Convertir des tableaux PDF en Excel
PDF vers Excel repère les lignes de tableau alignées dans le texte d’un PDF et écrit chaque tableau dans sa propre feuille d’un classeur .xlsx. Il exige une couche de texte et ne renvoie rien pour la prose ou les pages scannées.
Déposez des fichiers ici, ou cliquez pour les choisir
Formats acceptés : PDF · jusqu'à 500.0 MB par fichier · jusqu'à 20 fichiers à la fois
Vous pouvez aussi coller un fichier avec Ctrl/Cmd+V ou depuis le menu du presse-papiers.
PDF vers Excel exécute `pdftotext -layout`, cherche les lignes contenant au moins deux espaces consécutifs, et écrit ces lignes dans un classeur `.xlsx`. Chaque tableau détecté devient une feuille nommée `Page N` ou `Page N Table M`. Convient aux PDF électroniques dont les colonnes sont déjà alignées dans le texte extrait.
Un tableau exige au moins deux lignes consécutives qui ressemblent à un tableau. Prose, en-tête isolé, ou scan sans couche de texte : résultat `no_content` — aucun classeur. Un résultat vide est volontaire, pas un échec silencieux.
Cet outil ignore les paramètres de requête. Cette page n'a pas de champ de plage de pages. Les colonnes se coupent sur deux espaces ou plus ; un espace seul dans une cellule reste dans la cellule.
Ce n'est pas de l'OCR. Un scan purement image n'a rien que `pdftotext` puisse lire. L'OCR de ce site renvoie du Markdown, qui ne peut pas être renvoyé dans PDF vers Excel. Si les mots n'existent que dans les pixels, aucun tableur ici.
PDF vers CSV utilise la même heuristique de mise en page. Un tableau devient un CSV ; plusieurs deviennent un ZIP de CSV. Excel place ces tableaux en feuilles du même classeur. Ni l'un ni l'autre ne restaure cellules fusionnées, en-têtes colorés ou feuilles masquées depuis le PDF.
Ouvrez le téléchargement dans Excel ou LibreOffice Calc et vérifiez quelques lignes de découpage. Les tableaux serrés sans double espace tombent souvent dans une seule colonne. Les fichiers protégés par mot de passe sont déverrouillés pour vous sur cette page une fois le mot de passe saisi ; via l'API, passez d'abord par Retirer le mot de passe.
La règle des deux espaces constitue tout le mécanisme de détection : la qualité du classeur dépend donc entièrement de la façon dont le PDF a été composé. Les tableaux produits par des générateurs de rapports qui remplissent chaque cellule à largeur fixe s'extraient proprement. Les tableaux avec un seul espace entre les colonnes, ou avec des polices proportionnelles qui rapprochent presque les colonnes, ne sont pas reconnus comme des tableaux et peuvent ne produire aucun classeur. Avant d'accuser l'outil, sélectionnez une ligne du PDF et vérifiez que le texte est bien sélectionnable.
Le nom des feuilles suit la position, pas le contenu. Chaque bloc détecté devient `Page N` ou `Page N Table M`, dans l'ordre de balayage des pages. Un rapport avec un tableau par page produit une feuille par page ; une page avec trois tableaux empilés produit trois feuilles numérotées. Aucune option ne permet de nommer les feuilles d'après une cellule d'en-tête, et il n'existe pas de sortie combinée en une seule feuille.
Les valeurs sont écrites en texte, exactement telles qu'elles apparaissaient dans l'extraction qui préserve la mise en page. Les nombres ne sont pas convertis en cellules numériques : les zéros de tête sont conservés et les symboles monétaires ainsi que les séparateurs de milliers restent dans la chaîne. C'est généralement ce que vous voulez pour des numéros de compte et des codes postaux, et un peu pénible pour une colonne de montants que vous comptez additionner. Convertissez les types dans le tableur, ou copiez la colonne et utilisez le fractionnement en colonnes ou la conversion de valeurs du logiciel de destination.
Les lignes ne sont pas dédoublonnées et les en-têtes répétés ne sont pas supprimés. Lorsqu'un tableau se coupe sur un saut de page, la ligne d'en-tête se répète souvent sur la page suivante et la suite devient sa propre feuille. Les cellules fusionnées ne sont pas reconstruites ; une cellule qui couvrait deux colonnes dans le PDF a simplement son texte dans la colonne la plus à gauche, la colonne de droite restant vide. Les cellules multilignes deviennent des lignes distinctes plutôt qu'une valeur renvoyée à la ligne.
L'envoi est temporaire. Nous ne conservons pas votre bibliothèque de classeurs.
Fonctions
- `pdftotext -layout` plus heuristique de colonnes à double espace
- Une feuille par tableau détecté ; détection vide → aucun fichier
- Pas d'OCR ; le Markdown de l'OCR ne peut pas être envoyé ici
- Cellules de type texte ; aucune inférence de type ni reconstruction des cellules fusionnées
- API anonyme : /api/v1/convert/pdf/xlsx
Quand utiliser cet outil
- Ouvrir directement les tableaux extraits dans Excel ou LibreOffice Calc
- Tirer un tableau de facture électronique dans un classeur
- Obtenir une feuille par tableau sur plusieurs pages, plutôt qu'un CSV
- Extraire un état financier à largeur fixe pour l'analyser plus finement
Comment convertir un tableau PDF en Excel ?
- Téléversez un PDF qui a déjà du texte sélectionnable en colonnes de type tableau.
- Cliquez sur Traiter. Cet outil n'a ni plage de pages ni option OCR.
- Si des tableaux sont trouvés, téléchargez le `.xlsx`. Sinon, vous obtenez un succès vide ; essayez une source avec couche de texte.
- Ouvrez le classeur et vérifiez le découpage. Un PDF purement prose ne produit pas de feuille.
Limites et cas limites
- Exige du texte sélectionnable et un écart de colonnes à double espace
- Pas d'OCR, pas de contrôle de plage de pages
- Les cellules fusionnées et les styles ne sont pas reconstruits
- Toutes les valeurs sont du texte ; aucun typage numérique ni de date
- Les tableaux qui s'étendent sur plusieurs pages deviennent des feuilles distinctes
- Limite d’envoi sur ce site : 500 Mo par fichier, envoyé par morceaux au-delà d’environ 95 Mo. Le corps d’une requête API directe est limité à 100 Mo.
Exemples
- Un PDF texte avec une grille de prix à trois colonnes devient souvent une feuille de ces colonnes
- Un relevé bancaire scanné sans couche de texte ne renvoie pas de classeur
- Un rapport de dix pages avec un tableau par page donne dix feuilles nommées Page 1 à Page 10
Confidentialité de cet outil
Les fichiers sont envoyés en HTTPS, traités en mémoire ou dans un répertoire temporaire de courte durée sur nos serveurs, puis supprimés dès que le résultat est prêt. Nous ne conservons pas de copies pour une consultation ultérieure, un entraînement de modèles ou des profils publicitaires. Consultez la politique de confidentialité pour la durée de conservation et les cookies AdSense.
Questions fréquentes
- Pourquoi n'ai-je pas obtenu de tableur ?
- Aucun bloc d'au moins deux lignes de type tableau consécutives n'a été trouvé. Scans, prose et tableaux sans double espace font échouer l'heuristique.
- Puis-je faire de l'OCR puis convertir en Excel ?
- Non. L'OCR renvoie du Markdown. Cet outil ne lit le PDF que via pdftotext.
- Quelle différence avec PDF vers CSV ?
- La détection est la même. Excel écrit chaque tableau dans une feuille du même classeur. CSV : un fichier par tableau (un seul → CSV, plusieurs → ZIP).
- Chaque page est-elle lue ?
- Oui. pdftotext pagine par sauts de page. Chaque page est scannée pour des blocs de tableau. Pas de paramètre de plage de pages.
- Pourquoi mes nombres sont-ils stockés en texte ?
- Les valeurs sont écrites exactement comme extraites, donc les zéros de tête et le formatage sont conservés. Convertissez la colonne en numérique dans le tableur si vous voulez calculer avec.
- Les cellules fusionnées sont-elles reconstruites ?
- Non. Le texte d'une cellule fusionnée atterrit dans la colonne la plus à gauche et les autres colonnes restent vides. Les cellules multilignes deviennent des lignes distinctes plutôt qu'une valeur renvoyée à la ligne.
- Pourquoi ai-je plusieurs feuilles pour un même tableau ?
- Un tableau qui se poursuit sur une nouvelle page y est détecté de nouveau et devient une autre feuille. Les lignes d'en-tête se répètent souvent ; l'outil ne fusionne pas les fragments.
Dernière mise à jour:
Appeler depuis le code
Chaque outil du site est un endpoint REST. L'usage anonyme n'exige ni compte ni clé API. Pour le navigateur, les développeurs et les agents IA.
curl -X POST "https://pdf123.xyz/api/v1/convert/pdf/xlsx" \
-F "[email protected]" \
-o output.pdfAussi disponible comme outil MCP pour les clients agents qui parlent le Model Context Protocol (JSON-RPC 2.0 via POST /mcp). Référence API complète
L'utiliser depuis un agent IA
SkillAvec ce skill, Claude Code, Codex, Cursor et d'autres agents IA peuvent exécuter « PDF vers Excel » pour vous : /skills/pdf123-pdf-to-xlsx.md
Les fichiers ne servent qu'à ce traitement, puis sont supprimés automatiquement.