Aller au contenu principal
PPDF123

Extraire des tableaux d’un PDF en CSV

PDF vers CSV repère les lignes de tableau alignées dans le texte d’un PDF et écrit chaque tableau détecté en fichier CSV ; plusieurs tableaux reviennent dans un ZIP. Il exige une couche de texte et ne renvoie rien pour la prose ou les scans.

Déposez des fichiers ici, ou cliquez pour les choisir

Formats acceptés : PDF · jusqu'à 500.0 MB par fichier · jusqu'à 20 fichiers à la fois

Vous pouvez aussi coller un fichier avec Ctrl/Cmd+V ou depuis le menu du presse-papiers.

PDF vers CSV exécute `pdftotext -layout`, cherche les lignes contenant au moins deux espaces consécutifs, et écrit ces lignes en CSV. Chaque tableau détecté devient un fichier nommé `{base}_pN_tM.csv`. Convient aux PDF électroniques dont les colonnes sont déjà alignées dans le texte extrait.

Un tableau exige au moins deux lignes consécutives qui ressemblent à un tableau. Prose, en-tête isolé, ou scan sans couche de texte : résultat `no_content` — HTTP 204, aucun fichier. Un résultat vide est volontaire, pas un échec silencieux.

Cet outil ignore les paramètres de requête. Le champ de plage de pages de cette page n'est pas lu ; chaque page est parcourue. Un tableau devient un `text/csv` ; plusieurs tableaux sont packés dans un ZIP nommé `{base}_extracted.zip`. Les colonnes se coupent sur deux espaces ou plus ; un espace seul dans une cellule reste dans la cellule. Les champs sont quotés selon RFC 4180.

Ce n'est pas de l'OCR. Un scan purement image n'a rien que `pdftotext` puisse lire. L'OCR de ce site renvoie du Markdown, qui ne peut pas être renvoyé dans PDF vers CSV. Si les mots n'existent que dans les pixels, aucun fichier tableau ici.

PDF vers Excel utilise la même heuristique de mise en page. Excel place ces tableaux en feuilles du même classeur. CSV : un fichier par tableau. Ni l'un ni l'autre ne restaure cellules fusionnées, en-têtes colorés ou feuilles masquées depuis le PDF.

Ouvrez le téléchargement dans Excel ou LibreOffice Calc et vérifiez quelques lignes de découpage. Les tableaux serrés sans double espace tombent souvent dans une seule colonne. Les fichiers protégés par mot de passe sont déverrouillés pour vous sur cette page une fois le mot de passe saisi ; via l'API, passez d'abord par Retirer le mot de passe.

L'envoi est temporaire. Nous ne conservons pas votre bibliothèque CSV.

Fonctions

  • `pdftotext -layout` plus heuristique de colonnes à double espace
  • Un CSV par tableau ; plusieurs → ZIP ; détection vide → HTTP 204
  • Pas d'OCR ; le Markdown de l'OCR ne peut pas être envoyé ici
  • API anonyme : /api/v1/convert/pdf/csv

Quand utiliser cet outil

  • Tirer un tableau de facture électronique dans Excel ou LibreOffice Calc
  • Obtenir un CSV par tableau sur plusieurs pages, plutôt qu'une seule feuille
  • Fournir une entrée à un script qui n'accepte que du CSV

Comment extraire un tableau d’un PDF vers CSV ?

  1. Téléversez un PDF avec texte sélectionnable et colonnes de type tableau.
  2. Cliquez sur Traiter. Le champ de plage de pages est là, mais le convertisseur ne le lit pas. Pas d'option OCR.
  3. Si un tableau est trouvé, téléchargez le `.csv`. Si plusieurs, le ZIP. Sinon, succès vide : changez de source avec couche de texte.
  4. Ouvrez dans Excel ou LibreOffice Calc et vérifiez le découpage. Un PDF purement prose ne produit pas de fichier.

Limites et cas limites

  • Exige du texte sélectionnable et des écarts de colonnes à double espace
  • Pas d'OCR ; le contrôle de plage de pages n'a aucun effet
  • Ne restaure ni cellules fusionnées ni styles
  • Limite d’envoi sur ce site : 500 Mo par fichier, envoyé par morceaux au-delà d’environ 95 Mo. Le corps d’une requête API directe est limité à 100 Mo.

Exemples

  • Un PDF texte avec une grille de prix à trois colonnes devient souvent un CSV de ces colonnes
  • Un relevé bancaire scanné sans couche de texte donne HTTP 204

Confidentialité de cet outil

Les fichiers sont envoyés en HTTPS, traités en mémoire ou dans un répertoire temporaire de courte durée sur nos serveurs, puis supprimés dès que le résultat est prêt. Nous ne conservons pas de copies pour une consultation ultérieure, un entraînement de modèles ou des profils publicitaires. Consultez la politique de confidentialité pour la durée de conservation et les cookies AdSense.

Questions fréquentes

Pourquoi pas de CSV ?
Aucune suite d'au moins deux lignes de type tableau n'a été trouvée. Scans, prose, et tableaux sans double espace font échouer l'heuristique. L'interface répond 204 `no_content`.
Puis-je faire de l'OCR puis convertir en CSV ?
Non. L'OCR renvoie du Markdown. Cet outil ne lit le PDF que via pdftotext.
Quelle différence avec PDF vers Excel ?
La détection est la même. CSV : un fichier par tableau (un seul → CSV, plusieurs → ZIP). Excel écrit chaque tableau dans une feuille du même classeur.
Chaque page est-elle lue ?
Oui. pdftotext pagine par sauts de page ; chaque page est scannée pour des blocs de tableau. Le champ de plage de pages de cette page n'est pas lu.

Dernière mise à jour:

Appeler depuis le code

Chaque outil du site est un endpoint REST. L'usage anonyme n'exige ni compte ni clé API. Pour le navigateur, les développeurs et les agents IA.

curl -X POST "https://pdf123.xyz/api/v1/convert/pdf/csv" \
  -F "[email protected]" \
  -F "pageNumbers=all" \
  -o output.pdf

Aussi disponible comme outil MCP pour les clients agents qui parlent le Model Context Protocol (JSON-RPC 2.0 via POST /mcp). Référence API complète

L'utiliser depuis un agent IA

Skill

Avec ce skill, Claude Code, Codex, Cursor et d'autres agents IA peuvent exécuter « PDF vers CSV » pour vous : /skills/pdf123-pdf-to-csv.md

Tous les skills pour agents

Les fichiers ne servent qu'à ce traitement, puis sont supprimés automatiquement.