Tabellen aus einer PDF nach CSV extrahieren
PDF in CSV findet ausgerichtete Tabellenzeilen im Text einer PDF und schreibt jede erkannte Tabelle als CSV-Datei; mehrere Tabellen kommen als ZIP. Es braucht eine Textebene und liefert für Fließtext oder Scans nichts.
Dateien hierher ziehen oder klicken, um auszuwählen
Akzeptiert PDF · bis zu 500.0 MB pro Datei · bis zu 20 Dateien auf einmal
Sie können eine Datei auch mit Strg/Cmd+V oder über das Zwischenablage-Menü einfügen.
PDF in CSV führt `pdftotext -layout` aus, sucht Zeilen mit zwei oder mehr aufeinanderfolgenden Leerzeichen und schreibt diese Zeilen als CSV. Jede erkannte Tabelle wird `{base}_pN_tM.csv`. Geeignet für digitale PDFs, deren Spalten im extrahierten Text schon ausgerichtet sind.
Eine Tabelle braucht mindestens zwei aufeinanderfolgende tabellenartige Zeilen. Prosa, eine alleinstehende Kopfzeile oder Scans ohne Textschicht ergeben `no_content`: HTTP 204, keine Datei. Das leere Ergebnis ist Absicht, kein stilles Scheitern.
Dieses Werkzeug ignoriert Anfrageparameter. Das Seitenbereichsfeld auf dieser Seite wird nicht gelesen; jede Seite wird gescannt. Eine Tabelle wird zu einer `text/csv`; mehrere Tabellen zu einem ZIP namens `{base}_extracted.zip`. Spalten werden an zwei oder mehr Leerzeichen geschnitten; einzelne Leerzeichen bleiben in der Zelle. Felder werden nach RFC 4180 gequotet.
Das ist kein OCR. Reine Bildscans haben nichts für `pdftotext`. OCR nach Markdown liefert Markdown, das Sie nicht erneut an PDF in CSV senden können. Existieren Wörter nur als Pixel, gibt es hier keine Tabellendatei.
PDF in Excel nutzt dieselbe Layout-Heuristik. Excel legt die Tabellen als Arbeitsblätter in einer Arbeitsmappe ab. CSV ist eine Datei pro Tabelle. Keines von beiden stellt verbundene Zellen, farbige Köpfe oder ausgeblendete Blätter aus der PDF wieder her.
Öffnen Sie den Download in Excel oder LibreOffice Calc und prüfen Sie die Spaltentrennung. Enge Tabellen ohne Doppel-Leerzeichen landen oft in einer Spalte. Passwortgeschützte Dateien werden auf dieser Seite für Sie entsperrt, sobald Sie das Passwort eingeben; API-Aufrufer führen zuerst «Passwort entfernen» aus.
Uploads sind temporär. Wir führen keine CSV-Bibliothek.
Funktionen
- `pdftotext -layout` plus Doppel-Leerzeichen-Spaltenheuristik
- Eine CSV pro Tabelle; mehrere als ZIP; leer erkannt → HTTP 204
- Kein OCR; OCR-Markdown gehört nicht hierher
- Anonyme API: /api/v1/convert/pdf/csv
Wann Sie dieses Werkzeug nutzen
- Digitale Rechnungstabellen in Excel oder LibreOffice Calc ziehen
- Tabellen auf mehreren Seiten je als CSV statt eines Blatts
- Eingabe für Skripte, die nur CSV akzeptieren
Wie extrahiere ich eine Tabelle aus einer PDF nach CSV?
- Laden Sie eine PDF mit auswählbarem Text und tabellenartiger Spaltenausrichtung hoch.
- Klicken Sie auf Verarbeiten. Das Seitenbereichsfeld existiert, aber der Konverter liest es nicht. Keine OCR-Option.
- Eine Tabelle → `.csv`. Mehrere → ZIP. Keine → leerer Erfolg; wechseln Sie zu einer Quelle mit Textschicht.
- Öffnen Sie in Excel oder LibreOffice Calc und prüfen Sie die Trennung. Reine Prosa-PDF erzeugt keine Datei.
Grenzen und Sonderfälle
- Braucht auswählbaren Text und Doppel-Leerzeichen zwischen Spalten
- Kein OCR; Seitenbereichssteuerung wirkungslos
- Stellt verbundene Zellen und Stil nicht wieder her
- Upload-Limit auf dieser Website: 500 MB pro Datei, ab etwa 95 MB in Teilstücken gesendet. Eine einzelne direkte API-Anfrage ist auf 100 MB begrenzt.
Beispiele
- Text-PDF mit dreispaltiger Preisliste wird oft zu einer CSV mit diesen Spalten
- Scan-Kontoauszug ohne Textschicht ergibt HTTP 204
Datenschutz für dieses Werkzeug
Dateien werden über HTTPS hochgeladen, im Speicher oder in einem kurzlebigen temporären Verzeichnis auf unseren Servern verarbeitet und gelöscht, sobald Ihr Ergebnis bereitsteht. Wir behalten keine Kopien für späteres Durchsuchen, Training oder Werbeprofile. Einzelheiten zur Speicherdauer und zu AdSense-Cookies stehen in der Datenschutzerklärung.
Häufige Fragen
- Warum keine CSV?
- Es fehlten zwei oder mehr aufeinanderfolgende Tabellenzeilen. Scans, Prosa und Tabellen ohne Doppel-Leerzeichen lassen die Heuristik scheitern. Die API antwortet 204 `no_content`.
- Zuerst OCR, dann CSV?
- Nein. OCR liefert Markdown. Dieses Werkzeug liest PDF nur über pdftotext.
- Unterschied zu PDF in Excel?
- Dieselbe Erkennung. CSV ist eine Datei pro Tabelle (eine → CSV, mehrere → ZIP). Excel schreibt jede Tabelle als eigenes Blatt derselben Arbeitsmappe.
- Wird jede Seite gelesen?
- Ja. pdftotext paginiert an Form-Feeds; jede Seite wird auf Tabellenblöcke gescannt. Das Seitenbereichsfeld wird nicht gelesen.
Zuletzt aktualisiert:
Per Code aufrufen
Jedes Werkzeug auf dieser Seite ist ein gewöhnlicher REST-Endpunkt. Für anonyme Nutzung brauchen Sie weder Konto noch API-Schlüssel. Für Browser, Entwickler und KI-Agenten gleichermaßen.
curl -X POST "https://pdf123.xyz/api/v1/convert/pdf/csv" \
-F "[email protected]" \
-F "pageNumbers=all" \
-o output.pdfAuch als MCP-Werkzeug für Clients, die Model Context Protocol sprechen (JSON-RPC 2.0 über POST /mcp). Vollständige API-Referenz
Mit einem KI-Agenten nutzen
SkillMit diesem Skill können Claude Code, Codex, Cursor und andere KI-Agenten „PDF in CSV“ für Sie ausführen: /skills/pdf123-pdf-to-csv.md
Dateien dienen nur diesem Auftrag und werden danach automatisch gelöscht.