Zum Hauptinhalt springen
PPDF123

PDF-Tabellen in Excel umwandeln

PDF in Excel findet ausgerichtete Tabellenzeilen im Text einer PDF und schreibt jede Tabelle auf ein eigenes Blatt einer .xlsx-Arbeitsmappe. Es braucht eine Textebene und liefert für Fließtext oder gescannte Seiten nichts.

Dateien hierher ziehen oder klicken, um auszuwählen

Akzeptiert PDF · bis zu 500.0 MB pro Datei · bis zu 20 Dateien auf einmal

Sie können eine Datei auch mit Strg/Cmd+V oder über das Zwischenablage-Menü einfügen.

PDF in Excel führt `pdftotext -layout` aus, sucht Zeilen mit zwei oder mehr aufeinanderfolgenden Leerzeichen und schreibt sie in eine `.xlsx`-Arbeitsmappe. Jede erkannte Tabelle wird ein Blatt `Page N` oder `Page N Table M`. Geeignet für digitale PDFs mit schon ausgerichteten Spalten im Extrakt.

Eine Tabelle braucht mindestens zwei aufeinanderfolgende tabellenartige Zeilen. Prosa, alleinstehende Kopfzeilen oder Scans ohne Textschicht ergeben `no_content`: keine Arbeitsmappe. Das leere Ergebnis ist Absicht, kein stiller Fehler.

Dieses Werkzeug ignoriert Anfrageparameter. Auf dieser Seite gibt es kein Seitenbereichsfeld. Spalten werden an zwei oder mehr aufeinanderfolgenden Leerzeichen geschnitten; einzelne Leerzeichen bleiben in der Zelle.

Das ist kein OCR. Reine Bildscans haben nichts, was `pdftotext` lesen könnte. OCR auf dieser Website liefert Markdown, das sich nicht erneut in PDF in Excel einspeisen lässt. Existieren die Wörter nur als Pixel, gibt es hier keine Tabelle.

PDF in CSV nutzt dieselbe Layotheuristik. Eine Tabelle wird eine CSV; mehrere Tabellen werden ein ZIP aus CSVs. Excel legt diese Tabellen als Blätter in einer Arbeitsmappe ab. Keines von beiden rekonstruiert aus der PDF verbundene Zellen, farbige Kopfzeilen oder ausgeblendete Blätter.

Öffnen Sie den Download in Excel oder LibreOffice Calc und prüfen Sie an einigen Zeilen die Spaltentrennung. Enge Tabellen ohne Doppel-Leerzeichen landen oft in einer einzigen Spalte. Passwortgeschützte Dateien werden auf dieser Seite für Sie entsperrt, sobald Sie das Passwort eingeben; API-Aufrufer führen zuerst „Passwort entfernen“ aus.

Die Zwei-Leerzeichen-Regel ist der ganze Erkennungsmechanismus, deshalb hängt die Qualität der Arbeitsmappe allein davon ab, wie die PDF gesetzt wurde. Tabellen aus Report-Generatoren, die jede Zelle auf feste Breite auffüllen, lassen sich sauber extrahieren. Tabellen mit nur einem Leerzeichen zwischen den Spalten oder mit Proportionalschrift, die Spalten fast aneinanderrückt, gelten gar nicht als Tabelle und ergeben unter Umständen keine Arbeitsmappe. Bevor Sie das Werkzeug verantwortlich machen, markieren Sie eine Zeile der PDF und prüfen, ob der Text überhaupt auswählbar ist.

Die Blattnamen folgen der Position, nicht dem Inhalt. Jeder erkannte Block wird `Page N` oder `Page N Table M`, in der Reihenfolge der gescannten Seiten. Ein Bericht mit einer Tabelle pro Seite ergibt ein Blatt pro Seite; eine Seite mit drei übereinanderliegenden Tabellen ergibt drei nummerierte Blätter. Es gibt keine Option, Blätter nach einer Kopfzelle zu benennen, und keine zusammengeführte Ein-Blatt-Ausgabe.

Werte werden als Text geschrieben, genau wie in der layouttreuen Extraktion der PDF. Zahlen werden nicht in numerische Zellen umgewandelt, führende Nullen bleiben erhalten, und Währungssymbole sowie Tausendertrennzeichen bleiben in der Zeichenkette. Für Kontonummern und Postleitzahlen ist das meist gewünscht, für eine Spalte mit Beträgen, die Sie summieren möchten, etwas lästig. Wandeln Sie die Typen in der Tabelle um, oder kopieren Sie die Spalte und nutzen Sie Text-in-Spalten bzw. die Wertumwandlung des Zielprogramms.

Zeilen werden nicht entdoppelt, wiederholte Kopfzeilen nicht entfernt. Bricht eine Tabelle über einen Seitenwechsel, wiederholt sich die Kopfzeile oft auf der nächsten Seite, und die Fortsetzung wird ein eigenes Blatt. Verbundene Zellen werden nicht rekonstruiert; eine Zelle, die in der PDF zwei Spalten überspannte, hat ihren Text nur in der linken Spalte, die rechte bleibt leer. Mehrzeilige Zellen werden eigene Zeilen statt eines umbrochenen Werts.

Uploads sind temporär. Wir führen keine Bibliothek Ihrer Arbeitsmappen.

Funktionen

  • `pdftotext -layout` plus Doppel-Leerzeichen-Spaltenheuristik
  • Ein Blatt pro erkannter Tabelle; leere Erkennung liefert keine Datei
  • Kein OCR; Markdown aus OCR kann hier nicht eingespeist werden
  • Texttypisierte Zellen; keine Typrüfung und keine Rekonstruktion verbundener Zellen
  • Anonyme API: /api/v1/convert/pdf/xlsx

Wann Sie dieses Werkzeug nutzen

  • Extrahierte Tabellen direkt in Excel oder LibreOffice Calc öffnen
  • Eine digitale Rechnungstabelle in eine Arbeitsmappe holen
  • Tabellen mehrerer Seiten als Blätter statt als eine CSV behalten
  • Einen Festbreiten-Finanzbericht zur weiteren Auswertung extrahieren

Wie wandle ich eine PDF-Tabelle in Excel um?

  1. Laden Sie eine PDF mit bereits auswählbarem Text in tabellenartigen Spalten hoch.
  2. Klicken Sie auf Verarbeiten. Es gibt keine Seitenbereichs- oder OCR-Optionen.
  3. Wurden Tabellen gefunden, laden Sie die `.xlsx` herunter. Wenn nicht, erhalten Sie einen leeren Erfolg; versuchen Sie eine Quelle mit Textschicht.
  4. Öffnen Sie die Arbeitsmappe und prüfen Sie die Trennungen. Reine Prosa-PDFs erzeugen keine Blätter.

Grenzen und Sonderfälle

  • Braucht auswählbaren Text und einen Doppel-Leerzeichen-Abstand zwischen Spalten
  • Kein OCR und keine Seitenbereichssteuerung
  • Verbundene Zellen und Formatierung werden nicht rekonstruiert
  • Alle Werte sind Text; keine Zahlen- oder Datumstypisierung
  • Tabellen über Seitengrenzen werden separate Blätter
  • Upload-Limit auf dieser Website: 500 MB pro Datei, ab etwa 95 MB in Teilstücken gesendet. Eine einzelne direkte API-Anfrage ist auf 100 MB begrenzt.

Beispiele

  • Eine Text-PDF mit dreispaltiger Preisliste wird oft ein Blatt mit diesen Spalten
  • Ein gescannter Kontoauszug ohne Textschicht liefert keine Arbeitsmappe
  • Ein zehnseitiger Bericht mit einer Tabelle pro Seite ergibt zehn Blätter von Page 1 bis Page 10

Datenschutz für dieses Werkzeug

Dateien werden über HTTPS hochgeladen, im Speicher oder in einem kurzlebigen temporären Verzeichnis auf unseren Servern verarbeitet und gelöscht, sobald Ihr Ergebnis bereitsteht. Wir behalten keine Kopien für späteres Durchsuchen, Training oder Werbeprofile. Einzelheiten zur Speicherdauer und zu AdSense-Cookies stehen in der Datenschutzerklärung.

Häufige Fragen

Warum habe ich keine Tabelle bekommen?
Es wurde kein Block aus zwei oder mehr aufeinanderfolgenden tabellenartigen Zeilen gefunden. Scans, Prosa und Tabellen ohne Doppel-Leerzeichen scheitern an dieser Heuristik.
Kann ich zuerst OCR machen und dann nach Excel konvertieren?
Nein. OCR liefert Markdown. Dieses Werkzeug liest eine PDF nur über pdftotext.
Worin unterscheidet es sich von PDF in CSV?
Dieselbe Erkennung. Excel schreibt jede Tabelle auf ein eigenes Blatt einer Arbeitsmappe. CSV schreibt eine Datei pro Tabelle (eine einzelne CSV, oder ein ZIP bei mehreren).
Wird jede Seite gelesen?
Ja. pdftotext trennt Seiten am Form Feed. Jede Seite wird auf Tabellenblöcke geprüft. Es gibt keinen Seitenbereichsparameter.
Warum werden meine Zahlen als Text gespeichert?
Werte werden exakt so geschrieben, wie sie extrahiert wurden, damit führende Nullen und Formatierungen erhalten bleiben. Wandeln Sie die Spalte in der Tabelle in Zahlen um, wenn Sie damit rechnen möchten.
Werden verbundene Zellen rekonstruiert?
Nein. Der Text einer verbundenen Zelle landet in der linken Spalte, die übrigen Spalten bleiben leer. Mehrzeilige Zellen werden eigene Zeilen statt eines umbrochenen Werts.
Warum habe ich mehrere Blätter für eine Tabelle?
Eine Tabelle, die sich auf einer neuen Seite fortsetzt, wird dort erneut erkannt und wird ein weiteres Blatt. Kopfzeilen wiederholen sich oft; das Werkzeug führt die Fragmente nicht zusammen.

Zuletzt aktualisiert:

Per Code aufrufen

Jedes Werkzeug auf dieser Seite ist ein gewöhnlicher REST-Endpunkt. Für anonyme Nutzung brauchen Sie weder Konto noch API-Schlüssel. Für Browser, Entwickler und KI-Agenten gleichermaßen.

curl -X POST "https://pdf123.xyz/api/v1/convert/pdf/xlsx" \
  -F "[email protected]" \
  -o output.pdf

Auch als MCP-Werkzeug für Clients, die Model Context Protocol sprechen (JSON-RPC 2.0 über POST /mcp). Vollständige API-Referenz

Mit einem KI-Agenten nutzen

Skill

Mit diesem Skill können Claude Code, Codex, Cursor und andere KI-Agenten „PDF in Excel“ für Sie ausführen: /skills/pdf123-pdf-to-xlsx.md

Alle Agent-Skills

Dateien dienen nur diesem Auftrag und werden danach automatisch gelöscht.