Gescannte PDF per OCR in Markdown umwandeln
OCR nach Markdown liest eine gescannte oder bildbasierte PDF und liefert ihren Text als Markdown-Datei. Der PDF wird keine Textebene hinzugefügt, und die Originaldatei bleibt unverändert.
Dateien hierher ziehen oder klicken, um auszuwählen
Akzeptiert PDF · bis zu 500.0 MB pro Datei · bis zu 20 Dateien auf einmal
Sie können eine Datei auch mit Strg/Cmd+V oder über das Zwischenablage-Menü einfügen.
OCR nach Markdown liest Scan- oder reine Bild-PDFs und liefert Markdown (`text/markdown`, Dateiname `.md`). Es schreibt keine versteckte Textschicht zurück in die PDF und bereinigt, entzerrt oder schreibt Scans nicht um.
Der Server kombiniert vorhandenen nativen Text in der PDF mit optischer Erkennung auf Bildseiten. Force OCR (`ocrType=force-ocr`, Website-Standard) erkennt jede Seite neu. Normal (alles außer `force-ocr`) nutzt nativen Text, wo vorhanden, und OCR nur auf reinen Bildseiten. Auf sauberen digitalen PDFs lädt Auto die OCR-Laufzeit nicht.
Die Genauigkeit hängt von Scanqualität, Kontrast und Schräglage ab. Die aktuelle Engine hat keinen Sprachparameter. Alte Java-OCRmyPDF-Felder (`languages`, `deskew`, `clean`, `sidecar`), die Clients noch senden, werden ignoriert.
Das ist kein Vorlauf für PDF in Word oder PDF in RTF. Diese Werkzeuge brauchen weiterhin Text in der PDF. OCR hier ist parallele Extraktion: Sie erhalten Markdown, die Original-PDF bleibt unverändert.
Führen Sie kein OCR an Dateien durch, die Sie nicht digitalisieren oder weitergeben dürfen. Extrahierter Text unterliegt denselben Urheber- und Arbeitsplatzregeln.
Wer eine durchsuchbare PDF erwartet, bekommt sie hier nicht. Das durchsuchbare Ergebnis ist die Markdown-Datei. Öffnen Sie sie im Editor und prüfen Sie Namen und Zahlen, die stimmen müssen.
Handyfotos möglichst zuerst zuschneiden und ausrichten. Trapezförmige Aufnahmen verschwenden Erkennung am Hintergrund. OCR ist keine Übersetzung: es erkennt Zeichen und schreibt das Dokument nicht in eine andere Sprache um.
Aufträge laufen auf dem Server. Laden Sie rechtzeitig herunter. Wir bauen keine OCR-Bibliothek aus Ihren Dateien. Passwortgeschützte Dateien werden auf dieser Seite für Sie entsperrt, sobald Sie das Passwort eingeben; API-Aufrufer führen zuerst «Passwort entfernen» aus.
Funktionen
- Liefert Markdown, keine PDF mit OCR-Schicht
- Force OCR liest jede Seite neu; Normal/Auto nutzt nativen Text, wo vorhanden
- Original-PDF bleibt unverändert
- Anonyme API: /api/v1/misc/ocr-pdf
Wann Sie dieses Werkzeug nutzen
- Klauseltext aus Archivscans herausziehen
- Scans an Agenten oder Pipelines geben, die Markdown erwarten
- Schrift aus reinen Bild-PDFs ohne Textschicht zurückholen
Wie führe ich OCR für eine gescannte PDF durch?
- Laden Sie eine Scan- oder Handyfoto-PDF hoch.
- Wählen Sie Force OCR (Standard) oder Normal/Auto.
- Klicken Sie auf Verarbeiten und laden Sie die `.md`-Datei herunter.
- Prüfen Sie Namen und Zahlen in Markdown, bevor Sie sie verwenden.
Grenzen und Sonderfälle
- Genauigkeit schwankt mit der Bildqualität
- Viele Seiten brauchen länger
- Aktuelle Engine ohne Sprachparameter
- Keine lokale OCR-Bibliothek und kein Offline-SDK
- Upload-Limit auf dieser Website: 500 MB pro Datei, ab etwa 95 MB in Teilstücken gesendet. Eine einzelne direkte API-Anfrage ist auf 100 MB begrenzt.
Beispiele
- Ein 20-seitiger Graustufen-Vertragsscan wird zu einer Markdown-Datei mit Klauseltext
- Schräge Handyaufnahmen müssen oft neu fotografiert werden, bevor OCR nützlich ist
Datenschutz für dieses Werkzeug
Dateien werden über HTTPS hochgeladen, im Speicher oder in einem kurzlebigen temporären Verzeichnis auf unseren Servern verarbeitet und gelöscht, sobald Ihr Ergebnis bereitsteht. Wir behalten keine Kopien für späteres Durchsuchen, Training oder Werbeprofile. Einzelheiten zur Speicherdauer und zu AdSense-Cookies stehen in der Datenschutzerklärung.
Häufige Fragen
- Ändert OCR das Aussehen der Seiten?
- Es liefert keine PDF. Das Original bleibt; Sie erhalten zusätzlich einen Markdown-Download.
- Ist das eine einbettbare OCR-Bibliothek?
- Nein. Das ist ein HTTP-Auftrag unter /api/v1/misc/ocr-pdf. Siehe /developers. Es ist kein linkbares SDK.
- Kann ich danach nach Word konvertieren?
- Nicht als PDF-Pipeline. OCR liefert Markdown. PDF in Word braucht weiterhin eine PDF mit Textschicht.
- Braucht eine digitale PDF Force OCR?
- Meist nicht. Normal/Auto nutzt vorhandenen Text und überspringt die OCR-Laufzeit. Force nur, wenn die Textschicht beschädigt oder unglaubwürdig ist.
Zuletzt aktualisiert:
Per Code aufrufen
Jedes Werkzeug auf dieser Seite ist ein gewöhnlicher REST-Endpunkt. Für anonyme Nutzung brauchen Sie weder Konto noch API-Schlüssel. Für Browser, Entwickler und KI-Agenten gleichermaßen.
curl -X POST "https://pdf123.xyz/api/v1/misc/ocr-pdf" \
-F "[email protected]" \
-F "ocrType=force-ocr" \
-o output.pdfAuch als MCP-Werkzeug für Clients, die Model Context Protocol sprechen (JSON-RPC 2.0 über POST /mcp). Vollständige API-Referenz
Mit einem KI-Agenten nutzen
SkillMit diesem Skill können Claude Code, Codex, Cursor und andere KI-Agenten „OCR nach Markdown“ für Sie ausführen: /skills/pdf123-ocr.md
Dateien dienen nur diesem Auftrag und werden danach automatisch gelöscht.