Product2026-09-283 Min. Lesezeit

Vom Scan-Paket zum Text: Erst OCR, dann die PDF komprimieren, die du behÀltst

Ein Scan-Paket braucht zwei Schritte: OCR auf PDF123 liefert Markdown, Komprimieren verkleinert die Original-PDF per Rekompression. Reihenfolge und Ausgabe zÀhlen.

PDF123 · Updated 2026-09-28

Ein „Scan-Paket“ ist meist ein Stapel Seitenbilder, der zu einer PDF geheftet wurde: viel Platz auf der Festplatte, leer fĂŒr Suche und Kopieren. Zwei Werkzeuge, die viele hintereinander ausfĂŒhren, erzeugen auf dieser Website keine einzige magische durchsuchbare PDF. OCR liefert Markdown. Komprimieren schreibt die PDF um, die du weiterhin behĂ€ltst.

Diese Trennung ist der ganze Ablauf.

Was OCR hier tatsÀchlich liefert

POST /api/v1/misc/ocr-pdf fĂŒhrt die Erkennung aus und lĂ€dt eine Datei .md herunter (text/markdown): nativen Text aus der PDF, verschmolzen mit OCR-Ergebnissen aus Bildseiten. Es schreibt keine verborgene Textebene in die PDF zurĂŒck. Wer Markieren und Suchen in derselben Datei erwartet hat, denkt an eine andere Produktform (die klassische Ausgabe im Stil von OCRmyPDF). Dieser Endpunkt ist fĂŒr Text gedacht, den ein Agent oder eine Pipeline lesen kann.

Auto und Force OCR:

  • Alles außer ocrType=force-ocr (einschließlich der Bezeichnung „Normal“ im Portal) entspricht Auto: vorhandenen Text nutzen, wo er vorhanden ist, und OCR nur auf reinen Bildseiten ausfĂŒhren.
  • force-ocr liest jede Seite erneut, auch Seiten mit vorhandener Textebene.

Im Formular des Portals gibt es keine Auswahl der Sprache. Felder, die aus dem frĂŒheren tessdata-Stil ĂŒbrig geblieben sind (languages, Deskew, Bereinigungsflags und Ähnliches), ignoriert der Rust-Pfad ocr_pdf. Auto und Force und die Frage, warum die Erkennung bei schlechten Scans scheitert, behandelt Wie OCR ein gescanntes PDF liest.

OCR verkleinert die PDF nicht. Der Markdown-Download ist ein zweites Ergebnis neben dem ursprĂŒnglichen Scan-Paket.

Wo das Komprimieren passt

Komprimieren (POST /api/v1/misc/compress-pdf) fĂŒhrt die Kompression der Streams mit qpdf aus: --compress-streams=y, erneute Rekompression mit Flate und erzeugte Objektstreams. Es erfindet keine Textebene, subsettet keine Schriften und verspricht kein Downsampling von Fotos. Bei einer Datei mit vielen Scans kann der Speicherbedarf trotzdem sinken, weil die Streams dichter gepackt werden; bei einer bereits dichten Datei kann der Gewinn klein sein. Hintergrund zu den Hebeln Stream und Bild: Was beim Komprimieren einer PDF wirklich passiert.

Nutze das Komprimieren auf der PDF, die du archivierst oder per E-Mail verschickst. Nutze die Ausgabe von OCR als Markdown, wenn du die Wörter brauchst. Zuerst zu komprimieren macht OCR nicht genauer; zuerst OCR auszufĂŒhren macht die PDF nicht kleiner.

Eine praktische Reihenfolge

  1. Öffnet der Betrachter das Paket nicht, zuerst Reparieren oder Get Info.
  2. Das Scan-Paket per OCR zu Markdown verarbeiten und einige Seiten Text stichprobenartig prĂŒfen.
  3. Separat eine Kopie der PDF komprimieren, wenn die GrĂ¶ĂŸe das verbleibende Problem ist.
  4. Das unverÀnderte Original behalten, wenn die Richtlinie es verlangt.

Eine verschlĂŒsselte Datei braucht vor jedem Schritt ein berechtigtes Entsperren. Geheimnisse brauchen Bereinigen oder Automatisches SchwĂ€rzen und kein OCR. Ein Export von Tabellen, der nach einem Scan 204 liefert, bedeutet, dass keine Textspalten gefunden wurden; fĂŒhre zuerst OCR zu Markdown aus und entscheide dann, ob ein Werkzeug fĂŒr Tabellen ĂŒberhaupt passt (Leerer Export von Tabellen (204)).

Ausgaben, die du im Blick behalten solltest

Nach einem typischen Lauf hĂ€ltst du womöglich drei Ergebnisse: das ursprĂŒngliche Scan-Paket, einen Download von OCR als .md und optional eine komprimierte Kopie der PDF. Beschrifte sie. Nur das Markdown zu verschicken verliert die Seitenbilder; nur die komprimierte PDF zu verschicken hat weiterhin keine Ebene zum Markieren und Suchen aus diesem OCR-Weg. AblĂ€ufe, die sowohl die Wörter als auch eine kleinere PDF brauchen, mĂŒssen beide Ausgaben speichern oder eine Seite spĂ€ter erneut ausfĂŒhren.

Force OCR auf einem digital erzeugten Paket mit beschĂ€digter Textebene kann trotzdem nĂŒtzlich sein; Auto kann bei einem sauberen digital erzeugten Paket die OCR-Laufzeit ganz ĂŒberspringen. Keiner der Modi schreibt Text in die PDF zurĂŒck.

Was dieser Ablauf nicht ist

Scan-Pakete scheitern, wenn Teams annehmen, ein einziger Knopf extrahiere Text und verkleinere Pixel, wie es ein Ablauf mit OCRmyPDF auf dem Desktop tut. Hier gehen die Wörter als Markdown hinaus; die PDF bleibt eine PDF, bis du sie absichtlich komprimierst. Es gibt auf dieser Website keinen Schritt, der aus einem einzigen Aufruf „dieselbe PDF, jetzt durchsuchbar und kleiner“ zurĂŒckgibt.

FĂŒr die Automatisierung derselben Operationen ĂŒber HTTP siehe Entwickler.

Open tool
Process in the browser — no watermark, files removed after the job.
Open tool