Product2026-09-28約1分で読めます

スキャン束をテキストへ:OCR してから、手元に残す PDF を圧縮する

スキャン束には二つの手順がある。PDF123 の OCR は Markdown テキストを返し、圧縮はストリーム再圧縮で元の PDF を縮める。順序も出力も別物だ。

PDF123 · Updated 2026-09-28

「スキャン束」は通常、ページ画像を一つの PDF に綴じた山だ。ディスク上は重く、検索やコピーには空っぽに等しい。このサイトでは、人が繋いで使う二つのツールが、魔法の検索可能 PDF を一つ生むわけではない。OCR は Markdown を返す。圧縮 は手元に残す PDF を書き換える。

この分離こそがワークフロー全体だ。

ここで OCR が実際に与えるもの

POST /api/v1/misc/ocr-pdf は認識を走らせ、.md ファイル(text/markdown)をダウンロードさせる。ネイティブな PDF テキストと、画像ページからの OCR を融合したものだ。隠しテキスト層を PDF に書き戻さない。同じファイルの中で選択と検索を期待していたなら、それは別の製品の形(古典的な OCRmyPDF 式の出力)だ。このエンドポイントは、エージェントやパイプラインが読めるテキストのためのものだ。

Auto と Force OCR:

  • ocrType=force-ocr 以外(ポータルのラベル「Normal」を含む)は Auto に対応する。既存のテキストがあるところではそれを使い、画像のみのページに OCR をかける。
  • force-ocr は、すでにテキスト層があるページも含めて全ページを読み直す。

ポータルのフォームに言語の選択肢は無い。古い経路の tessdata 風のフィールド(languages、deskew、clean フラグなど)は Rust の ocr_pdf の経路では無視される。Auto と Force の違い、そして悪いスキャンで認識が失敗する理由は OCR がスキャン PDF をどう読むか にある。

OCR は PDF を縮めない。Markdown のダウンロードは、元のスキャン束の隣に生まれる第二の成果物だ。

圧縮がどこに嵌まるか

圧縮(POST /api/v1/misc/compress-pdf)は qpdf のストリーム圧縮を走らせる。--compress-streams=y、flate の再圧縮、オブジェクトストリームの生成だ。テキスト層を発明せず、フォントをサブセット化せず、写真のダウンサンプリングも約束しない。スキャン中心のファイルではストリームをより強く詰めることで保存量を縮められることもあるが、すでに締まったファイルでは利得が小さいこともある。ストリームと画像というレバーの背景は PDF を圧縮すると実際に何が起きるのか にある。

圧縮はアーカイブやメールに使う PDF に対して使う。語が必要なときは OCR の Markdown 出力を使う。先に圧縮しても OCR の精度は上がらないし、先に OCR しても PDF は小さくならない。

実務的な順序

  1. ビューアが束を開けないなら、先に 修復 か 情報取得。
  2. スキャン束を Markdown へ OCR し、数ページのテキストを目視確認する。
  3. サイズが残った問題なら、PDF の複製を別途圧縮する。
  4. 方針が求めるなら、手を付けていない原本を保持する。

暗号化されたファイルは、どちらの工程の前にも正当な パスワードの解除 が必要だ。秘密には Sanitize/Auto Redact であり、OCR ではない。スキャンのあとの表エクスポートが 204 を返すなら、テキストの列が見つからなかったという意味だ。先に OCR の Markdown を作り、スプレッドシートのツールがそもそも当てはまるかを判断する(空の表エクスポート(204))。

追跡すべき出力

典型的な実行のあと、手元には三つの成果物がありうる。元のスキャン束、.md の OCR ダウンロード、そして(任意で)圧縮した PDF の複製だ。それぞれにラベルを付ける。Markdown だけをメールするとページ画像を失い、圧縮した PDF だけをメールすると、この OCR 経路の選択・検索可能な層は無いままだ。語とより小さい PDF の両方が必要なパイプラインは、両方の出力を保存するか、後で片方を走らせ直す必要がある。

テキスト層が壊れたボーンデジタル束への Force OCR は今も有用だ。きれいなボーンデジタル束への Auto は OCR ランタイムを完全に飛ばすことがある。どちらのモードもテキストを PDF に書き戻さない。

このワークフローがそうではないもの

ボタン一つでテキスト抽出と画素の縮小を同時に行うデスクトップの OCRmyPDF パイプラインのようなものを想定すると、スキャン束は期待を裏切る。ここではテキストは Markdown として外に出て、意図的に圧縮しない限り PDF は PDF のままだ。本サイトには「同じ PDF が、検索可能でより小さくなった状態で」を一つの呼び出しで返す工程は無い。

同じ op を HTTP から自動化する方法は 開発者向け にある。

Open tool
Process in the browser — no watermark, files removed after the job.
Open tool