メインコンテンツへスキップ
PPDF123

スキャンしたPDFをOCRでMarkdownにする

OCR(Markdown)は、スキャンまたは画像ベースのPDFを読み、その文字をMarkdownファイルとして返します。PDFに文字層を書き戻すことはなく、元のファイルは変わりません。

ファイルをここにドロップするか、クリックして選んでください

対応形式:PDF・1ファイル500.0 MBまで · 一度に最大20ファイル

Ctrl/Cmd+V またはクリップボードメニューからファイルを貼り付けることもできます。

OCR はスキャンまたは画像ベースの PDF を読み、Markdown(`text/markdown`、ファイル名 `.md`)を返します。隠しテキスト層を PDF に書き戻すことはなく、スキャンの清掃・傾き補正・書き換えもしません。

サーバーは PDF のネイティブテキストと、画像ページの光学認識を合成します。Force OCR(`ocrType=force-ocr`、ポータルの既定)は全ページを再認識します。Normal(`force-ocr` 以外)は、すでにテキストがある箇所はそれを使い、画像のみのページだけ OCR します。きれいな電子生成 PDF では、Auto は OCR ランタイムを読み込みません。

精度はスキャン品質、コントラスト、傾きに左右されます。エンジンに言語パラメータはありません。旧 Java OCRmyPDF の項目(`languages`、`deskew`、`clean`、`sidecar`)をクライアントが送っても無視されます。

PDFからWord や PDFからテキストの前処理ではありません。それらのツールは今でも PDF 内のテキストが必要です。ここでの OCR は並列抽出です。Markdown が得られ、元の PDF は変わりません。

デジタル化や再配布の権限がない文書に OCR をかけないでください。抽出したテキストにも著作権と職場の規則が適用されます。

検索可能な PDF を求める用途には向きません。検索可能な成果物は Markdown ファイルです。エディタで開き、正確でなければならない氏名と数字を確認してください。

可能ならアップロード前に、スマホ撮影を切り抜き・水平にしてください。台形に写ったページは背景の認識に浪費します。OCR は翻訳ではありません。文字を認識するだけで、別言語に書き直しません。

処理はサーバー側で実行されます。速やかにダウンロードしてください。ファイルの OCR 書庫は保持しません。パスワード保護されたファイルは、このページでパスワードを入力すると自動で解除されます。API を使う場合は先にパスワード解除を実行してください。

機能

  • 返すのは Markdown であり、OCR 済み PDF ではない
  • Force OCR は全ページを再読取。Normal/Auto はネイティブテキストがあればそれを使う
  • 元の PDF は変わらない
  • 匿名 API:/api/v1/misc/ocr-pdf

こんなときに使う

  • アーカイブスキャンから条項テキストを取り出す
  • Markdown を求めるエージェントやパイプラインにスキャンを渡す
  • 画像のみの PDF からテキストを取り戻す

スキャンしたPDFをOCRにかけるには?

  1. スキャンまたは撮影した PDF をアップロードします。
  2. Force OCR(既定)または Normal/Auto を選びます。
  3. 処理をクリックし、`.md` ファイルをダウンロードします。
  4. Markdown 内の氏名と数字を確認してから使います。

制限と注意点

  • 精度は画像品質で変わる
  • ページ数が非常に多いと時間がかかる
  • 現在のエンジンに言語パラメータはない
  • ローカル OCR ライブラリやオフライン SDK ではない
  • このサイトのアップロード上限は 1 ファイルあたり 500 MB で、約 95 MB を超えると分割して送信されます。API への直接リクエスト 1 回の本文は 100 MB までです。

例

  • 20 ページのグレースケール契約スキャンが、条項テキストの Markdown ファイルになる
  • 傾いたスマホ写真は、OCR が役立つ前に撮り直しが必要になることがある

このツールのプライバシー

ファイルは HTTPS でアップロードされ、サーバーのメモリまたは短命の一時ディレクトリで処理され、結果の準備ができた時点で削除されます。後から閲覧・学習・広告プロファイル用にコピーは残しません。保持期間と AdSense Cookie の開示はプライバシーポリシーをご覧ください。

よくある質問

OCR でページの見た目は変わりますか?
PDF は返しません。元ファイルはそのままです。別途 Markdown がダウンロードされます。
埋め込み可能な OCR ライブラリですか?
いいえ。/api/v1/misc/ocr-pdf のホスト型 HTTP ジョブです。/developers をご覧ください。リンク可能な SDK ではありません。
OCR のあと Word に変換できますか?
PDF パイプラインとしてはできません。OCR の出力は Markdown です。PDFからWord には今でもテキスト層付き PDF が必要です。
電子生成 PDF に Force OCR は必要ですか?
通常は不要です。Normal/Auto は既存テキストを使い、OCR ランタイムを飛ばします。その層が壊れているか信用できないときだけ Force を使います。

最終更新:

コードから呼び出す

このサイトの各ツールは、通常のRESTエンドポイントです。匿名利用にアカウントやAPIキーは不要です。ブラウザだけでなく、AIエージェントや開発者向けにも使えます。

curl -X POST "https://pdf123.xyz/api/v1/misc/ocr-pdf" \
  -F "[email protected]" \
  -F "ocrType=force-ocr" \
  -o output.pdf

Model Context Protocolに対応したエージェント向けに、MCPツールとしても使えます(JSON-RPC 2.0、POST /mcp)。 APIリファレンス

AI エージェントから使う

スキル

このスキルを入れると、Claude Code、Codex、Cursor などの AI エージェントが「OCR(Markdown)」を代わりに実行できます: /skills/pdf123-ocr.md

すべてのエージェント用スキル

ファイルはこの処理のためだけに使い、完了後に自動で削除します。