メインコンテンツへスキップ
PPDF123

PDFを文字データに変換する

PDFからテキストは、PDFにすでにある文字を取り出し、プレーンな .txt ファイル、またはRTFとして返します。OCRは行わないため、画像だけのスキャンは空になります。

ファイルをここにドロップするか、クリックして選んでください

対応形式:PDF・1ファイル500.0 MBまで · 一度に最大20ファイル

Ctrl/Cmd+V またはクリップボードメニューからファイルを貼り付けることもできます。

PDFからテキスト は、すでに文字オブジェクトとして存在する語を抽出します。既定の `txt` 経路は他の pdf-core 操作と同じローカル抽出器(`pdfio::extract_text`)を使い、`text/plain` を返します。OCR も LibreOffice も呼びません。

`rtf` を選ぶと、ファイルは LibreOffice `writer_pdf_import` へ回ります。その経路はサーバー上の `soffice` が必要で、粗いリッチテキストを再構築します。フォント置換と表のずれは常態です。RTF は下書きとして扱ってください。

純画像スキャンは空かほぼ空の `.txt` になります。本サイトの OCR は Markdown を返し、ここに再投入できる検索可能 PDF ではありません。

このページにページ範囲フィールドはありません。すべてのページを読みます。パスワード保護されたファイルは、このページでパスワードを入力すると自動で解除されます。API を使う場合は先にパスワード解除を実行してください。

見出しとリストがプレーンテキストより必要なら PDFからMarkdown です。表を行にするなら PDFからCSV または PDFからExcel です。

アップロードは一時的です。テキストの書庫は保持しません。

機能

  • 既定 TXT はローカル文字抽出。pdftotext でも OCR でもない
  • 任意の RTF は LibreOffice `writer_pdf_import` 経由
  • 全ページを読む。ページ範囲パラメータなし
  • 匿名 API:/api/v1/convert/pdf/text

こんなときに使う

  • テキスト層付きレポートを grep やスクリプトに流す
  • 電子版メモから粗い RTF 下書きを得る
  • PDF に本当にテキスト層があるか確認する

PDFから文字を抽出するには?

  1. 選べる文字のある PDF をアップロードします。
  2. TXT のままにするか、LibreOffice のリッチテキスト下書きが必要なら RTF を選びます。
  3. 処理をクリックし、`.txt` または `.rtf` をダウンロードします。
  4. 数段落を抜きで確認します。テキスト層のないスキャンは空に見えます。

制限と注意点

  • OCR ではない。スキャンからはほぼ文字が出ない
  • ページ範囲操作はない
  • TXT は多段組の視覚読み順を再構築しない
  • このサイトのアップロード上限は 1 ファイルあたり 500 MB で、約 95 MB を超えると分割して送信されます。API への直接リクエスト 1 回の本文は 100 MB までです。

例

  • 選択可能な年次報告は、多くの場合長い .txt になる
  • ホワイトボード撮影の PDF は、空白か極小ファイルになることが多い

このツールのプライバシー

ファイルは HTTPS でアップロードされ、サーバーのメモリまたは短命の一時ディレクトリで処理され、結果の準備ができた時点で削除されます。後から閲覧・学習・広告プロファイル用にコピーは残しません。保持期間と AdSense Cookie の開示はプライバシーポリシーをご覧ください。

よくある質問

なぜテキストファイルが空ですか?
PDF に抽出器が読む文字オブジェクトがありません。スキャンは OCR(Markdown)が必要です。その Markdown をこのツールに再投入はできません。
TXT は閲覧ソフトからのコピーと同じですか?
近いですが同じではありません。順序はページ内容ストリーム内の文字の並び方に従います。多段組は視覚的な読み順と一致しないことがあります。
いつ RTF を選ぶべきですか?
LibreOffice に文書を再構築させたいときだけです。TXT は直接抽出で soffice は不要です。
フォントと版式は残りますか?
TXT はプレーンテキストです。RTF はできる範囲の再構築であり、ピクセル一致ではありません。

最終更新:

コードから呼び出す

このサイトの各ツールは、通常のRESTエンドポイントです。匿名利用にアカウントやAPIキーは不要です。ブラウザだけでなく、AIエージェントや開発者向けにも使えます。

curl -X POST "https://pdf123.xyz/api/v1/convert/pdf/text" \
  -F "[email protected]" \
  -F "outputFormat=txt" \
  -o output.pdf

Model Context Protocolに対応したエージェント向けに、MCPツールとしても使えます(JSON-RPC 2.0、POST /mcp)。 APIリファレンス

AI エージェントから使う

スキル

このスキルを入れると、Claude Code、Codex、Cursor などの AI エージェントが「PDFからテキスト」を代わりに実行できます: /skills/pdf123-pdf-to-text.md

すべてのエージェント用スキル

ファイルはこの処理のためだけに使い、完了後に自動で削除します。