PDFを文字データに変換する
PDFからテキストは、PDFにすでにある文字を取り出し、プレーンな .txt ファイル、またはRTFとして返します。OCRは行わないため、画像だけのスキャンは空になります。
ファイルをここにドロップするか、クリックして選んでください
対応形式:PDF・1ファイル500.0 MBまで · 一度に最大20ファイル
Ctrl/Cmd+V またはクリップボードメニューからファイルを貼り付けることもできます。
PDFからテキスト は、すでに文字オブジェクトとして存在する語を抽出します。既定の `txt` 経路は他の pdf-core 操作と同じローカル抽出器(`pdfio::extract_text`)を使い、`text/plain` を返します。OCR も LibreOffice も呼びません。
`rtf` を選ぶと、ファイルは LibreOffice `writer_pdf_import` へ回ります。その経路はサーバー上の `soffice` が必要で、粗いリッチテキストを再構築します。フォント置換と表のずれは常態です。RTF は下書きとして扱ってください。
純画像スキャンは空かほぼ空の `.txt` になります。本サイトの OCR は Markdown を返し、ここに再投入できる検索可能 PDF ではありません。
このページにページ範囲フィールドはありません。すべてのページを読みます。パスワード保護されたファイルは、このページでパスワードを入力すると自動で解除されます。API を使う場合は先にパスワード解除を実行してください。
見出しとリストがプレーンテキストより必要なら PDFからMarkdown です。表を行にするなら PDFからCSV または PDFからExcel です。
アップロードは一時的です。テキストの書庫は保持しません。
機能
- 既定 TXT はローカル文字抽出。pdftotext でも OCR でもない
- 任意の RTF は LibreOffice `writer_pdf_import` 経由
- 全ページを読む。ページ範囲パラメータなし
- 匿名 API:/api/v1/convert/pdf/text
こんなときに使う
- テキスト層付きレポートを grep やスクリプトに流す
- 電子版メモから粗い RTF 下書きを得る
- PDF に本当にテキスト層があるか確認する
PDFから文字を抽出するには?
- 選べる文字のある PDF をアップロードします。
- TXT のままにするか、LibreOffice のリッチテキスト下書きが必要なら RTF を選びます。
- 処理をクリックし、`.txt` または `.rtf` をダウンロードします。
- 数段落を抜きで確認します。テキスト層のないスキャンは空に見えます。
制限と注意点
- OCR ではない。スキャンからはほぼ文字が出ない
- ページ範囲操作はない
- TXT は多段組の視覚読み順を再構築しない
- このサイトのアップロード上限は 1 ファイルあたり 500 MB で、約 95 MB を超えると分割して送信されます。API への直接リクエスト 1 回の本文は 100 MB までです。
例
- 選択可能な年次報告は、多くの場合長い .txt になる
- ホワイトボード撮影の PDF は、空白か極小ファイルになることが多い
このツールのプライバシー
ファイルは HTTPS でアップロードされ、サーバーのメモリまたは短命の一時ディレクトリで処理され、結果の準備ができた時点で削除されます。後から閲覧・学習・広告プロファイル用にコピーは残しません。保持期間と AdSense Cookie の開示はプライバシーポリシーをご覧ください。
よくある質問
- なぜテキストファイルが空ですか?
- PDF に抽出器が読む文字オブジェクトがありません。スキャンは OCR(Markdown)が必要です。その Markdown をこのツールに再投入はできません。
- TXT は閲覧ソフトからのコピーと同じですか?
- 近いですが同じではありません。順序はページ内容ストリーム内の文字の並び方に従います。多段組は視覚的な読み順と一致しないことがあります。
- いつ RTF を選ぶべきですか?
- LibreOffice に文書を再構築させたいときだけです。TXT は直接抽出で soffice は不要です。
- フォントと版式は残りますか?
- TXT はプレーンテキストです。RTF はできる範囲の再構築であり、ピクセル一致ではありません。
最終更新:
コードから呼び出す
このサイトの各ツールは、通常のRESTエンドポイントです。匿名利用にアカウントやAPIキーは不要です。ブラウザだけでなく、AIエージェントや開発者向けにも使えます。
curl -X POST "https://pdf123.xyz/api/v1/convert/pdf/text" \
-F "[email protected]" \
-F "outputFormat=txt" \
-o output.pdfModel Context Protocolに対応したエージェント向けに、MCPツールとしても使えます(JSON-RPC 2.0、POST /mcp)。 APIリファレンス
AI エージェントから使う
スキルこのスキルを入れると、Claude Code、Codex、Cursor などの AI エージェントが「PDFからテキスト」を代わりに実行できます: /skills/pdf123-pdf-to-text.md
ファイルはこの処理のためだけに使い、完了後に自動で削除します。