PDFをXMLファイルにする
PDFからXMLは、PDFをLibreOfficeで取り込み、Office風のXMLファイルとして返します。文字とレイアウトをできる範囲で書き出したもので、PDFの構造やタグの複製ではありません。
ファイルをここにドロップするか、クリックして選んでください
対応形式:PDF・1ファイル500.0 MBまで · 一度に最大20ファイル
Ctrl/Cmd+V またはクリップボードメニューからファイルを貼り付けることもできます。
PDFからXML はファイルを LibreOffice `writer_pdf_import` に渡し、`outputFormat=xml` です。ダウンロードは Office 風 XML(`octet-stream`)であり、PDF 内容ストリームやタグ付き PDF 構造の復元ではありません。
PDFからWord と同系統の LibreOffice 取り込みで、目標だけが XML です。版式・表・フォントはできる範囲です。テキスト層のないスキャンは図や空段落になります。
このページに選択肢はありません。パスワード保護されたファイルは、このページでパスワードを入力すると自動で解除されます。API を使う場合は先にパスワード解除を実行してください。OCR の Markdown はここに送れません。
表から行を取るなら PDFからCSV。文字だけなら PDFからテキスト です。
アップロードは一時的です。XML の書庫は保持しません。
機能
- LibreOffice `writer_pdf_import` で XML へ
- PDF 構造の書き出しでも OCR でもない
- ページ範囲やスキーマの選択肢なし
- 匿名 API:/api/v1/convert/pdf/xml
こんなときに使う
- 電子版 PDF を、すでに Office XML を受け取るパイプラインへ渡す
- LibreOffice がこの文書をどう切るか見る
- 次工程が DOCX でないとき、XML 下書きを取る
PDFをXMLに変換するには?
- 文字のある PDF をアップロードします。
- 処理をクリックします。このページに形式の選択肢はありません。
- `.xml` をダウンロードします。
- LibreOffice またはエディタで開き、下書きとして扱います。
制限と注意点
- タグ付き PDF でも XFDF/XFA 抽出でもない
- OCR ではない
- 表と改ページは PDF と一致しない
- このサイトのアップロード上限は 1 ファイルあたり 500 MB で、約 95 MB を超えると分割して送信されます。API への直接リクエスト 1 回の本文は 100 MB までです。
例
- 文字メモは、多くの場合段落 run 付きの大きな Office XML になる
- 純スキャン PDF は、主に図を包む XML になることが多い
このツールのプライバシー
ファイルは HTTPS でアップロードされ、サーバーのメモリまたは短命の一時ディレクトリで処理され、結果の準備ができた時点で削除されます。後から閲覧・学習・広告プロファイル用にコピーは残しません。保持期間と AdSense Cookie の開示はプライバシーポリシーをご覧ください。
よくある質問
- これは PDF 内部の XML ですか?
- いいえ。LibreOffice が取り込んだ文書を XML として書き出したものであり、PDF オブジェクトツリーではありません。
- なぜスキャンはほとんど空なのですか?
- LibreOffice が取り込む文字がありません。ピクセル内の文字は OCR(Markdown)を使ってください。
- 別の XML 方言を選べますか?
- できません。この経路は outputFormat を xml に固定し、その値だけを許します。
- PDFからWord との違いは?
- インポータは同じで、出力が違います。PDFからWord は docx、doc、または odt。この経路は xml です。
最終更新:
コードから呼び出す
このサイトの各ツールは、通常のRESTエンドポイントです。匿名利用にアカウントやAPIキーは不要です。ブラウザだけでなく、AIエージェントや開発者向けにも使えます。
curl -X POST "https://pdf123.xyz/api/v1/convert/pdf/xml" \
-F "[email protected]" \
-o output.pdfModel Context Protocolに対応したエージェント向けに、MCPツールとしても使えます(JSON-RPC 2.0、POST /mcp)。 APIリファレンス
AI エージェントから使う
スキルこのスキルを入れると、Claude Code、Codex、Cursor などの AI エージェントが「PDFからXML」を代わりに実行できます: /skills/pdf123-pdf-to-xml.md
ファイルはこの処理のためだけに使い、完了後に自動で削除します。