PDFの表をExcelに変換する
PDFからExcelは、PDFの文字から列がそろった表の行を見つけ、表ごとに .xlsx ブックの別々のシートへ書き込みます。文字層が必要で、散文やスキャンしたページからは何も返しません。
ファイルをここにドロップするか、クリックして選んでください
対応形式:PDF・1ファイル500.0 MBまで · 一度に最大20ファイル
Ctrl/Cmd+V またはクリップボードメニューからファイルを貼り付けることもできます。
PDFからExcel は `pdftotext -layout` を実行し、連続する 2 つ以上の空白を含む行を探し、それらの行を `.xlsx` ブックに書き込みます。検出された各表は `Page N` または `Page N Table M` という名前のシートになります。抽出テキストで列がすでに揃っている電子版 PDF 向けです。
1 つの表には連続する 2 行以上の表らしい行が必要です。散文、単独の見出し行、テキスト層のないスキャンは `no_content` になります。ブックは返りません。空結果は意図的であり、静かな失敗ではありません。
このツールはリクエストパラメータを無視します。このページにページ範囲フィールドはありません。列は連続する 2 つ以上の空白で切れます。セル内の単一スペースはセルに残ります。
OCR ではありません。純画像スキャンには `pdftotext` が読む内容がありません。本サイトの OCR は Markdown を返し、PDFからExcel に再投入できません。文字がピクセルにしかないとき、ここから表計算は得られません。
PDFからCSV は同じレイアウトヒューリスティックを使います。1 表は 1 つの CSV、複数表は CSV の ZIP になります。Excel はそれらの表を同一ブックの各シートに置きます。どちらも PDF から結合セル・色付き見出し・非表示シートを復元しません。
ダウンロードを Excel または LibreOffice Calc で開き、何行か抜きで列の切れ方を確認してください。二重空白の隙間がない密な表は、しばしば 1 列に落ちます。パスワード保護されたファイルは、このページでパスワードを入力すると自動で解除されます。API を使う場合は先にパスワード解除を実行してください。
二重空白ルールこそが検出機構のすべてなので、ブックの品質は PDF の組版次第で決まります。各セルを固定幅にパディングする帳票ジェネレーター製の表はきれいに抽出できます。列間に空白が 1 つしかない表や、比例フォントで列がほぼ隣接する表は、そもそも表として認識されず、ブックが得られないこともあります。ツールを責める前に、PDF の 1 行を選択してテキストが選択できること自体を確認してください。
シート名は内容ではなく位置に従います。検出された各ブロックは、ページを走査した順に `Page N` または `Page N Table M` になります。各ページに 1 表ある帳票は 1 ページ 1 シートになります。3 つの表が縦に並ぶページは 3 つの番号付きシートになります。見出しセルからシート名を付けるオプションはなく、1 シートに統合する出力もありません。
値は、レイアウトを保持した抽出に出てきたとおり、テキストとして書き込まれます。数値は数値セルに変換されないため、先頭のゼロは残り、通貨記号や桁区切りも文字列のまま残ります。口座番号や郵便番号にはたいてい望ましく、合計したい金額列には少し厄介です。スプレッドシート側で型を変換するか、列をコピーして貼り付け先のテキスト区切りや値変換を使ってください。
行の重複除去は行われず、繰り返し見出しも削除されません。表がページ境界で分かれると、見出し行が次ページで繰り返され、続きが独立したシートになります。結合セルは再構築されません。PDF で 2 列にまたがっていたセルは、テキストが左端の列に入るだけで、右の列は空のままです。複数行のセルは、折り返された 1 つの値ではなく別々の行になります。
アップロードは一時的です。ブックの書庫は保持しません。
機能
- `pdftotext -layout` と二重空白による列分割ヒューリスティック
- 検出された表ごとに 1 シート。検出が空ならファイルを返さない
- OCR ではない。OCR の Markdown はここに送れない
- テキスト型のセル。型推論や結合セルの再構築はなし
- 匿名 API:/api/v1/convert/pdf/xlsx
こんなときに使う
- 抽出した表をそのまま Excel または LibreOffice Calc で開く
- 電子版の請求表をブックに取り込む
- 複数ページの表を 1 つの CSV ではなく各シートにする
- 固定幅の財務諸表を抽出してさらに分析する
PDFの表をExcelに変換するには?
- 選べる文字があり、表形式で列が並ぶ PDF をアップロードします。
- 処理をクリックします。このツールにページ範囲や OCR オプションはありません。
- 表が見つかれば `.xlsx` をダウンロードします。なければ空の成功です。テキスト層のあるソースに変えてください。
- ブックを開き切れ方を確認します。純散文の PDF はシートを生みません。
制限と注意点
- 選べる文字と、二重空白の列隙間が必要
- OCR もページ範囲操作もない
- 結合セルとスタイルは復元しない
- すべての値はテキスト。数値・日付の型付けなし
- ページをまたぐ表は別々のシートになる
- このサイトのアップロード上限は 1 ファイルあたり 500 MB で、約 95 MB を超えると分割して送信されます。API への直接リクエスト 1 回の本文は 100 MB までです。
例
- 3 列の価格表がある文字 PDF は、多くの場合それらの列の 1 シートになる
- テキスト層のないスキャンの銀行明細は、ブックを返さない
- 各ページに 1 表ある 10 ページの帳票は Page 1 から Page 10 という 10 枚のシートになる
このツールのプライバシー
ファイルは HTTPS でアップロードされ、サーバーのメモリまたは短命の一時ディレクトリで処理され、結果の準備ができた時点で削除されます。後から閲覧・学習・広告プロファイル用にコピーは残しません。保持期間と AdSense Cookie の開示はプライバシーポリシーをご覧ください。
よくある質問
- なぜ表計算が出ないのですか?
- 連続する 2 行以上の表行のまとまりが見つかりませんでした。スキャン、散文、二重空白の隙間がない表は、このヒューリスティックに失敗します。
- 先に OCR してから Excel に変換できますか?
- できません。OCR は Markdown を返します。このツールは pdftotext 経由でのみ PDF を読みます。
- PDFからCSV との違いは?
- 検出は同じです。Excel は各表を同一ブックの各シートに書きます。CSV は表ごとに 1 ファイル(1 表なら 1 CSV、複数なら ZIP)です。
- すべてのページを読みますか?
- 読みます。pdftotext は改ページで分けます。各ページで表ブロックを走査します。ページ範囲パラメータはありません。
- 数値がテキストで保存されるのはなぜですか?
- 値は抽出されたまま書き込まれるため、先頭のゼロや書式が保たれます。計算に使うなら、スプレッドシートでその列を数値に変換してください。
- 結合セルは再構築されますか?
- いいえ。結合セルのテキストは左端の列に入り、他の列は空のままです。複数行のセルは、折り返された 1 つの値ではなく別々の行になります。
- 1 つの表でシートが複数できるのはなぜですか?
- 新しいページに続く表はそのページで再び検出され、別のシートになります。見出し行はしばしば繰り返され、ツールは断片を統合しません。
最終更新:
コードから呼び出す
このサイトの各ツールは、通常のRESTエンドポイントです。匿名利用にアカウントやAPIキーは不要です。ブラウザだけでなく、AIエージェントや開発者向けにも使えます。
curl -X POST "https://pdf123.xyz/api/v1/convert/pdf/xlsx" \
-F "[email protected]" \
-o output.pdfModel Context Protocolに対応したエージェント向けに、MCPツールとしても使えます(JSON-RPC 2.0、POST /mcp)。 APIリファレンス
AI エージェントから使う
スキルこのスキルを入れると、Claude Code、Codex、Cursor などの AI エージェントが「PDFからExcel」を代わりに実行できます: /skills/pdf123-pdf-to-xlsx.md
ファイルはこの処理のためだけに使い、完了後に自動で削除します。