メインコンテンツへスキップ
PPDF123

PDFの表をExcelに変換する

PDFからExcelは、PDFの文字から列がそろった表の行を見つけ、表ごとに .xlsx ブックの別々のシートへ書き込みます。文字層が必要で、散文やスキャンしたページからは何も返しません。

ファイルをここにドロップするか、クリックして選んでください

対応形式:PDF・1ファイル500.0 MBまで · 一度に最大20ファイル

Ctrl/Cmd+V またはクリップボードメニューからファイルを貼り付けることもできます。

PDFからExcel は `pdftotext -layout` を実行し、連続する 2 つ以上の空白を含む行を探し、それらの行を `.xlsx` ブックに書き込みます。検出された各表は `Page N` または `Page N Table M` という名前のシートになります。抽出テキストで列がすでに揃っている電子版 PDF 向けです。

1 つの表には連続する 2 行以上の表らしい行が必要です。散文、単独の見出し行、テキスト層のないスキャンは `no_content` になります。ブックは返りません。空結果は意図的であり、静かな失敗ではありません。

このツールはリクエストパラメータを無視します。このページにページ範囲フィールドはありません。列は連続する 2 つ以上の空白で切れます。セル内の単一スペースはセルに残ります。

OCR ではありません。純画像スキャンには `pdftotext` が読む内容がありません。本サイトの OCR は Markdown を返し、PDFからExcel に再投入できません。文字がピクセルにしかないとき、ここから表計算は得られません。

PDFからCSV は同じレイアウトヒューリスティックを使います。1 表は 1 つの CSV、複数表は CSV の ZIP になります。Excel はそれらの表を同一ブックの各シートに置きます。どちらも PDF から結合セル・色付き見出し・非表示シートを復元しません。

ダウンロードを Excel または LibreOffice Calc で開き、何行か抜きで列の切れ方を確認してください。二重空白の隙間がない密な表は、しばしば 1 列に落ちます。パスワード保護されたファイルは、このページでパスワードを入力すると自動で解除されます。API を使う場合は先にパスワード解除を実行してください。

二重空白ルールこそが検出機構のすべてなので、ブックの品質は PDF の組版次第で決まります。各セルを固定幅にパディングする帳票ジェネレーター製の表はきれいに抽出できます。列間に空白が 1 つしかない表や、比例フォントで列がほぼ隣接する表は、そもそも表として認識されず、ブックが得られないこともあります。ツールを責める前に、PDF の 1 行を選択してテキストが選択できること自体を確認してください。

シート名は内容ではなく位置に従います。検出された各ブロックは、ページを走査した順に `Page N` または `Page N Table M` になります。各ページに 1 表ある帳票は 1 ページ 1 シートになります。3 つの表が縦に並ぶページは 3 つの番号付きシートになります。見出しセルからシート名を付けるオプションはなく、1 シートに統合する出力もありません。

値は、レイアウトを保持した抽出に出てきたとおり、テキストとして書き込まれます。数値は数値セルに変換されないため、先頭のゼロは残り、通貨記号や桁区切りも文字列のまま残ります。口座番号や郵便番号にはたいてい望ましく、合計したい金額列には少し厄介です。スプレッドシート側で型を変換するか、列をコピーして貼り付け先のテキスト区切りや値変換を使ってください。

行の重複除去は行われず、繰り返し見出しも削除されません。表がページ境界で分かれると、見出し行が次ページで繰り返され、続きが独立したシートになります。結合セルは再構築されません。PDF で 2 列にまたがっていたセルは、テキストが左端の列に入るだけで、右の列は空のままです。複数行のセルは、折り返された 1 つの値ではなく別々の行になります。

アップロードは一時的です。ブックの書庫は保持しません。

機能

  • `pdftotext -layout` と二重空白による列分割ヒューリスティック
  • 検出された表ごとに 1 シート。検出が空ならファイルを返さない
  • OCR ではない。OCR の Markdown はここに送れない
  • テキスト型のセル。型推論や結合セルの再構築はなし
  • 匿名 API:/api/v1/convert/pdf/xlsx

こんなときに使う

  • 抽出した表をそのまま Excel または LibreOffice Calc で開く
  • 電子版の請求表をブックに取り込む
  • 複数ページの表を 1 つの CSV ではなく各シートにする
  • 固定幅の財務諸表を抽出してさらに分析する

PDFの表をExcelに変換するには?

  1. 選べる文字があり、表形式で列が並ぶ PDF をアップロードします。
  2. 処理をクリックします。このツールにページ範囲や OCR オプションはありません。
  3. 表が見つかれば `.xlsx` をダウンロードします。なければ空の成功です。テキスト層のあるソースに変えてください。
  4. ブックを開き切れ方を確認します。純散文の PDF はシートを生みません。

制限と注意点

  • 選べる文字と、二重空白の列隙間が必要
  • OCR もページ範囲操作もない
  • 結合セルとスタイルは復元しない
  • すべての値はテキスト。数値・日付の型付けなし
  • ページをまたぐ表は別々のシートになる
  • このサイトのアップロード上限は 1 ファイルあたり 500 MB で、約 95 MB を超えると分割して送信されます。API への直接リクエスト 1 回の本文は 100 MB までです。

例

  • 3 列の価格表がある文字 PDF は、多くの場合それらの列の 1 シートになる
  • テキスト層のないスキャンの銀行明細は、ブックを返さない
  • 各ページに 1 表ある 10 ページの帳票は Page 1 から Page 10 という 10 枚のシートになる

このツールのプライバシー

ファイルは HTTPS でアップロードされ、サーバーのメモリまたは短命の一時ディレクトリで処理され、結果の準備ができた時点で削除されます。後から閲覧・学習・広告プロファイル用にコピーは残しません。保持期間と AdSense Cookie の開示はプライバシーポリシーをご覧ください。

よくある質問

なぜ表計算が出ないのですか?
連続する 2 行以上の表行のまとまりが見つかりませんでした。スキャン、散文、二重空白の隙間がない表は、このヒューリスティックに失敗します。
先に OCR してから Excel に変換できますか?
できません。OCR は Markdown を返します。このツールは pdftotext 経由でのみ PDF を読みます。
PDFからCSV との違いは?
検出は同じです。Excel は各表を同一ブックの各シートに書きます。CSV は表ごとに 1 ファイル(1 表なら 1 CSV、複数なら ZIP)です。
すべてのページを読みますか?
読みます。pdftotext は改ページで分けます。各ページで表ブロックを走査します。ページ範囲パラメータはありません。
数値がテキストで保存されるのはなぜですか?
値は抽出されたまま書き込まれるため、先頭のゼロや書式が保たれます。計算に使うなら、スプレッドシートでその列を数値に変換してください。
結合セルは再構築されますか?
いいえ。結合セルのテキストは左端の列に入り、他の列は空のままです。複数行のセルは、折り返された 1 つの値ではなく別々の行になります。
1 つの表でシートが複数できるのはなぜですか?
新しいページに続く表はそのページで再び検出され、別のシートになります。見出し行はしばしば繰り返され、ツールは断片を統合しません。

最終更新:

コードから呼び出す

このサイトの各ツールは、通常のRESTエンドポイントです。匿名利用にアカウントやAPIキーは不要です。ブラウザだけでなく、AIエージェントや開発者向けにも使えます。

curl -X POST "https://pdf123.xyz/api/v1/convert/pdf/xlsx" \
  -F "[email protected]" \
  -o output.pdf

Model Context Protocolに対応したエージェント向けに、MCPツールとしても使えます(JSON-RPC 2.0、POST /mcp)。 APIリファレンス

AI エージェントから使う

スキル

このスキルを入れると、Claude Code、Codex、Cursor などの AI エージェントが「PDFからExcel」を代わりに実行できます: /skills/pdf123-pdf-to-xlsx.md

すべてのエージェント用スキル

ファイルはこの処理のためだけに使い、完了後に自動で削除します。