PDFの表をCSVに書き出す
PDFからCSVは、PDFの文字から列がそろった表の行を見つけ、検出した表ごとにCSVファイルを書き出します。複数の表はZIPで返ります。文字層が必要で、散文やスキャンからは何も返しません。
ファイルをここにドロップするか、クリックして選んでください
対応形式:PDF・1ファイル500.0 MBまで · 一度に最大20ファイル
Ctrl/Cmd+V またはクリップボードメニューからファイルを貼り付けることもできます。
PDFからCSV は `pdftotext -layout` を実行し、連続する 2 つ以上の空白を含む行を探し、それらの行を CSV に書き込みます。検出された各表は `{base}_pN_tM.csv` という名前のファイルになります。抽出テキストで列がすでに揃っている電子版 PDF 向けです。
1 つの表には連続する 2 行以上の表らしい行が必要です。散文、単独の見出し行、テキスト層のないスキャンは `no_content`:HTTP 204、ファイルなしになります。空結果は意図的であり、静かな失敗ではありません。
このツールはリクエストパラメータを無視します。このページのページ範囲欄は読まれず、すべてのページが走査されます。1 表は 1 つの `text/csv`、複数表は `{base}_extracted.zip` という ZIP になります。列は連続する 2 つ以上の空白で切れ、セル内の単一スペースはセルに残ります。フィールドは RFC 4180 で引用符付けされます。
OCR ではありません。純画像スキャンには `pdftotext` が読む内容がありません。本サイトの OCR は Markdown を返し、PDFからCSV に再投入できません。文字がピクセルにしかないとき、ここから表ファイルは得られません。
PDFからExcel は同じレイアウトヒューリスティックを使います。Excel はそれらの表を同一ブックの各シートに置きます。CSV は表ごとに 1 ファイルです。どちらも PDF から結合セル・色付き見出し・非表示シートを復元しません。
ダウンロードを Excel または LibreOffice Calc で開き、何行か抜きで列の切れ方を確認してください。二重空白の隙間がない密な表は、しばしば 1 列に落ちます。パスワード保護されたファイルは、このページでパスワードを入力すると自動で解除されます。API を使う場合は先にパスワード解除を実行してください。
アップロードは一時的です。CSV の書庫は保持しません。
機能
- `pdftotext -layout` と二重空白による列分割ヒューリスティック
- 表ごとに 1 CSV。複数なら ZIP。検出が空なら HTTP 204
- OCR ではない。OCR の Markdown はここに送れない
- 匿名 API:/api/v1/convert/pdf/csv
こんなときに使う
- 電子版の請求表を Excel または LibreOffice Calc に取り込む
- 複数ページの表を 1 シートではなく各 CSV にする
- CSV しか受け付けないスクリプトの入力にする
PDFの表をCSVに抽出するには?
- 選べる文字があり、表形式で列が並ぶ PDF をアップロードします。
- 処理をクリックします。ページ範囲欄はありますが、変換器は読みません。OCR オプションはありません。
- 1 表なら `.csv`、複数なら ZIP をダウンロードします。なければ空の成功です。テキスト層のあるソースに変えてください。
- Excel または LibreOffice Calc で開き、切れ方を確認します。純散文の PDF はファイルを生みません。
制限と注意点
- 選べる文字と、二重空白の列隙間が必要
- OCR なし。ページ範囲操作も効かない
- 結合セルとスタイルは復元しない
- このサイトのアップロード上限は 1 ファイルあたり 500 MB で、約 95 MB を超えると分割して送信されます。API への直接リクエスト 1 回の本文は 100 MB までです。
例
- 3 列の価格表がある文字 PDF は、多くの場合それらの列の 1 CSV になる
- テキスト層のないスキャンの銀行明細は HTTP 204 になる
このツールのプライバシー
ファイルは HTTPS でアップロードされ、サーバーのメモリまたは短命の一時ディレクトリで処理され、結果の準備ができた時点で削除されます。後から閲覧・学習・広告プロファイル用にコピーは残しません。保持期間と AdSense Cookie の開示はプライバシーポリシーをご覧ください。
よくある質問
- なぜ CSV が出ないのですか?
- 連続する 2 行以上の表行が見つかりませんでした。スキャン、散文、二重空白の隙間がない表は、このヒューリスティックに失敗します。API は 204 `no_content` で答えます。
- 先に OCR してから CSV にできますか?
- できません。OCR は Markdown を返します。このツールは pdftotext 経由でのみ PDF を読みます。
- PDFからExcel との違いは?
- 検出は同じです。CSV は表ごとに 1 ファイル(1 表なら 1 CSV、複数なら ZIP)。Excel は各表を同一ブックの各シートに書きます。
- すべてのページを読みますか?
- 読みます。pdftotext は改ページで分け、各ページで表ブロックを走査します。このページのページ範囲欄は読まれません。
最終更新:
コードから呼び出す
このサイトの各ツールは、通常のRESTエンドポイントです。匿名利用にアカウントやAPIキーは不要です。ブラウザだけでなく、AIエージェントや開発者向けにも使えます。
curl -X POST "https://pdf123.xyz/api/v1/convert/pdf/csv" \
-F "[email protected]" \
-F "pageNumbers=all" \
-o output.pdfModel Context Protocolに対応したエージェント向けに、MCPツールとしても使えます(JSON-RPC 2.0、POST /mcp)。 APIリファレンス
AI エージェントから使う
スキルこのスキルを入れると、Claude Code、Codex、Cursor などの AI エージェントが「PDFからCSV」を代わりに実行できます: /skills/pdf123-pdf-to-csv.md
ファイルはこの処理のためだけに使い、完了後に自動で削除します。