Langkau ke kandungan utama
PPDF123

Ekstrak Jadual daripada PDF ke CSV

PDF ke CSV mencari baris jadual yang sejajar dalam teks PDF dan menulis setiap jadual yang dikesan sebagai fail CSV; beberapa jadual dipulangkan dalam ZIP. Ia memerlukan lapisan teks dan tidak memberi apa-apa untuk prosa atau imbasan.

Seret dan lepaskan fail di sini, atau klik untuk pilih

Menerima PDF · sehingga 500.0 MB setiap fail · sehingga 20 fail sekali gus

Anda juga boleh menampal fail dengan Ctrl/Cmd+V atau dari menu papan keratan.

PDF ke CSV menjalankan `pdftotext -layout`, mencari baris dengan dua atau lebih ruang berturut-turut, lalu menulis baris itu sebagai CSV. Setiap jadual dikesan menjadi fail `{base}_pN_tM.csv`. Sesuai untuk PDF elektronik yang lajur sudah sejajar dalam teks yang diekstrak.

Satu jadual memerlukan sekurang-kurangnya dua baris berturut-turut seperti jadual. Prosa, pengepala satu baris, atau imbasan tanpa lapisan teks menghasilkan `no_content`: HTTP 204, tiada fail. Hasil kosong disengajakan, bukan kegagalan senyap.

Alat ini mengabaikan parameter permintaan. Medan julat halaman pada halaman ini tidak dibaca; setiap halaman diimbas. Satu jadual menjadi satu `text/csv`; beberapa jadual dibungkus ZIP `{base}_extracted.zip`. Lajur dipotong pada dua atau lebih ruang berturut-turut; ruang tunggal dalam sel kekal. Medan diquote mengikut RFC 4180.

Ini bukan OCR. Imbasan imej sahaja tiada kandungan untuk `pdftotext`. OCR di tapak ini memulangkan Markdown, yang tidak boleh dihantar semula ke PDF ke CSV. Apabila teks hanya dalam piksel, tiada fail jadual di sini.

PDF ke Excel memakai heuristik susun atur yang sama. Excel meletakkan jadual sebagai lembaran dalam buku kerja yang sama. CSV satu fail setiap jadual. Kedua-duanya tidak memulihkan sel gabung, pengepala berwarna, atau lembaran tersembunyi.

Buka muat turun dalam Excel atau LibreOffice Calc dan sampel beberapa baris. Jadual rapat tanpa jurang ruang berganda sering jatuh ke satu lajur. Fail yang dilindungi kata laluan dibuka untuk anda pada halaman ini sebaik sahaja anda memasukkan kata laluan; pemanggil API perlu menjalankan Buang kata laluan dahulu.

Muat naik bersifat sementara. Kami tidak menyimpan pustaka CSV anda.

Ciri

  • `pdftotext -layout` ditambah heuristik potong lajur ruang berganda
  • Satu CSV setiap jadual; banyak → ZIP; pengesanan kosong → HTTP 204
  • Bukan OCR; Markdown OCR tidak boleh dihantar ke sini
  • API tanpa nama: /api/v1/convert/pdf/csv

Bila menggunakan alat ini

  • Tarik jadual invois elektronik ke Excel atau LibreOffice Calc
  • Jadikan jadual merentas halaman sebagai CSV berasingan, bukan satu lembaran
  • Input untuk skrip yang hanya menerima CSV

Bagaimana cara mengekstrak jadual daripada PDF ke CSV?

  1. Muat naik PDF dengan teks boleh dipilih dan lajur berbentuk jadual.
  2. Klik proses. Medan julat halaman ada tetapi penukar tidak membaca. Tiada pilihan OCR.
  3. Jika satu jadual dijumpai, muat turun `.csv`. Jika banyak, muat turun ZIP. Jika tiada, kejayaan kosong; tukar sumber berlapisan teks.
  4. Buka dalam Excel atau LibreOffice Calc dan semak potongan. PDF prosa sahaja tidak menghasilkan fail.

Had dan kes khas

  • Memerlukan teks boleh dipilih dan jurang lajur ruang berganda
  • Tiada OCR; kawalan julat halaman tidak berkesan
  • Tidak memulihkan sel gabung dan gaya
  • Had muat naik di tapak web ini: 500 MB setiap fail, dihantar berketul-ketul melebihi kira-kira 95 MB. Satu badan permintaan API langsung dihadkan pada 100 MB.

Contoh

  • PDF teks dengan senarai harga tiga lajur sering menjadi satu CSV dengan lajur itu
  • Penyata bank imbasan tanpa lapisan teks mendapat HTTP 204

Privasi untuk alat ini

Fail dimuat naik melalui HTTPS, diproses dalam memori atau direktori sementara singkat di pelayan kami, kemudian dipadam apabila hasil sedia. Kami tidak menyimpan salinan untuk semakan kemudian, latihan, atau profil iklan. Lihat Dasar Privasi untuk pengekalan dan pendedahan kuki AdSense.

Soalan lazim

Mengapa tiada CSV?
Tiada dua baris jadual atau lebih berturut-turut. Imbasan, prosa, dan jadual tanpa jurang ruang berganda gagal. API menjawab 204 `no_content`.
Bolehkah OCR dahulu kemudian ke CSV?
Tidak. OCR memulangkan Markdown. Alat ini hanya membaca PDF melalui pdftotext.
Apa beza dengan PDF ke Excel?
Pengesanan sama. CSV satu fail setiap jadual (satu CSV, atau ZIP jika banyak). Excel menulis setiap jadual ke lembaran sendiri dalam buku kerja yang sama.
Adakah setiap halaman dibaca?
Ya. pdftotext membahagi mengikut form suapan; setiap halaman diimbas. Medan julat halaman pada halaman ini tidak dibaca.

Kemas kini terakhir:

Panggil dari kod

Setiap alat di laman ini ialah panggilan REST biasa. Penggunaan tanpa nama tidak perlukan akaun atau kunci API. Untuk pelayar, pembangun dan ejen AI sama-sama.

curl -X POST "https://pdf123.xyz/api/v1/convert/pdf/csv" \
  -F "[email protected]" \
  -F "pageNumbers=all" \
  -o output.pdf

Juga tersedia sebagai alat MCP untuk klien ejen yang menggunakan Model Context Protocol (JSON-RPC 2.0 melalui POST /mcp). Rujukan API penuh

Gunakan melalui ejen AI

Skill

Dengan skill ini, Claude Code, Codex, Cursor dan ejen AI lain boleh menjalankan "PDF ke CSV" bagi pihak anda: /skills/pdf123-pdf-to-csv.md

Semua skill ejen

Fail hanya digunakan untuk pemprosesan ini dan dipadam secara automatik selepas itu.