Przejdź do głównej treści
PPDF123

Wyodrębnianie tabel z PDF do CSV

PDF na CSV znajduje wyrównane wiersze tabel w tekście PDF i zapisuje każdą wykrytą tabelę jako plik CSV; kilka tabel wraca w ZIP-ie. Wymaga warstwy tekstu i nic nie zwraca dla zwykłego tekstu ani skanów.

Przeciągnij pliki tutaj albo kliknij, żeby wybrać

Obsługiwane: PDF · do 500.0 MB na plik · maks. 20 plików naraz

Możesz też wkleić plik przez Ctrl/Cmd+V lub z menu schowka.

Konwersja PDF na CSV uruchamia `pdftotext -layout`, szuka wierszy z co najmniej dwoma spacjami pod rząd i zapisuje je jako CSV. Każda wykryta tabela staje się plikiem `{base}_pN_tM.csv`. Nadaje się do elektronicznych PDF, w których kolumny są już wyrównane w wyciągniętym tekście.

Tabela wymaga co najmniej dwóch kolejnych wierszy tabelarycznych. Proza, samotny wiersz nagłówka albo skan bez warstwy tekstu dają `no_content`: HTTP 204, bez pliku. Pusty wynik jest zamierzony, nie cichą awarią.

Narzędzie ignoruje parametry żądania. Pole zakresu stron na tej stronie nie jest czytane; skanowane jest wszystko. Jedna tabela to `text/csv`; wiele — ZIP `{base}_extracted.zip`. Kolumny tną się na dwóch lub więcej spacjach z rzędu; pojedyncze spacje w komórce zostają. Pola cytowane według RFC 4180.

To nie OCR. Czysty skan obrazowy nie ma treści dla `pdftotext`. OCR zwraca Markdown i nie da się go tu włożyć. Gdy tekst istnieje tylko w pikselach, pliku tabeli nie będzie.

PDF na Excel używa tej samej heurystyki układu. Excel kładzie tabele na arkuszach jednego skoroszytu. CSV daje jeden plik na tabelę. Żadne nie odtwarza scalonych komórek, kolorowych nagłówków ani ukrytych arkuszy.

Otwórz pobranie w Excelu lub LibreOffice Calc i sprawdź kilka wierszy. Ścisłe tabele bez podwójnych spacji często wpadają do jednej kolumny. Pliki chronione hasłem są odblokowywane za Ciebie na tej stronie, gdy tylko wpiszesz hasło; wywołujący API najpierw uruchamiają Usuń hasło.

Przesłania są tymczasowe. Nie prowadzimy biblioteki Twoich CSV.

Funkcje

  • `pdftotext -layout` plus heurystyka kolumn na podwójnych spacjach
  • Jeden CSV na tabelę; wiele → ZIP; puste wykrycie → HTTP 204
  • Bez OCR; Markdown z OCR nie wchodzi tutaj
  • Anonimowe API: /api/v1/convert/pdf/csv

Kiedy tego użyć

  • Wciągnąć elektroniczną tabelę faktury do Excela lub LibreOffice Calc
  • Mieć tabele z wielu stron jako osobne CSV zamiast jednego arkusza
  • Dać wejście skryptowi przyjmującemu tylko CSV

Jak wyodrębnić tabelę z PDF do CSV?

  1. Prześlij PDF z zaznaczalnym tekstem i kolumnami tabeli.
  2. Kliknij Przetwórz. Pole zakresu stron jest, ale konwerter go nie czyta. Bez opcji OCR.
  3. Jedna tabela → pobierz `.csv`. Wiele → ZIP. Brak → puste powodzenie; zmień źródło z warstwą tekstu.
  4. Otwórz w Excelu lub LibreOffice Calc i sprawdź cięcie. Czysta proza nie da pliku.

Ograniczenia i przypadki brzegowe

  • Wymaga zaznaczalnego tekstu i luk kolumn na podwójnych spacjach
  • Bez OCR; kontrolka zakresu stron nie działa
  • Nie odtwarza scalonych komórek ani stylów
  • Limit przesyłania na tej stronie: 500 MB na plik, wysyłane porcjami powyżej około 95 MB. Treść pojedynczego bezpośredniego żądania API jest ograniczona do 100 MB.

Przykłady

  • Tekstowy PDF z trójkolumnowym cennikiem często staje się jednym CSV tych kolumn
  • Zeskanowany wyciąg bankowy bez warstwy tekstu daje HTTP 204

Prywatność tego narzędzia

Pliki są przesyłane przez HTTPS, przetwarzane w pamięci lub w krótkotrwałym katalogu tymczasowym na naszych serwerach i usuwane, gdy wynik jest gotowy. Nie przechowujemy kopii do późniejszego przeglądania, trenowania ani profili reklamowych. Szczegóły retencji i pliki cookie AdSense znajdują się w polityce prywatności.

Najczęstsze pytania

Dlaczego nie ma CSV?
Nie znaleziono dwóch lub więcej kolejnych wierszy tabelarycznych. Skany, proza i tabele bez podwójnych spacji zawodzą heurystykę. API odpowiada 204 `no_content`.
Czy mogę najpierw OCR, a potem CSV?
Nie. OCR zwraca Markdown. To narzędzie czyta PDF tylko przez pdftotext.
Czym różni się od PDF na Excel?
Wykrywanie jest to samo. CSV: jeden plik na tabelę (jeden CSV albo ZIP). Excel: każda tabela na osobnym arkuszu jednego skoroszytu.
Czy czyta każdą stronę?
Tak. pdftotext dzieli po znakach nowej strony; każda strona jest skanowana. Pole zakresu stron nie jest czytane.

Ostatnia aktualizacja:

Wywołanie z kodu

Każde narzędzie na stronie to zwykły interfejs REST. Anonimowo nie trzeba konta ani klucza API. Działa w przeglądarce, u programistów i u agentów AI.

curl -X POST "https://pdf123.xyz/api/v1/convert/pdf/csv" \
  -F "[email protected]" \
  -F "pageNumbers=all" \
  -o output.pdf

Dostępne też jako narzędzie MCP dla klientów mówiących Model Context Protocol (JSON-RPC 2.0, POST /mcp). Pełna dokumentacja API

Użyj go z agentem AI

Skill

Z tym skillem Claude Code, Codex, Cursor i inne agenty AI mogą wykonać za Ciebie „PDF na CSV”: /skills/pdf123-pdf-to-csv.md

Wszystkie skille dla agentów

Pliki służą tylko do tego zadania i są potem automatycznie usuwane.