Към основното съдържание
PPDF123

Извлечете таблици от PDF в CSV

PDF към CSV намира подравнени редове на таблици в текста на PDF и записва всяка открита таблица като CSV файл; няколко таблици се връщат в ZIP. Изисква текстов слой и не връща нищо за проза или сканове.

Плъзнете файлове тук или кликнете, за да изберете

Приема PDF · до 500.0 MB на файл · до 20 файла наведнъж

Можете също да поставите файл с Ctrl/Cmd+V или от менюто на клипборда.

PDF към CSV пуска `pdftotext -layout`, търси редове с два или повече последователни интервала и ги записва като CSV. Всяка открита таблица става файл `{base}_pN_tM.csv`. Подходящо за електронни PDF, чиито колони вече са подравнени в извлечения текст.

Таблицата трябва да има поне два последователни реда, приличащи на таблица. Проза, само един ред заглавие или скан без текстов слой дават `no_content`: HTTP 204, без файл. Празният резултат е умишлен, не тих провал.

Инструментът игнорира параметрите на заявката. Полето за диапазон страници на страницата не се чете — сканира се всяка страница. Една таблица става един `text/csv`; няколко таблици се пакетират в ZIP `{base}_extracted.zip`. Колоните се режат по два или повече последователни интервала; единичните интервали в клетката остават. Полетата се цитират по RFC 4180.

Това не е OCR. Чисто изображенните сканове нямат съдържание за `pdftotext`. «OCR към Markdown» връща Markdown и не може да се подаде тук. Когато думите са само в пиксели, тук няма табличен файл.

«PDF към Excel» ползва същата евристика за макет. Excel слага таблиците в отделни листове на една работна книга. CSV дава по файл на таблица. Нито едното не възстановява обединени клетки, цветни заглавия или скрити листове.

Отворете изтеглянето в Excel или LibreOffice Calc и проверете няколко реда за разрез на колони. Плътни таблици без двойни интервали често падат в една колона. Файловете, защитени с парола, се отключват вместо вас на тази страница, щом въведете паролата; при API първо пуснете «Премахване на парола».

Качванията са временни. Не пазим CSV библиотека.

Възможности

  • `pdftotext -layout` плюс евристика с двойни интервали
  • По CSV на таблица; при няколко — ZIP; празно откриване — HTTP 204
  • Не е OCR; Markdown от OCR не се подава тук
  • Анонимен API: /api/v1/convert/pdf/csv

Кога да го използвате

  • Изваждане на електронна фактурна таблица към Excel или Calc
  • По отделен CSV на таблица от много страници
  • Вход за скриптове, които приемат само CSV

Как да извлека таблица от PDF в CSV?

  1. Качете PDF с избираем текст и таблично подравнени колони.
  2. Стартирайте обработката. Полето за диапазон страници съществува, но конверторът не го чете. Няма OCR опция.
  3. При една таблица изтеглете `.csv`. При няколко — ZIP. При никаква — празен успех; сменете източника с текстов слой.
  4. Отворете в Excel или LibreOffice Calc и проверете разреза. Чиста проза не дава файл.

Ограничения и крайни случаи

  • Иска избираем текст и двойни интервали между колони
  • Без OCR; контролът за диапазон страници не действа
  • Не възстановява обединени клетки и стилове
  • Ограничение за качване на този сайт: 500 MB на файл; над около 95 MB файлът се изпраща на части. Тялото на една пряка API заявка е ограничено до 100 MB.

Примери

  • Текстов PDF с триколонна ценова листа често става CSV с тези колони
  • Сканирано банково извлечение без текст слой дава HTTP 204

Поверителност при този инструмент

Файловете се качват по HTTPS, обработват се в паметта или в краткоживуща временна директория на нашите сървъри и се изтриват, щом резултатът е готов. Не задържаме копия за по-късен преглед, обучение на модели или рекламни профили. Сроковете за съхранение и обясненията за бисквитките на AdSense са в Политиката за поверителност.

Често задавани въпроси

Защо няма CSV?
Не са намерени два или повече последователни таблични реда. Сканове, проза и таблици без двойни интервали провалят евристиката. Интерфейсът отговаря 204 `no_content`.
Мога ли първо OCR, после CSV?
Не. OCR връща Markdown. Този инструмент чете PDF само през pdftotext.
Каква е разликата с PDF към Excel?
Откриването е същото. CSV е по файл на таблица (една таблица — един CSV; няколко — ZIP). Excel пише всяка таблица в отделен лист на една книга.
Чете ли всяка страница?
Да. pdftotext разделя по form feed и всяка страница се сканира за таблични блокове. Полето за диапазон на страницата не се чете.

Последна актуализация:

Извикване от код

Всеки инструмент е обикновен REST интерфейс. За анонимна употреба не трябват профил или API ключ. Работи еднакво в браузър, за разработчици и за AI агенти.

curl -X POST "https://pdf123.xyz/api/v1/convert/pdf/csv" \
  -F "[email protected]" \
  -F "pageNumbers=all" \
  -o output.pdf

Наличен е и като MCP инструмент за клиенти с Model Context Protocol (JSON-RPC 2.0 през POST /mcp). Пълна API документация

Използвайте го чрез AI агент

Скил

С този скил Claude Code, Codex, Cursor и други AI агенти могат да изпълнят „PDF към CSV“ вместо вас: /skills/pdf123-pdf-to-csv.md

Всички скилове за агенти

Файловете служат само за тази обработка и после се изтриват автоматично.