Извлечете таблици от PDF в CSV
PDF към CSV намира подравнени редове на таблици в текста на PDF и записва всяка открита таблица като CSV файл; няколко таблици се връщат в ZIP. Изисква текстов слой и не връща нищо за проза или сканове.
Плъзнете файлове тук или кликнете, за да изберете
Приема PDF · до 500.0 MB на файл · до 20 файла наведнъж
Можете също да поставите файл с Ctrl/Cmd+V или от менюто на клипборда.
PDF към CSV пуска `pdftotext -layout`, търси редове с два или повече последователни интервала и ги записва като CSV. Всяка открита таблица става файл `{base}_pN_tM.csv`. Подходящо за електронни PDF, чиито колони вече са подравнени в извлечения текст.
Таблицата трябва да има поне два последователни реда, приличащи на таблица. Проза, само един ред заглавие или скан без текстов слой дават `no_content`: HTTP 204, без файл. Празният резултат е умишлен, не тих провал.
Инструментът игнорира параметрите на заявката. Полето за диапазон страници на страницата не се чете — сканира се всяка страница. Една таблица става един `text/csv`; няколко таблици се пакетират в ZIP `{base}_extracted.zip`. Колоните се режат по два или повече последователни интервала; единичните интервали в клетката остават. Полетата се цитират по RFC 4180.
Това не е OCR. Чисто изображенните сканове нямат съдържание за `pdftotext`. «OCR към Markdown» връща Markdown и не може да се подаде тук. Когато думите са само в пиксели, тук няма табличен файл.
«PDF към Excel» ползва същата евристика за макет. Excel слага таблиците в отделни листове на една работна книга. CSV дава по файл на таблица. Нито едното не възстановява обединени клетки, цветни заглавия или скрити листове.
Отворете изтеглянето в Excel или LibreOffice Calc и проверете няколко реда за разрез на колони. Плътни таблици без двойни интервали често падат в една колона. Файловете, защитени с парола, се отключват вместо вас на тази страница, щом въведете паролата; при API първо пуснете «Премахване на парола».
Качванията са временни. Не пазим CSV библиотека.
Възможности
- `pdftotext -layout` плюс евристика с двойни интервали
- По CSV на таблица; при няколко — ZIP; празно откриване — HTTP 204
- Не е OCR; Markdown от OCR не се подава тук
- Анонимен API: /api/v1/convert/pdf/csv
Кога да го използвате
- Изваждане на електронна фактурна таблица към Excel или Calc
- По отделен CSV на таблица от много страници
- Вход за скриптове, които приемат само CSV
Как да извлека таблица от PDF в CSV?
- Качете PDF с избираем текст и таблично подравнени колони.
- Стартирайте обработката. Полето за диапазон страници съществува, но конверторът не го чете. Няма OCR опция.
- При една таблица изтеглете `.csv`. При няколко — ZIP. При никаква — празен успех; сменете източника с текстов слой.
- Отворете в Excel или LibreOffice Calc и проверете разреза. Чиста проза не дава файл.
Ограничения и крайни случаи
- Иска избираем текст и двойни интервали между колони
- Без OCR; контролът за диапазон страници не действа
- Не възстановява обединени клетки и стилове
- Ограничение за качване на този сайт: 500 MB на файл; над около 95 MB файлът се изпраща на части. Тялото на една пряка API заявка е ограничено до 100 MB.
Примери
- Текстов PDF с триколонна ценова листа често става CSV с тези колони
- Сканирано банково извлечение без текст слой дава HTTP 204
Поверителност при този инструмент
Файловете се качват по HTTPS, обработват се в паметта или в краткоживуща временна директория на нашите сървъри и се изтриват, щом резултатът е готов. Не задържаме копия за по-късен преглед, обучение на модели или рекламни профили. Сроковете за съхранение и обясненията за бисквитките на AdSense са в Политиката за поверителност.
Често задавани въпроси
- Защо няма CSV?
- Не са намерени два или повече последователни таблични реда. Сканове, проза и таблици без двойни интервали провалят евристиката. Интерфейсът отговаря 204 `no_content`.
- Мога ли първо OCR, после CSV?
- Не. OCR връща Markdown. Този инструмент чете PDF само през pdftotext.
- Каква е разликата с PDF към Excel?
- Откриването е същото. CSV е по файл на таблица (една таблица — един CSV; няколко — ZIP). Excel пише всяка таблица в отделен лист на една книга.
- Чете ли всяка страница?
- Да. pdftotext разделя по form feed и всяка страница се сканира за таблични блокове. Полето за диапазон на страницата не се чете.
Последна актуализация:
Извикване от код
Всеки инструмент е обикновен REST интерфейс. За анонимна употреба не трябват профил или API ключ. Работи еднакво в браузър, за разработчици и за AI агенти.
curl -X POST "https://pdf123.xyz/api/v1/convert/pdf/csv" \
-F "[email protected]" \
-F "pageNumbers=all" \
-o output.pdfНаличен е и като MCP инструмент за клиенти с Model Context Protocol (JSON-RPC 2.0 през POST /mcp). Пълна API документация
Използвайте го чрез AI агент
СкилС този скил Claude Code, Codex, Cursor и други AI агенти могат да изпълнят „PDF към CSV“ вместо вас: /skills/pdf123-pdf-to-csv.md
Файловете служат само за тази обработка и после се изтриват автоматично.