Извлечение таблиц из PDF в CSV
«PDF в CSV» находит выровненные строки таблиц в тексте PDF и записывает каждую найденную таблицу файлом CSV; несколько таблиц возвращаются в ZIP. Нужен текстовый слой; для сплошного текста и сканов результата не будет.
Перетащите файлы сюда или нажмите, чтобы выбрать
Форматы: PDF · до 500.0 MB на файл · до 20 файлов за раз
Файл можно также вставить через Ctrl/Cmd+V или из меню буфера обмена.
PDF в CSV запускает `pdftotext -layout`, ищет строки с двумя и более пробелами подряд и пишет эти строки в CSV. Каждая найденная таблица становится файлом `{base}_pN_tM.csv`. Подходит для цифровых PDF, где колонки уже выровнены в извлечённом тексте.
Таблице нужны хотя бы две табличные строки подряд. Проза, одна строка заголовка или скан без текстового слоя дают `no_content`: HTTP 204 без файла. Пустой результат намеренный, не тихий сбой.
Параметры запроса игнорируются. Поле диапазона страниц на этой странице не читается — сканируется всё. Одна таблица — `text/csv`; несколько — ZIP `{base}_extracted.zip`. Колонки режутся по сериям из двух и более пробелов; один пробел внутри ячейки остаётся в ячейке. Поля в кавычках по RFC 4180.
Это не OCR. У чисто графического скана `pdftotext` нечего читать. OCR на этом сайте возвращает Markdown; его нельзя снова отправить в PDF в CSV. Если знаки есть только в пикселях, табличного файла здесь не будет.
PDF в Excel использует ту же эвристику вёрстки. Excel кладёт таблицы на листы одной книги. CSV пишет один файл на таблицу. Ни то ни другое не восстанавливает из PDF объединённые ячейки, цветные шапки или скрытые листы.
Откройте скачивание в Excel или LibreOffice Calc и проверьте разрезы колонок на нескольких строках. Плотные таблицы без зазора в два пробела часто падают в одну колонку. Файлы, защищённые паролем, снимаются с защиты прямо на этой странице, как только вы введёте пароль; при работе через API сначала запустите «Снять пароль».
Загрузки временные. Библиотеку ваших CSV мы не храним.
Функции
- `pdftotext -layout` плюс эвристика колонок по двум пробелам
- Один CSV на таблицу; несколько — ZIP; если ничего не найдено — HTTP 204
- Не OCR; Markdown с OCR сюда не входит
- Анонимный API: /api/v1/convert/pdf/csv
Когда применять
- Перенести таблицу цифровой накладной в Excel или LibreOffice Calc
- Получить по CSV на таблицу в многостраничном документе, а не один лист
- Подать вход скрипту, который принимает только CSV
Как извлечь таблицу из PDF в CSV?
- Загрузите PDF с выделяемым текстом и колонками, уже видимыми в извлечённом тексте.
- Нажмите «Обработать». Поле диапазона страниц есть, но конвертер его не читает. Опции OCR нет.
- Если таблица одна — скачайте `.csv`. Если несколько — ZIP. Если нет — успех приходит пустым; возьмите источник с текстовым слоем.
- Откройте файл в Excel или LibreOffice Calc и проверьте разрезы. PDF из одной прозы файла не даст.
Ограничения и особые случаи
- Нужен выделяемый текст и зазор колонок в два пробела
- Нет OCR; контроль диапазона страниц не действует
- Не восстанавливает объединённые ячейки и стили
- Лимит загрузки на сайте: 500 МБ на файл, файлы крупнее примерно 95 МБ отправляются частями. Тело одного прямого запроса к API ограничено 100 МБ.
Примеры
- Текстовый PDF с прайсом в три колонки часто даёт CSV с этими колонками
- Отсканированная банковская выписка без текстового слоя даёт HTTP 204
Конфиденциальность этого инструмента
Файлы загружаются по HTTPS, обрабатываются в памяти или в короткоживущем временном каталоге на наших серверах и удаляются, когда результат готов. Копии для последующего просмотра, обучения моделей или рекламных профилей мы не храним. Сроки хранения и сведения о cookie AdSense указаны в Политике конфиденциальности.
Частые вопросы
- Почему нет CSV?
- Не нашлось хотя бы двух табличных строк подряд. Сканы, проза и таблицы без зазора в два пробела проваливают эту эвристику. API отвечает 204 `no_content`.
- Можно сначала OCR, потом CSV?
- Нет. OCR возвращает Markdown. Этот инструмент читает PDF только через pdftotext.
- Чем это отличается от PDF в Excel?
- Обнаружение одинаковое. CSV — один файл на таблицу: одна таблица даёт один CSV, несколько — ZIP. Excel пишет каждую таблицу на свой лист одной книги.
- Читаются ли все страницы?
- Да. pdftotext делит страницы по form feed; на каждой ищутся табличные блоки. Поле диапазона страниц на этой странице не читается.
Последнее обновление:
Вызов из кода
Каждый инструмент на сайте: обычный REST. Анонимно не нужны ни аккаунт, ни ключ API. И для браузера, и для разработчиков, и для ИИ-агентов.
curl -X POST "https://pdf123.xyz/api/v1/convert/pdf/csv" \
-F "[email protected]" \
-F "pageNumbers=all" \
-o output.pdfЕсть и как MCP-инструмент для клиентов на Model Context Protocol (JSON-RPC 2.0, POST /mcp). Полное описание API
Использовать через ИИ-агента
СкиллС этим скиллом Claude Code, Codex, Cursor и другие ИИ-агенты смогут выполнить «PDF в CSV» за вас: /skills/pdf123-pdf-to-csv.md
Файлы нужны только для этой обработки и потом удаляются.