Витягання таблиць із PDF у CSV
PDF у CSV знаходить у тексті PDF вирівняні рядки таблиць і записує кожну знайдену таблицю як файл CSV; кілька таблиць повертаються в ZIP. Потрібен текстовий шар; для суцільного тексту чи сканів нічого не виходить.
Перетягніть файли сюди або натисніть, щоб вибрати
Формати: PDF · до 500.0 MB на файл · до 20 файлів за раз
Файл також можна вставити через Ctrl/Cmd+V або з меню буфера обміну.
PDF у CSV запускає `pdftotext -layout`, шукає рядки з двома й більше пробілами поспіль і записує ці рядки в CSV. Кожна знайдена таблиця стає файлом `{base}_pN_tM.csv`. Для електронних PDF, де колонки вже вирівняні у витягнутому тексті.
Таблиця потребує щонайменше двох підряд рядків «як таблиця». Проза, один рядок заголовка або скан без текстового шару дають `no_content`: HTTP 204 без файлу. Порожній результат навмисний, не тиха помилка.
Параметри запиту ігноруються. Поле діапазону сторінок на цій сторінці не читається — скануються всі сторінки. Одна таблиця — один `text/csv`; кілька — ZIP `{base}_extracted.zip`. Колонки ріжуться за двома+ пробілами; одинарні пробіли в комірці лишаються. Поля в лапках за RFC 4180.
Це не OCR. Суто зображений скан не має вмісту для `pdftotext`. OCR на сайті повертає Markdown і не подається знову в «PDF у CSV». Коли літери лише в пікселях, табличного файлу тут не буде.
«PDF у Excel» використовує ту саму евристику макета. Excel кладе таблиці на аркуші однієї книги. CSV — окремий файл на таблицю. Жоден не відновлює з PDF об’єднані комірки, кольорові заголовки чи приховані аркуші.
Відкрийте завантаження в Excel або LibreOffice Calc і перевірте розріз колонок на кількох рядках. Щільні таблиці без подвійних пробілів часто падають в одну колонку. Файли, захищені паролем, на цій сторінці розблоковуються за вас, щойно ви введете пароль; виклики через API спочатку виконують «Зняти пароль».
Вивантаження тимчасові. Бібліотеки CSV ми не зберігаємо.
Що вміє
- `pdftotext -layout` плюс евристика розрізу за подвійними пробілами
- Одна CSV на таблицю; кілька — ZIP; порожньо — HTTP 204
- Не OCR; Markdown з OCR сюди не подається
- Анонімний API: /api/v1/convert/pdf/csv
Коли брати цей інструмент
- Витягнути вирівняні таблиці звітів у CSV
- Підготувати дані для імпорту без OCR
- Швидко перевірити наявність табличної структури
Як витягти таблицю з PDF у CSV?
- Вивантажте електронний PDF із вирівняними колонками в тексті.
- Натисніть «Обробити». Діапазон сторінок не читається.
- Завантажте CSV або ZIP.
- Перевірте розріз колонок у табличному редакторі.
Обмеження і межі
- Не OCR
- Параметри/діапазон сторінок ігноруються
- Щільні таблиці часто в одній колонці
- Обмеження завантаження на цьому сайті: 500 МБ на файл; якщо файл більший за приблизно 95 МБ, він надсилається частинами. Тіло одного прямого запиту до API — не більше 100 МБ.
Приклади
- Дві таблиці → ZIP із двома CSV
- Скан без тексту → 204
Приватність цього інструмента
Файли надсилаються через HTTPS, обробляються в оперативній пам’яті або в короткочасному тимчасовому каталозі на наших серверах і видаляються, щойно результат готовий. Копій для подальшого перегляду, навчання моделей чи рекламних профілів ми не зберігаємо. Строки зберігання та відомості про файли cookie AdSense наведені в Політиці конфіденційності.
Часті запитання
- Чому HTTP 204?
- Не знайдено рядків, схожих на таблицю. Це навмисний no_content.
- Чи це OCR?
- Ні. Скани без тексту тут порожні.
- Чим відрізняється від Excel?
- Та сама евристика; CSV — файли, Excel — аркуші однієї книги.
- Чому все в одній колонці?
- Немає подвійних пробілів між колонками у витягнутому тексті.
Востаннє оновлено:
Виклик із коду
Кожен інструмент на сайті - звичайний REST-інтерфейс. Для анонімної роботи не потрібні обліковий запис чи ключ API. І для браузера, і для розробників, і для програмних агентів.
curl -X POST "https://pdf123.xyz/api/v1/convert/pdf/csv" \
-F "[email protected]" \
-F "pageNumbers=all" \
-o output.pdfТакож є як MCP-інструмент для клієнтів із Model Context Protocol (JSON-RPC 2.0 через POST /mcp). Повний довідник API
Використати через ШІ-агента
СкілЗ цим скілом Claude Code, Codex, Cursor та інші ШІ-агенти зможуть виконати «PDF у CSV» замість вас: /skills/pdf123-pdf-to-csv.md
Файли потрібні лише для цієї обробки й потім стираються самі.