Перейти до основного вмісту
PPDF123

Витягання таблиць із PDF у CSV

PDF у CSV знаходить у тексті PDF вирівняні рядки таблиць і записує кожну знайдену таблицю як файл CSV; кілька таблиць повертаються в ZIP. Потрібен текстовий шар; для суцільного тексту чи сканів нічого не виходить.

Перетягніть файли сюди або натисніть, щоб вибрати

Формати: PDF · до 500.0 MB на файл · до 20 файлів за раз

Файл також можна вставити через Ctrl/Cmd+V або з меню буфера обміну.

PDF у CSV запускає `pdftotext -layout`, шукає рядки з двома й більше пробілами поспіль і записує ці рядки в CSV. Кожна знайдена таблиця стає файлом `{base}_pN_tM.csv`. Для електронних PDF, де колонки вже вирівняні у витягнутому тексті.

Таблиця потребує щонайменше двох підряд рядків «як таблиця». Проза, один рядок заголовка або скан без текстового шару дають `no_content`: HTTP 204 без файлу. Порожній результат навмисний, не тиха помилка.

Параметри запиту ігноруються. Поле діапазону сторінок на цій сторінці не читається — скануються всі сторінки. Одна таблиця — один `text/csv`; кілька — ZIP `{base}_extracted.zip`. Колонки ріжуться за двома+ пробілами; одинарні пробіли в комірці лишаються. Поля в лапках за RFC 4180.

Це не OCR. Суто зображений скан не має вмісту для `pdftotext`. OCR на сайті повертає Markdown і не подається знову в «PDF у CSV». Коли літери лише в пікселях, табличного файлу тут не буде.

«PDF у Excel» використовує ту саму евристику макета. Excel кладе таблиці на аркуші однієї книги. CSV — окремий файл на таблицю. Жоден не відновлює з PDF об’єднані комірки, кольорові заголовки чи приховані аркуші.

Відкрийте завантаження в Excel або LibreOffice Calc і перевірте розріз колонок на кількох рядках. Щільні таблиці без подвійних пробілів часто падають в одну колонку. Файли, захищені паролем, на цій сторінці розблоковуються за вас, щойно ви введете пароль; виклики через API спочатку виконують «Зняти пароль».

Вивантаження тимчасові. Бібліотеки CSV ми не зберігаємо.

Що вміє

  • `pdftotext -layout` плюс евристика розрізу за подвійними пробілами
  • Одна CSV на таблицю; кілька — ZIP; порожньо — HTTP 204
  • Не OCR; Markdown з OCR сюди не подається
  • Анонімний API: /api/v1/convert/pdf/csv

Коли брати цей інструмент

  • Витягнути вирівняні таблиці звітів у CSV
  • Підготувати дані для імпорту без OCR
  • Швидко перевірити наявність табличної структури

Як витягти таблицю з PDF у CSV?

  1. Вивантажте електронний PDF із вирівняними колонками в тексті.
  2. Натисніть «Обробити». Діапазон сторінок не читається.
  3. Завантажте CSV або ZIP.
  4. Перевірте розріз колонок у табличному редакторі.

Обмеження і межі

  • Не OCR
  • Параметри/діапазон сторінок ігноруються
  • Щільні таблиці часто в одній колонці
  • Обмеження завантаження на цьому сайті: 500 МБ на файл; якщо файл більший за приблизно 95 МБ, він надсилається частинами. Тіло одного прямого запиту до API — не більше 100 МБ.

Приклади

  • Дві таблиці → ZIP із двома CSV
  • Скан без тексту → 204

Приватність цього інструмента

Файли надсилаються через HTTPS, обробляються в оперативній пам’яті або в короткочасному тимчасовому каталозі на наших серверах і видаляються, щойно результат готовий. Копій для подальшого перегляду, навчання моделей чи рекламних профілів ми не зберігаємо. Строки зберігання та відомості про файли cookie AdSense наведені в Політиці конфіденційності.

Часті запитання

Чому HTTP 204?
Не знайдено рядків, схожих на таблицю. Це навмисний no_content.
Чи це OCR?
Ні. Скани без тексту тут порожні.
Чим відрізняється від Excel?
Та сама евристика; CSV — файли, Excel — аркуші однієї книги.
Чому все в одній колонці?
Немає подвійних пробілів між колонками у витягнутому тексті.

Востаннє оновлено:

Виклик із коду

Кожен інструмент на сайті - звичайний REST-інтерфейс. Для анонімної роботи не потрібні обліковий запис чи ключ API. І для браузера, і для розробників, і для програмних агентів.

curl -X POST "https://pdf123.xyz/api/v1/convert/pdf/csv" \
  -F "[email protected]" \
  -F "pageNumbers=all" \
  -o output.pdf

Також є як MCP-інструмент для клієнтів із Model Context Protocol (JSON-RPC 2.0 через POST /mcp). Повний довідник API

Використати через ШІ-агента

Скіл

З цим скілом Claude Code, Codex, Cursor та інші ШІ-агенти зможуть виконати «PDF у CSV» замість вас: /skills/pdf123-pdf-to-csv.md

Усі скіли для агентів

Файли потрібні лише для цієї обробки й потім стираються самі.