Перейти к основному содержимому
PPDF123

Преобразование таблиц PDF в Excel

«PDF в Excel» находит выровненные строки таблиц в тексте PDF и записывает каждую таблицу на отдельный лист книги .xlsx. Нужен текстовый слой; для сплошного текста и отсканированных страниц результата не будет.

Перетащите файлы сюда или нажмите, чтобы выбрать

Форматы: PDF · до 500.0 MB на файл · до 20 файлов за раз

Файл можно также вставить через Ctrl/Cmd+V или из меню буфера обмена.

PDF в Excel запускает `pdftotext -layout`, ищет строки с двумя и более пробелами подряд и пишет эти ряды в книгу `.xlsx`. Каждая найденная таблица становится листом `Page N` или `Page N Table M`. Подходит для цифровых PDF, где колонки уже выровнены в извлечённом тексте.

Таблице нужны хотя бы две табличные строки подряд. Проза, одна строка заголовка или скан без текстового слоя дают `no_content`: книги нет. Пустой результат намеренный, не тихий сбой.

Параметры запроса игнорируются. Поля диапазона страниц на этой странице нет. Колонки режутся по сериям из двух и более пробелов; один пробел внутри ячейки остаётся в ячейке.

Это не OCR. У чисто графического скана `pdftotext` нечего читать. OCR на этом сайте возвращает Markdown и не может быть снова отправлен в PDF в Excel. Если знаки есть только в пикселях, таблицы здесь не будет.

PDF в CSV использует ту же эвристику вёрстки. Одна таблица становится одним CSV; несколько — ZIP из CSV. Excel держит эти таблицы листами одной книги. Ни то ни другое не восстанавливает из PDF объединённые ячейки, цветные шапки или скрытые листы.

Откройте скачивание в Excel или LibreOffice Calc и проверьте разрезы колонок на нескольких строках. Плотные таблицы без зазора в два пробела часто падают в одну колонку. Файлы, защищённые паролем, снимаются с защиты прямо на этой странице, как только вы введёте пароль; при работе через API сначала запустите «Снять пароль».

Правило двух пробелов — это весь механизм обнаружения, поэтому качество книги целиком зависит от того, как свёрстан PDF. Таблицы из генераторов отчётов, дополняющих каждую ячейку до фиксированной ширины, извлекаются чисто. Таблицы с одним пробелом между колонками или с пропорциональным шрифтом, при котором колонки стоят почти вплотную, вообще не распознаются как таблицы и могут не дать книги. Прежде чем винить инструмент, выделите строку в PDF и убедитесь, что текст вообще выделяется.

Имена листов следуют позиции, а не содержанию. Каждый найденный блок становится `Page N` или `Page N Table M` в порядке сканирования страниц. Отчёт с одной таблицей на странице даёт по листу на страницу; страница с тремя таблицами подряд даёт три нумерованных листа. Нет ни опции называть листы по ячейке заголовка, ни объединённого вывода на одном листе.

Значения записываются как текст, в точности как они выглядели в извлечении с сохранением вёрстки. Числа не преобразуются в числовые ячейки, поэтому ведущие нули сохраняются, а символы валют и разделители тысяч остаются в строке. Для номеров счетов и почтовых индексов это обычно то, что нужно, а для колонки сумм, которые вы собираетесь складывать, слегка мешает. Либо преобразуйте типы в таблице, либо скопируйте колонку и используйте «текст по столбцам» или преобразование значений в целевой программе.

Строки не дедуплицируются, а повторяющиеся заголовки не удаляются. Когда таблица разрывается на границе страницы, строка заголовка часто повторяется на следующей странице, и продолжение становится отдельным листом. Объединённые ячейки не восстанавливаются; ячейка, занимавшая в PDF две колонки, просто содержит текст в самой левой колонке, а правая остаётся пустой. Многострочные ячейки становятся отдельными строками, а не одним перенесённым значением.

Загрузки временные. Библиотеку ваших книг мы не храним.

Функции

  • `pdftotext -layout` плюс эвристика колонок по двум пробелам
  • Один лист на найденную таблицу; пустое обнаружение не отдаёт файл
  • Не OCR; Markdown с OCR сюда отправить нельзя
  • Ячейки в текстовом формате; без вывода типов и восстановления объединённых ячеек
  • Анонимный API: /api/v1/convert/pdf/xlsx

Когда применять

  • Открыть извлечённые таблицы сразу в Excel или LibreOffice Calc
  • Перенести таблицу цифровой накладной в книгу
  • Держать таблицы с нескольких страниц листами, а не одним CSV
  • Извлечь финансовый отчёт фиксированной ширины для дальнейшего анализа

Как преобразовать таблицу PDF в Excel?

  1. Загрузите PDF с выделяемым текстом и колонками в виде таблицы.
  2. Нажмите «Обработать». Параметров страниц или OCR у этого инструмента нет.
  3. Если таблицы найдены — скачайте `.xlsx`. Если нет — успех приходит пустым; попробуйте источник с текстовым слоем.
  4. Откройте книгу и проверьте разрезы. Чисто прозаические PDF листов не дадут.

Ограничения и особые случаи

  • Нужен выделяемый текст и зазор колонок в два пробела
  • Нет OCR и нет выбора диапазона страниц
  • Объединённые ячейки и стили не восстанавливаются
  • Все значения — текст; без числового и датового типа
  • Таблицы, идущие через страницы, становятся отдельными листами
  • Лимит загрузки на сайте: 500 МБ на файл, файлы крупнее примерно 95 МБ отправляются частями. Тело одного прямого запроса к API ограничено 100 МБ.

Примеры

  • Текстовый PDF с трёхколоночным прайсом часто становится листом этих колонок
  • Отсканированная банковская выписка без текстового слоя книгу не вернёт
  • Отчёт на десять страниц с одной таблицей на странице даёт десять листов от Page 1 до Page 10

Конфиденциальность этого инструмента

Файлы загружаются по HTTPS, обрабатываются в памяти или в короткоживущем временном каталоге на наших серверах и удаляются, когда результат готов. Копии для последующего просмотра, обучения моделей или рекламных профилей мы не храним. Сроки хранения и сведения о cookie AdSense указаны в Политике конфиденциальности.

Частые вопросы

Почему я не получил электронную таблицу?
Не найден блок из двух и более табличных строк подряд. Сканы, проза и таблицы без зазора в два пробела эту эвристику не проходят.
Можно сначала OCR, потом Excel?
Нет. OCR возвращает Markdown. Этот инструмент читает PDF только через pdftotext.
Чем это отличается от PDF в CSV?
Обнаружение одинаковое. Excel пишет каждую таблицу на свой лист одной книги. CSV — один файл на таблицу (один CSV или ZIP, если таблиц несколько).
Читаются ли все страницы?
Да. pdftotext делит страницы по form feed. На каждой ищутся табличные блоки. Параметра диапазона страниц нет.
Почему мои числа сохраняются как текст?
Значения записываются в точности как извлечены, поэтому ведущие нули и форматирование сохраняются. Преобразуйте колонку в числовую в таблице, если хотите считать с ней.
Восстанавливаются ли объединённые ячейки?
Нет. Текст объединённой ячейки попадает в самую левую колонку, остальные остаются пустыми. Многострочные ячейки становятся отдельными строками, а не одним перенесённым значением.
Почему для одной таблицы у меня несколько листов?
Таблица, продолжающаяся на новой странице, обнаруживается там снова и становится ещё одним листом. Строки заголовка часто повторяются; инструмент не объединяет фрагменты.

Последнее обновление:

Вызов из кода

Каждый инструмент на сайте: обычный REST. Анонимно не нужны ни аккаунт, ни ключ API. И для браузера, и для разработчиков, и для ИИ-агентов.

curl -X POST "https://pdf123.xyz/api/v1/convert/pdf/xlsx" \
  -F "[email protected]" \
  -o output.pdf

Есть и как MCP-инструмент для клиентов на Model Context Protocol (JSON-RPC 2.0, POST /mcp). Полное описание API

Использовать через ИИ-агента

Скилл

С этим скиллом Claude Code, Codex, Cursor и другие ИИ-агенты смогут выполнить «PDF в Excel» за вас: /skills/pdf123-pdf-to-xlsx.md

Все скиллы для агентов

Файлы нужны только для этой обработки и потом удаляются.