Към основното съдържание
PPDF123

Превърнете таблици от PDF в Excel

PDF към Excel намира подравнени редове на таблици в текста на PDF и записва всяка таблица в отделен лист на .xlsx работна книга. Изисква текстов слой и не връща нищо за проза или сканирани страници.

Плъзнете файлове тук или кликнете, за да изберете

Приема PDF · до 500.0 MB на файл · до 20 файла наведнъж

Можете също да поставите файл с Ctrl/Cmd+V или от менюто на клипборда.

PDF към Excel пуска `pdftotext -layout`, търси редове с два или повече последователни интервала и ги записва в `.xlsx` работна книга. Всяка открита таблица става лист с име `Page N` или `Page N Table M`. Подходящо за електронни PDF с вече подравнени колони в извлечения текст.

Таблицата трябва да има поне два последователни реда, приличащи на таблица. Проза, само един ред заглавие или скан без текстов слой дават `no_content`: без работна книга. Празният резултат е умишлен, не тих провал.

Инструментът игнорира параметрите на заявката. На страницата няма поле за диапазон страници. Колоните се режат по два или повече последователни интервала; единичните интервали в клетката остават.

Това не е OCR. Чисто изображенните сканове нямат съдържание за `pdftotext`. OCR на този сайт връща Markdown, който не може да се подаде обратно в PDF към Excel. Когато думите са само в пиксели, тук няма електронна таблица.

«PDF към CSV» ползва същата евристика. Една таблица става един CSV; няколко — ZIP с CSV. Excel слага тези таблици в отделни листове на една книга. Нито едното не възстановява обединени клетки, цветни заглавия или скрити листове.

Отворете изтеглянето в Excel или LibreOffice Calc и проверете няколко реда. Плътни таблици без двойни интервали често падат в една колона. Файловете, защитени с парола, се отключват вместо вас на тази страница, щом въведете паролата; при API първо пуснете «Премахване на парола».

Правилото за двата интервала е целият механизъм за откриване, затова качеството на книгата зависи изцяло от това как е набрано PDF. Таблиците от генератори на отчети, които допълват всяка клетка до фиксирана ширина, се извличат чисто. Таблици с един интервал между колоните или с пропорционален шрифт, който доближава колоните почти една до друга, изобщо не се разпознават като таблици и може да не дадат книга. Преди да обвините инструмента, маркирайте ред от PDF и потвърдете, че текстът изобщо е избираем.

Имената на листовете следват позицията, не съдържанието. Всеки открит блок става `Page N` или `Page N Table M` в реда на сканиране на страниците. Отчет с по една таблица на страница дава по един лист на страница; страница с три подредени таблици дава три номерирани листа. Няма опция листовете да се именуват по клетка от заглавието и няма обединен изход в един лист.

Стойностите се записват като текст, точно както са се появили в извличането със запазен изглед. Числата не се преобразуват в числови клетки, затова водещите нули оцеляват, а символите за валута и разделителите на хиляди остават в низа. Това обикновено е желателно за номера на сметки и пощенски кодове, но леко досадно за колона със суми, които смятате да събирате. Или преобразувайте типовете в таблицата, или копирайте колоната и използвайте „текст към колони“ или преобразуване на стойности в целевата програма.

Редовете не се дедублират и повтарящите се заглавия не се премахват. Когато таблица се скъса на граница между страници, редът на заглавието често се повтаря на следващата страница и продължението става отделен лист. Обединените клетки не се възстановяват; клетка, обхващала две колони в PDF, просто има текста си в най-лявата колона, а дясната остава празна. Многоредовите клетки стават отделни редове, а не една пренасяна стойност.

Качванията са временни. Не пазим библиотека с работни книги.

Възможности

  • `pdftotext -layout` плюс евристика с двойни интервали
  • По лист на открита таблица; празно откриване — без файл
  • Не е OCR; Markdown от OCR не се подава тук
  • Текстови клетки; без извеждане на типове и без възстановяване на обединени клетки
  • Анонимен API: /api/v1/convert/pdf/xlsx

Кога да го използвате

  • Извлечени таблици директно в Excel или LibreOffice Calc
  • Електронна фактурна таблица в работна книга
  • По лист на таблица от много страници вместо един CSV
  • Извличане на финансов отчет с фиксирана ширина за допълнителен анализ

Как да превърна таблица от PDF в Excel?

  1. Качете PDF с избираем текст и таблично подравнени колони.
  2. Стартирайте обработката. Няма диапазон страници или OCR опция.
  3. При намерени таблици изтеглете `.xlsx`. При никакви — празен успех; опитайте източник с текстов слой.
  4. Отворете книгата и проверете разреза. Чиста проза не дава листове.

Ограничения и крайни случаи

  • Иска избираем текст и двойни интервали между колони
  • Без OCR и без контрол за диапазон страници
  • Обединени клетки и стилове не се възстановяват
  • Всички стойности са текст; без цифров или датов тип
  • Таблиците през няколко страници стават отделни листове
  • Ограничение за качване на този сайт: 500 MB на файл; над около 95 MB файлът се изпраща на части. Тялото на една пряка API заявка е ограничено до 100 MB.

Примери

  • Текстов PDF с триколонна ценова листа често става лист с тези колони
  • Сканирано банково извлечение без текстов слой не връща книга
  • Отчет от десет страници с по една таблица на страница дава десет листа от Page 1 до Page 10

Поверителност при този инструмент

Файловете се качват по HTTPS, обработват се в паметта или в краткоживуща временна директория на нашите сървъри и се изтриват, щом резултатът е готов. Не задържаме копия за по-късен преглед, обучение на модели или рекламни профили. Сроковете за съхранение и обясненията за бисквитките на AdSense са в Политиката за поверителност.

Често задавани въпроси

Защо няма електронна таблица?
Не е намерен блок от два или повече последователни таблични реда. Сканове, проза и таблици без двойни интервали провалят евристиката.
Мога ли първо OCR, после Excel?
Не. OCR връща Markdown. Този инструмент чете PDF само през pdftotext.
Каква е разликата с PDF към CSV?
Откриването е същото. Excel пише всяка таблица в отделен лист на една книга. CSV е по файл на таблица (една — един CSV; няколко — ZIP).
Чете ли всяка страница?
Да. pdftotext разделя по form feed. Всяка страница се сканира за таблични блокове. Няма параметър за диапазон.
Защо числата ми се запазват като текст?
Стойностите се записват точно както са извлечени, затова водещите нули и форматирането оцеляват. Преобразувайте колоната в числова в таблицата, ако искате да смятате с нея.
Възстановяват ли се обединените клетки?
Не. Текстът на обединена клетка отива в най-лявата колона, а останалите остават празни. Многоредовите клетки стават отделни редове, а не една пренасяна стойност.
Защо имам няколко листа за една таблица?
Таблица, която продължава на нова страница, се открива отново там и става още един лист. Редовете заглавие често се повтарят; инструментът не слива фрагментите.

Последна актуализация:

Извикване от код

Всеки инструмент е обикновен REST интерфейс. За анонимна употреба не трябват профил или API ключ. Работи еднакво в браузър, за разработчици и за AI агенти.

curl -X POST "https://pdf123.xyz/api/v1/convert/pdf/xlsx" \
  -F "[email protected]" \
  -o output.pdf

Наличен е и като MCP инструмент за клиенти с Model Context Protocol (JSON-RPC 2.0 през POST /mcp). Пълна API документация

Използвайте го чрез AI агент

Скил

С този скил Claude Code, Codex, Cursor и други AI агенти могат да изпълнят „PDF към Excel“ вместо вас: /skills/pdf123-pdf-to-xlsx.md

Всички скилове за агенти

Файловете служат само за тази обработка и после се изтриват автоматично.