Превърнете таблици от PDF в Excel
PDF към Excel намира подравнени редове на таблици в текста на PDF и записва всяка таблица в отделен лист на .xlsx работна книга. Изисква текстов слой и не връща нищо за проза или сканирани страници.
Плъзнете файлове тук или кликнете, за да изберете
Приема PDF · до 500.0 MB на файл · до 20 файла наведнъж
Можете също да поставите файл с Ctrl/Cmd+V или от менюто на клипборда.
PDF към Excel пуска `pdftotext -layout`, търси редове с два или повече последователни интервала и ги записва в `.xlsx` работна книга. Всяка открита таблица става лист с име `Page N` или `Page N Table M`. Подходящо за електронни PDF с вече подравнени колони в извлечения текст.
Таблицата трябва да има поне два последователни реда, приличащи на таблица. Проза, само един ред заглавие или скан без текстов слой дават `no_content`: без работна книга. Празният резултат е умишлен, не тих провал.
Инструментът игнорира параметрите на заявката. На страницата няма поле за диапазон страници. Колоните се режат по два или повече последователни интервала; единичните интервали в клетката остават.
Това не е OCR. Чисто изображенните сканове нямат съдържание за `pdftotext`. OCR на този сайт връща Markdown, който не може да се подаде обратно в PDF към Excel. Когато думите са само в пиксели, тук няма електронна таблица.
«PDF към CSV» ползва същата евристика. Една таблица става един CSV; няколко — ZIP с CSV. Excel слага тези таблици в отделни листове на една книга. Нито едното не възстановява обединени клетки, цветни заглавия или скрити листове.
Отворете изтеглянето в Excel или LibreOffice Calc и проверете няколко реда. Плътни таблици без двойни интервали често падат в една колона. Файловете, защитени с парола, се отключват вместо вас на тази страница, щом въведете паролата; при API първо пуснете «Премахване на парола».
Правилото за двата интервала е целият механизъм за откриване, затова качеството на книгата зависи изцяло от това как е набрано PDF. Таблиците от генератори на отчети, които допълват всяка клетка до фиксирана ширина, се извличат чисто. Таблици с един интервал между колоните или с пропорционален шрифт, който доближава колоните почти една до друга, изобщо не се разпознават като таблици и може да не дадат книга. Преди да обвините инструмента, маркирайте ред от PDF и потвърдете, че текстът изобщо е избираем.
Имената на листовете следват позицията, не съдържанието. Всеки открит блок става `Page N` или `Page N Table M` в реда на сканиране на страниците. Отчет с по една таблица на страница дава по един лист на страница; страница с три подредени таблици дава три номерирани листа. Няма опция листовете да се именуват по клетка от заглавието и няма обединен изход в един лист.
Стойностите се записват като текст, точно както са се появили в извличането със запазен изглед. Числата не се преобразуват в числови клетки, затова водещите нули оцеляват, а символите за валута и разделителите на хиляди остават в низа. Това обикновено е желателно за номера на сметки и пощенски кодове, но леко досадно за колона със суми, които смятате да събирате. Или преобразувайте типовете в таблицата, или копирайте колоната и използвайте „текст към колони“ или преобразуване на стойности в целевата програма.
Редовете не се дедублират и повтарящите се заглавия не се премахват. Когато таблица се скъса на граница между страници, редът на заглавието често се повтаря на следващата страница и продължението става отделен лист. Обединените клетки не се възстановяват; клетка, обхващала две колони в PDF, просто има текста си в най-лявата колона, а дясната остава празна. Многоредовите клетки стават отделни редове, а не една пренасяна стойност.
Качванията са временни. Не пазим библиотека с работни книги.
Възможности
- `pdftotext -layout` плюс евристика с двойни интервали
- По лист на открита таблица; празно откриване — без файл
- Не е OCR; Markdown от OCR не се подава тук
- Текстови клетки; без извеждане на типове и без възстановяване на обединени клетки
- Анонимен API: /api/v1/convert/pdf/xlsx
Кога да го използвате
- Извлечени таблици директно в Excel или LibreOffice Calc
- Електронна фактурна таблица в работна книга
- По лист на таблица от много страници вместо един CSV
- Извличане на финансов отчет с фиксирана ширина за допълнителен анализ
Как да превърна таблица от PDF в Excel?
- Качете PDF с избираем текст и таблично подравнени колони.
- Стартирайте обработката. Няма диапазон страници или OCR опция.
- При намерени таблици изтеглете `.xlsx`. При никакви — празен успех; опитайте източник с текстов слой.
- Отворете книгата и проверете разреза. Чиста проза не дава листове.
Ограничения и крайни случаи
- Иска избираем текст и двойни интервали между колони
- Без OCR и без контрол за диапазон страници
- Обединени клетки и стилове не се възстановяват
- Всички стойности са текст; без цифров или датов тип
- Таблиците през няколко страници стават отделни листове
- Ограничение за качване на този сайт: 500 MB на файл; над около 95 MB файлът се изпраща на части. Тялото на една пряка API заявка е ограничено до 100 MB.
Примери
- Текстов PDF с триколонна ценова листа често става лист с тези колони
- Сканирано банково извлечение без текстов слой не връща книга
- Отчет от десет страници с по една таблица на страница дава десет листа от Page 1 до Page 10
Поверителност при този инструмент
Файловете се качват по HTTPS, обработват се в паметта или в краткоживуща временна директория на нашите сървъри и се изтриват, щом резултатът е готов. Не задържаме копия за по-късен преглед, обучение на модели или рекламни профили. Сроковете за съхранение и обясненията за бисквитките на AdSense са в Политиката за поверителност.
Често задавани въпроси
- Защо няма електронна таблица?
- Не е намерен блок от два или повече последователни таблични реда. Сканове, проза и таблици без двойни интервали провалят евристиката.
- Мога ли първо OCR, после Excel?
- Не. OCR връща Markdown. Този инструмент чете PDF само през pdftotext.
- Каква е разликата с PDF към CSV?
- Откриването е същото. Excel пише всяка таблица в отделен лист на една книга. CSV е по файл на таблица (една — един CSV; няколко — ZIP).
- Чете ли всяка страница?
- Да. pdftotext разделя по form feed. Всяка страница се сканира за таблични блокове. Няма параметър за диапазон.
- Защо числата ми се запазват като текст?
- Стойностите се записват точно както са извлечени, затова водещите нули и форматирането оцеляват. Преобразувайте колоната в числова в таблицата, ако искате да смятате с нея.
- Възстановяват ли се обединените клетки?
- Не. Текстът на обединена клетка отива в най-лявата колона, а останалите остават празни. Многоредовите клетки стават отделни редове, а не една пренасяна стойност.
- Защо имам няколко листа за една таблица?
- Таблица, която продължава на нова страница, се открива отново там и става още един лист. Редовете заглавие често се повтарят; инструментът не слива фрагментите.
Последна актуализация:
Извикване от код
Всеки инструмент е обикновен REST интерфейс. За анонимна употреба не трябват профил или API ключ. Работи еднакво в браузър, за разработчици и за AI агенти.
curl -X POST "https://pdf123.xyz/api/v1/convert/pdf/xlsx" \
-F "[email protected]" \
-o output.pdfНаличен е и като MCP инструмент за клиенти с Model Context Protocol (JSON-RPC 2.0 през POST /mcp). Пълна API документация
Използвайте го чрез AI агент
СкилС този скил Claude Code, Codex, Cursor и други AI агенти могат да изпълнят „PDF към Excel“ вместо вас: /skills/pdf123-pdf-to-xlsx.md
Файловете служат само за тази обработка и после се изтриват автоматично.