Превърнете PDF в XML
PDF към XML внася PDF през LibreOffice и връща XML файл в стил Office. Това е износ на текст и макет с най-добро усилие, а не копие на структурата или таговете на PDF.
Плъзнете файлове тук или кликнете, за да изберете
Приема PDF · до 500.0 MB на файл · до 20 файла наведнъж
Можете също да поставите файл с Ctrl/Cmd+V или от менюто на клипборда.
PDF към XML подава файла към LibreOffice `writer_pdf_import` с `outputFormat=xml`. Изтеглянето е Office-стилов XML (`octet-stream`), не възстановяване на PDF потоци на съдържание или tagged-PDF структура.
Това е същото семейство LibreOffice импорт като «PDF към Word», само че целта е XML. Макет, таблици и шрифтове са приблизителни. Сканове без текст слой стават картинки или празни абзаци.
На страницата няма опции. Файловете, защитени с парола, се отключват вместо вас на тази страница, щом въведете паролата; при API първо пуснете «Премахване на парола». Markdown от OCR не се подава тук.
За редове от таблици ползвайте «PDF към CSV». За само думи — «PDF към RTF (текст)».
Качванията са временни. Не пазим XML библиотека.
Възможности
- LibreOffice `writer_pdf_import` към XML
- Не е износ на PDF структура и не е OCR
- Без диапазон страници или schema опции
- Анонимен API: /api/v1/convert/pdf/xml
Кога да го използвате
- Електронен PDF към конвейер, който вече приема Office XML
- Преглед как LibreOffice реже документа
- XML чернова, когато следващата стъпка не е DOCX
Как да превърна PDF в XML?
- Качете PDF с текст.
- Стартирайте обработката. На страницата няма опции за формат.
- Изтеглете `.xml`.
- Отворете с LibreOffice или редактор и го третирайте като чернова.
Ограничения и крайни случаи
- Не е tagged-PDF и не е XFDF/XFA извличане
- Не е OCR
- Таблиците и пагинацията няма да съвпаднат с PDF
- Ограничение за качване на този сайт: 500 MB на файл; над около 95 MB файлът се изпраща на части. Тялото на една пряка API заявка е ограничено до 100 MB.
Примери
- Текстова бележка често става голям Office XML с paragraph runs
- Чисто сканиран PDF често става XML, който предимно обвива картинки
Поверителност при този инструмент
Файловете се качват по HTTPS, обработват се в паметта или в краткоживуща временна директория на нашите сървъри и се изтриват, щом резултатът е готов. Не задържаме копия за по-късен преглед, обучение на модели или рекламни профили. Сроковете за съхранение и обясненията за бисквитките на AdSense са в Политиката за поверителност.
Често задавани въпроси
- Това вътрешният XML на PDF ли е?
- Не. LibreOffice експортира импортирания документ като XML, не дървото от PDF обекти.
- Защо сканът е почти празен?
- LibreOffice няма текст за импорт. За думи в пиксели ползвайте «OCR към Markdown».
- Мога ли да избера друг XML диалект?
- Не. Пътят фиксира outputFormat=xml и приема само тази стойност.
- Каква е разликата с PDF към Word?
- Импортерът е същият, изходът е различен. «PDF към Word» дава docx/doc/odt. Този път дава xml.
Последна актуализация:
Извикване от код
Всеки инструмент е обикновен REST интерфейс. За анонимна употреба не трябват профил или API ключ. Работи еднакво в браузър, за разработчици и за AI агенти.
curl -X POST "https://pdf123.xyz/api/v1/convert/pdf/xml" \
-F "[email protected]" \
-o output.pdfНаличен е и като MCP инструмент за клиенти с Model Context Protocol (JSON-RPC 2.0 през POST /mcp). Пълна API документация
Използвайте го чрез AI агент
СкилС този скил Claude Code, Codex, Cursor и други AI агенти могат да изпълнят „PDF към XML“ вместо вас: /skills/pdf123-pdf-to-xml.md
Файловете служат само за тази обработка и после се изтриват автоматично.