Към основното съдържание
PPDF123

Превърнете PDF в XML

PDF към XML внася PDF през LibreOffice и връща XML файл в стил Office. Това е износ на текст и макет с най-добро усилие, а не копие на структурата или таговете на PDF.

Плъзнете файлове тук или кликнете, за да изберете

Приема PDF · до 500.0 MB на файл · до 20 файла наведнъж

Можете също да поставите файл с Ctrl/Cmd+V или от менюто на клипборда.

PDF към XML подава файла към LibreOffice `writer_pdf_import` с `outputFormat=xml`. Изтеглянето е Office-стилов XML (`octet-stream`), не възстановяване на PDF потоци на съдържание или tagged-PDF структура.

Това е същото семейство LibreOffice импорт като «PDF към Word», само че целта е XML. Макет, таблици и шрифтове са приблизителни. Сканове без текст слой стават картинки или празни абзаци.

На страницата няма опции. Файловете, защитени с парола, се отключват вместо вас на тази страница, щом въведете паролата; при API първо пуснете «Премахване на парола». Markdown от OCR не се подава тук.

За редове от таблици ползвайте «PDF към CSV». За само думи — «PDF към RTF (текст)».

Качванията са временни. Не пазим XML библиотека.

Възможности

  • LibreOffice `writer_pdf_import` към XML
  • Не е износ на PDF структура и не е OCR
  • Без диапазон страници или schema опции
  • Анонимен API: /api/v1/convert/pdf/xml

Кога да го използвате

  • Електронен PDF към конвейер, който вече приема Office XML
  • Преглед как LibreOffice реже документа
  • XML чернова, когато следващата стъпка не е DOCX

Как да превърна PDF в XML?

  1. Качете PDF с текст.
  2. Стартирайте обработката. На страницата няма опции за формат.
  3. Изтеглете `.xml`.
  4. Отворете с LibreOffice или редактор и го третирайте като чернова.

Ограничения и крайни случаи

  • Не е tagged-PDF и не е XFDF/XFA извличане
  • Не е OCR
  • Таблиците и пагинацията няма да съвпаднат с PDF
  • Ограничение за качване на този сайт: 500 MB на файл; над около 95 MB файлът се изпраща на части. Тялото на една пряка API заявка е ограничено до 100 MB.

Примери

  • Текстова бележка често става голям Office XML с paragraph runs
  • Чисто сканиран PDF често става XML, който предимно обвива картинки

Поверителност при този инструмент

Файловете се качват по HTTPS, обработват се в паметта или в краткоживуща временна директория на нашите сървъри и се изтриват, щом резултатът е готов. Не задържаме копия за по-късен преглед, обучение на модели или рекламни профили. Сроковете за съхранение и обясненията за бисквитките на AdSense са в Политиката за поверителност.

Често задавани въпроси

Това вътрешният XML на PDF ли е?
Не. LibreOffice експортира импортирания документ като XML, не дървото от PDF обекти.
Защо сканът е почти празен?
LibreOffice няма текст за импорт. За думи в пиксели ползвайте «OCR към Markdown».
Мога ли да избера друг XML диалект?
Не. Пътят фиксира outputFormat=xml и приема само тази стойност.
Каква е разликата с PDF към Word?
Импортерът е същият, изходът е различен. «PDF към Word» дава docx/doc/odt. Този път дава xml.

Последна актуализация:

Извикване от код

Всеки инструмент е обикновен REST интерфейс. За анонимна употреба не трябват профил или API ключ. Работи еднакво в браузър, за разработчици и за AI агенти.

curl -X POST "https://pdf123.xyz/api/v1/convert/pdf/xml" \
  -F "[email protected]" \
  -o output.pdf

Наличен е и като MCP инструмент за клиенти с Model Context Protocol (JSON-RPC 2.0 през POST /mcp). Пълна API документация

Използвайте го чрез AI агент

Скил

С този скил Claude Code, Codex, Cursor и други AI агенти могат да изпълнят „PDF към XML“ вместо вас: /skills/pdf123-pdf-to-xml.md

Всички скилове за агенти

Файловете служат само за тази обработка и после се изтриват автоматично.