Перейти к основному содержимому
PPDF123

Преобразование PDF в XML

«PDF в XML» импортирует PDF через LibreOffice и возвращает XML-файл в офисном формате. Это экспорт текста и вёрстки по мере возможности, а не копия структуры или тегов PDF.

Перетащите файлы сюда или нажмите, чтобы выбрать

Форматы: PDF · до 500.0 MB на файл · до 20 файлов за раз

Файл можно также вставить через Ctrl/Cmd+V или из меню буфера обмена.

PDF в XML отправляет файл в LibreOffice `writer_pdf_import` с `outputFormat=xml`. Скачивание — XML в духе Office (`octet-stream`), а не восстановление потоков содержимого PDF и не структура размеченного PDF.

Это то же семейство импорта LibreOffice, что PDF в Word, только цель — XML. Вёрстка, таблицы и шрифты — по возможности. Сканы без текстового слоя становятся картинками или пустыми абзацами.

На этой странице нет опций. Файлы, защищённые паролем, снимаются с защиты прямо на этой странице, как только вы введёте пароль; при работе через API сначала запустите «Снять пароль». Markdown с OCR сюда не отправить.

Если нужны строки таблицы, берите PDF в CSV. Если только слова — PDF в RTF (текст).

Загрузки временные. Библиотеку ваших XML мы не храним.

Функции

  • LibreOffice `writer_pdf_import` в XML
  • Не экспорт структуры PDF и не OCR
  • Нет диапазона страниц и опций схемы
  • Анонимный API: /api/v1/convert/pdf/xml

Когда применять

  • Отдать цифровой PDF в конвейер, который уже принимает Office XML
  • Посмотреть, как LibreOffice разбил документ
  • Получить XML-черновик, когда следующий шаг — не DOCX

Как преобразовать PDF в XML?

  1. Загрузите PDF с текстом.
  2. Нажмите «Обработать». На этой странице нет выбора формата.
  3. Скачайте `.xml`.
  4. Откройте в LibreOffice или редакторе и считайте это черновиком.

Ограничения и особые случаи

  • Не размеченный PDF и не извлечение XFDF/XFA
  • Не OCR
  • Таблицы и разбивка на страницы не совпадут с PDF
  • Лимит загрузки на сайте: 500 МБ на файл, файлы крупнее примерно 95 МБ отправляются частями. Тело одного прямого запроса к API ограничено 100 МБ.

Примеры

  • Текстовая служебная часто становится большим Office XML с прогонами абзацев
  • PDF только из скана часто становится XML, который в основном оборачивает картинки

Конфиденциальность этого инструмента

Файлы загружаются по HTTPS, обрабатываются в памяти или в короткоживущем временном каталоге на наших серверах и удаляются, когда результат готов. Копии для последующего просмотра, обучения моделей или рекламных профилей мы не храним. Сроки хранения и сведения о cookie AdSense указаны в Политике конфиденциальности.

Частые вопросы

Это внутренний XML PDF?
Нет. LibreOffice экспортирует импортированный документ как XML, а не дерево объектов PDF.
Почему скан почти пустой?
У LibreOffice нет текста для импорта. Для слов из пикселей — OCR в Markdown.
Можно выбрать другой вид XML?
Нет. Этот путь фиксирует outputFormat как xml и разрешает только это значение.
Чем это отличается от PDF в Word?
Импортёр тот же, выход другой. PDF в Word даёт docx, doc или odt. Этот путь даёт xml.

Последнее обновление:

Вызов из кода

Каждый инструмент на сайте: обычный REST. Анонимно не нужны ни аккаунт, ни ключ API. И для браузера, и для разработчиков, и для ИИ-агентов.

curl -X POST "https://pdf123.xyz/api/v1/convert/pdf/xml" \
  -F "[email protected]" \
  -o output.pdf

Есть и как MCP-инструмент для клиентов на Model Context Protocol (JSON-RPC 2.0, POST /mcp). Полное описание API

Использовать через ИИ-агента

Скилл

С этим скиллом Claude Code, Codex, Cursor и другие ИИ-агенты смогут выполнить «PDF в XML» за вас: /skills/pdf123-pdf-to-xml.md

Все скиллы для агентов

Файлы нужны только для этой обработки и потом удаляются.