Преобразование PDF в XML
«PDF в XML» импортирует PDF через LibreOffice и возвращает XML-файл в офисном формате. Это экспорт текста и вёрстки по мере возможности, а не копия структуры или тегов PDF.
Перетащите файлы сюда или нажмите, чтобы выбрать
Форматы: PDF · до 500.0 MB на файл · до 20 файлов за раз
Файл можно также вставить через Ctrl/Cmd+V или из меню буфера обмена.
PDF в XML отправляет файл в LibreOffice `writer_pdf_import` с `outputFormat=xml`. Скачивание — XML в духе Office (`octet-stream`), а не восстановление потоков содержимого PDF и не структура размеченного PDF.
Это то же семейство импорта LibreOffice, что PDF в Word, только цель — XML. Вёрстка, таблицы и шрифты — по возможности. Сканы без текстового слоя становятся картинками или пустыми абзацами.
На этой странице нет опций. Файлы, защищённые паролем, снимаются с защиты прямо на этой странице, как только вы введёте пароль; при работе через API сначала запустите «Снять пароль». Markdown с OCR сюда не отправить.
Если нужны строки таблицы, берите PDF в CSV. Если только слова — PDF в RTF (текст).
Загрузки временные. Библиотеку ваших XML мы не храним.
Функции
- LibreOffice `writer_pdf_import` в XML
- Не экспорт структуры PDF и не OCR
- Нет диапазона страниц и опций схемы
- Анонимный API: /api/v1/convert/pdf/xml
Когда применять
- Отдать цифровой PDF в конвейер, который уже принимает Office XML
- Посмотреть, как LibreOffice разбил документ
- Получить XML-черновик, когда следующий шаг — не DOCX
Как преобразовать PDF в XML?
- Загрузите PDF с текстом.
- Нажмите «Обработать». На этой странице нет выбора формата.
- Скачайте `.xml`.
- Откройте в LibreOffice или редакторе и считайте это черновиком.
Ограничения и особые случаи
- Не размеченный PDF и не извлечение XFDF/XFA
- Не OCR
- Таблицы и разбивка на страницы не совпадут с PDF
- Лимит загрузки на сайте: 500 МБ на файл, файлы крупнее примерно 95 МБ отправляются частями. Тело одного прямого запроса к API ограничено 100 МБ.
Примеры
- Текстовая служебная часто становится большим Office XML с прогонами абзацев
- PDF только из скана часто становится XML, который в основном оборачивает картинки
Конфиденциальность этого инструмента
Файлы загружаются по HTTPS, обрабатываются в памяти или в короткоживущем временном каталоге на наших серверах и удаляются, когда результат готов. Копии для последующего просмотра, обучения моделей или рекламных профилей мы не храним. Сроки хранения и сведения о cookie AdSense указаны в Политике конфиденциальности.
Частые вопросы
- Это внутренний XML PDF?
- Нет. LibreOffice экспортирует импортированный документ как XML, а не дерево объектов PDF.
- Почему скан почти пустой?
- У LibreOffice нет текста для импорта. Для слов из пикселей — OCR в Markdown.
- Можно выбрать другой вид XML?
- Нет. Этот путь фиксирует outputFormat как xml и разрешает только это значение.
- Чем это отличается от PDF в Word?
- Импортёр тот же, выход другой. PDF в Word даёт docx, doc или odt. Этот путь даёт xml.
Последнее обновление:
Вызов из кода
Каждый инструмент на сайте: обычный REST. Анонимно не нужны ни аккаунт, ни ключ API. И для браузера, и для разработчиков, и для ИИ-агентов.
curl -X POST "https://pdf123.xyz/api/v1/convert/pdf/xml" \
-F "[email protected]" \
-o output.pdfЕсть и как MCP-инструмент для клиентов на Model Context Protocol (JSON-RPC 2.0, POST /mcp). Полное описание API
Использовать через ИИ-агента
СкиллС этим скиллом Claude Code, Codex, Cursor и другие ИИ-агенты смогут выполнить «PDF в XML» за вас: /skills/pdf123-pdf-to-xml.md
Файлы нужны только для этой обработки и потом удаляются.