Перейти к основному содержимому
PPDF123

Преобразование PDF в HTML

«PDF в HTML» конвертирует PDF через pdftohtml из Poppler и отдаёт ZIP со страницами HTML и их изображениями. Это слепок вёрстки, а не чистая веб-разметка, и OCR он не выполняет.

Перетащите файлы сюда или нажмите, чтобы выбрать

Форматы: PDF · до 500.0 MB на файл · до 20 файлов за раз

Файл можно также вставить через Ctrl/Cmd+V или из меню буфера обмена.

PDF в HTML запускает Poppler `pdftohtml -c` и упаковывает в ZIP то, что инструмент пишет в каталог вывода. Имя скачивания — `{base}ToHtml.zip`, не один `.html`. Цель не браузерный CSS, а HTML и картинки Poppler.

Полей формы нет. Конвертируется каждая страница. Если `pdftohtml` ничего не записал, API возвращает внутреннюю ошибку, а не пустой ZIP.

Это не OCR. Чисто графические сканы становятся картинками внутри HTML-пакета, а не выделяемым текстом. Файлы, защищённые паролем, снимаются с защиты прямо на этой странице, как только вы введёте пароль; при работе через API сначала запустите «Снять пароль».

Если нужны только слова, берите PDF в RTF (текст). Если статья для CMS — PDF в Markdown.

Загрузки временные. Библиотеку ваших HTML мы не храним.

Функции

  • Poppler `pdftohtml -c`, ZIP из HTML и ресурсов
  • Нет диапазона страниц и опций темы
  • Не OCR; сканы в пакете остаются картинками
  • Анонимный API: /api/v1/convert/pdf/html

Когда применять

  • Получить грубый HTML из PDF с текстовым слоем
  • Забрать картинки страниц, которые извлекает pdftohtml
  • Посмотреть, как Poppler понимает файл, до своего конвейера

Как преобразовать PDF в HTML?

  1. Загрузите PDF. На этой странице нет опций конвертации.
  2. Нажмите «Обработать» и скачайте `{name}ToHtml.zip`.
  3. Распакуйте и откройте HTML в браузере.
  4. Проверьте картинки и текст. Сканы не станут настоящим HTML-текстом.

Ограничения и особые случаи

  • Выход — ZIP, не один HTML
  • Не печать Chromium и не HTML-экспорт размеченного PDF
  • Пустой вывод pdftohtml — ошибка, не 204
  • Лимит загрузки на сайте: 500 МБ на файл, файлы крупнее примерно 95 МБ отправляются частями. Тело одного прямого запроса к API ограничено 100 МБ.

Примеры

  • Простая текстовая служебная часто распаковывается в HTML плюс несколько картинок
  • PDF только из скана даёт HTML, который в основном оборачивает картинки страниц

Конфиденциальность этого инструмента

Файлы загружаются по HTTPS, обрабатываются в памяти или в короткоживущем временном каталоге на наших серверах и удаляются, когда результат готов. Копии для последующего просмотра, обучения моделей или рекламных профилей мы не храним. Сроки хранения и сведения о cookie AdSense указаны в Политике конфиденциальности.

Частые вопросы

Почему результат — ZIP?
pdftohtml пишет HTML плюс извлечённые картинки в папку. Сервер упаковывает эту папку.
HTML совпадёт с вёрсткой PDF?
Настолько, насколько умеет режим `-c` Poppler. Многоколоночные журналы и тяжёлая векторная графика часто не совпадают.
Можно ли скан превратить в HTML-текст?
Нет. Этот путь не делает OCR. Нужны слова — OCR в Markdown.
Конвертация идёт в браузере?
Нет. Сервер вызывает pdftohtml.

Последнее обновление:

Вызов из кода

Каждый инструмент на сайте: обычный REST. Анонимно не нужны ни аккаунт, ни ключ API. И для браузера, и для разработчиков, и для ИИ-агентов.

curl -X POST "https://pdf123.xyz/api/v1/convert/pdf/html" \
  -F "[email protected]" \
  -o output.pdf

Есть и как MCP-инструмент для клиентов на Model Context Protocol (JSON-RPC 2.0, POST /mcp). Полное описание API

Использовать через ИИ-агента

Скилл

С этим скиллом Claude Code, Codex, Cursor и другие ИИ-агенты смогут выполнить «PDF в HTML» за вас: /skills/pdf123-pdf-to-html.md

Все скиллы для агентов

Файлы нужны только для этой обработки и потом удаляются.