Преобразование PDF в HTML
«PDF в HTML» конвертирует PDF через pdftohtml из Poppler и отдаёт ZIP со страницами HTML и их изображениями. Это слепок вёрстки, а не чистая веб-разметка, и OCR он не выполняет.
Перетащите файлы сюда или нажмите, чтобы выбрать
Форматы: PDF · до 500.0 MB на файл · до 20 файлов за раз
Файл можно также вставить через Ctrl/Cmd+V или из меню буфера обмена.
PDF в HTML запускает Poppler `pdftohtml -c` и упаковывает в ZIP то, что инструмент пишет в каталог вывода. Имя скачивания — `{base}ToHtml.zip`, не один `.html`. Цель не браузерный CSS, а HTML и картинки Poppler.
Полей формы нет. Конвертируется каждая страница. Если `pdftohtml` ничего не записал, API возвращает внутреннюю ошибку, а не пустой ZIP.
Это не OCR. Чисто графические сканы становятся картинками внутри HTML-пакета, а не выделяемым текстом. Файлы, защищённые паролем, снимаются с защиты прямо на этой странице, как только вы введёте пароль; при работе через API сначала запустите «Снять пароль».
Если нужны только слова, берите PDF в RTF (текст). Если статья для CMS — PDF в Markdown.
Загрузки временные. Библиотеку ваших HTML мы не храним.
Функции
- Poppler `pdftohtml -c`, ZIP из HTML и ресурсов
- Нет диапазона страниц и опций темы
- Не OCR; сканы в пакете остаются картинками
- Анонимный API: /api/v1/convert/pdf/html
Когда применять
- Получить грубый HTML из PDF с текстовым слоем
- Забрать картинки страниц, которые извлекает pdftohtml
- Посмотреть, как Poppler понимает файл, до своего конвейера
Как преобразовать PDF в HTML?
- Загрузите PDF. На этой странице нет опций конвертации.
- Нажмите «Обработать» и скачайте `{name}ToHtml.zip`.
- Распакуйте и откройте HTML в браузере.
- Проверьте картинки и текст. Сканы не станут настоящим HTML-текстом.
Ограничения и особые случаи
- Выход — ZIP, не один HTML
- Не печать Chromium и не HTML-экспорт размеченного PDF
- Пустой вывод pdftohtml — ошибка, не 204
- Лимит загрузки на сайте: 500 МБ на файл, файлы крупнее примерно 95 МБ отправляются частями. Тело одного прямого запроса к API ограничено 100 МБ.
Примеры
- Простая текстовая служебная часто распаковывается в HTML плюс несколько картинок
- PDF только из скана даёт HTML, который в основном оборачивает картинки страниц
Конфиденциальность этого инструмента
Файлы загружаются по HTTPS, обрабатываются в памяти или в короткоживущем временном каталоге на наших серверах и удаляются, когда результат готов. Копии для последующего просмотра, обучения моделей или рекламных профилей мы не храним. Сроки хранения и сведения о cookie AdSense указаны в Политике конфиденциальности.
Частые вопросы
- Почему результат — ZIP?
- pdftohtml пишет HTML плюс извлечённые картинки в папку. Сервер упаковывает эту папку.
- HTML совпадёт с вёрсткой PDF?
- Настолько, насколько умеет режим `-c` Poppler. Многоколоночные журналы и тяжёлая векторная графика часто не совпадают.
- Можно ли скан превратить в HTML-текст?
- Нет. Этот путь не делает OCR. Нужны слова — OCR в Markdown.
- Конвертация идёт в браузере?
- Нет. Сервер вызывает pdftohtml.
Последнее обновление:
Вызов из кода
Каждый инструмент на сайте: обычный REST. Анонимно не нужны ни аккаунт, ни ключ API. И для браузера, и для разработчиков, и для ИИ-агентов.
curl -X POST "https://pdf123.xyz/api/v1/convert/pdf/html" \
-F "[email protected]" \
-o output.pdfЕсть и как MCP-инструмент для клиентов на Model Context Protocol (JSON-RPC 2.0, POST /mcp). Полное описание API
Использовать через ИИ-агента
СкиллС этим скиллом Claude Code, Codex, Cursor и другие ИИ-агенты смогут выполнить «PDF в HTML» за вас: /skills/pdf123-pdf-to-html.md
Файлы нужны только для этой обработки и потом удаляются.