Извлечение картинок из PDF
«Извлечь изображения» вынимает из PDF встроенные растровые изображения и отдаёт их в ZIP файлами PNG или JPEG. Векторные рисунки и текст страницы изображениями не являются и в результат не входят.
Перетащите файлы сюда или нажмите, чтобы выбрать
Форматы: PDF · до 500.0 MB на файл · до 20 файлов за раз
Файл можно также вставить через Ctrl/Cmd+V или из меню буфера обмена.
Извлечение изображений обходит страничные XObject-изображения, декодирует потоки Flate/ASCII85/DCT и упаковывает их в ZIP как `image_N.png` или `image_N.jpeg`. `format` — png (по умолчанию) или jpeg. Общий XObject извлекается один раз.
Изображения с фильтром LZW дают внутреннюю ошибку (`LZW images unsupported`). Страницы без словаря XObject пропускаются. Файл без извлекаемых картинок всё равно возвращает ZIP, в котором может не быть нужных членов.
Это не растеризация каждой страницы в PNG (то PDF в изображения) и не OCR. Вектор — не image XObject и не появится.
Файлы, защищённые паролем, снимаются с защиты прямо на этой странице, как только вы введёте пароль; при работе через API сначала запустите «Снять пароль».
Загрузка временная. Библиотеку изображений мы не храним.
Функции
- XObject-изображения в ZIP как PNG или JPEG
- Дедупликация по id объекта; LZW не поддерживается
- Не растеризация страниц и не OCR
- Анонимный API: /api/v1/misc/extract-images
Когда применять
- Вынуть фото из электронного отчёта
- При format=jpeg по возможности не перекодировать JPEG-потоки фото
- Нужны только картинки, без растеризации страниц
Как извлечь изображения из PDF?
- Загрузите PDF со встроенными фото или растром.
- Оставьте PNG или выберите JPEG.
- Нажмите «Обработать» и скачайте `{name}_extracted_images.zip`.
- Если в ZIP нет полезных файлов, в PDF не было декодируемых image XObject.
Ограничения и особые случаи
- Не рендерер страниц
- LZW роняет задачу
- PNG на выходе — RGB, поэтому прозрачность и мягкие маски отбрасываются
- Нет OCR
- Лимит загрузки на сайте: 500 МБ на файл, файлы крупнее примерно 95 МБ отправляются частями. Тело одного прямого запроса к API ограничено 100 МБ.
Примеры
- PDF с тремя разными фото-XObject даёт в ZIP image_1 … image_3
- Страница с векторным логотипом может ничего не дать
Конфиденциальность этого инструмента
Файлы загружаются по HTTPS, обрабатываются в памяти или в короткоживущем временном каталоге на наших серверах и удаляются, когда результат готов. Копии для последующего просмотра, обучения моделей или рекламных профилей мы не храним. Сроки хранения и сведения о cookie AdSense указаны в Политике конфиденциальности.
Частые вопросы
- Почему не по картинке на страницу?
- Извлекаются только встроенные image XObject. Страница из текста и вектора может не дать ни одной.
- Чем отличается от PDF в изображения?
- PDF в изображения рендерит страницы. Извлечение изображений достаёт уже лежащие в файле объекты изображений.
- А LZW?
- Декодирование LZW не реализовано. Задача падает с ошибкой, а не пропускает кадр.
- Обрабатываются ли маски и SMask?
- Считайте экспорт пикселей приблизительным. Мягкие маски и редкие цветовые пространства могут выйти неверно.
Последнее обновление:
Вызов из кода
Каждый инструмент на сайте: обычный REST. Анонимно не нужны ни аккаунт, ни ключ API. И для браузера, и для разработчиков, и для ИИ-агентов.
curl -X POST "https://pdf123.xyz/api/v1/misc/extract-images" \
-F "[email protected]" \
-F "format=png" \
-o output.pdfЕсть и как MCP-инструмент для клиентов на Model Context Protocol (JSON-RPC 2.0, POST /mcp). Полное описание API
Использовать через ИИ-агента
СкиллС этим скиллом Claude Code, Codex, Cursor и другие ИИ-агенты смогут выполнить «Извлечь изображения» за вас: /skills/pdf123-extract-images.md
Файлы нужны только для этой обработки и потом удаляются.