Перейти к основному содержимому
PPDF123

Извлечение картинок из PDF

«Извлечь изображения» вынимает из PDF встроенные растровые изображения и отдаёт их в ZIP файлами PNG или JPEG. Векторные рисунки и текст страницы изображениями не являются и в результат не входят.

Перетащите файлы сюда или нажмите, чтобы выбрать

Форматы: PDF · до 500.0 MB на файл · до 20 файлов за раз

Файл можно также вставить через Ctrl/Cmd+V или из меню буфера обмена.

Извлечение изображений обходит страничные XObject-изображения, декодирует потоки Flate/ASCII85/DCT и упаковывает их в ZIP как `image_N.png` или `image_N.jpeg`. `format` — png (по умолчанию) или jpeg. Общий XObject извлекается один раз.

Изображения с фильтром LZW дают внутреннюю ошибку (`LZW images unsupported`). Страницы без словаря XObject пропускаются. Файл без извлекаемых картинок всё равно возвращает ZIP, в котором может не быть нужных членов.

Это не растеризация каждой страницы в PNG (то PDF в изображения) и не OCR. Вектор — не image XObject и не появится.

Файлы, защищённые паролем, снимаются с защиты прямо на этой странице, как только вы введёте пароль; при работе через API сначала запустите «Снять пароль».

Загрузка временная. Библиотеку изображений мы не храним.

Функции

  • XObject-изображения в ZIP как PNG или JPEG
  • Дедупликация по id объекта; LZW не поддерживается
  • Не растеризация страниц и не OCR
  • Анонимный API: /api/v1/misc/extract-images

Когда применять

  • Вынуть фото из электронного отчёта
  • При format=jpeg по возможности не перекодировать JPEG-потоки фото
  • Нужны только картинки, без растеризации страниц

Как извлечь изображения из PDF?

  1. Загрузите PDF со встроенными фото или растром.
  2. Оставьте PNG или выберите JPEG.
  3. Нажмите «Обработать» и скачайте `{name}_extracted_images.zip`.
  4. Если в ZIP нет полезных файлов, в PDF не было декодируемых image XObject.

Ограничения и особые случаи

  • Не рендерер страниц
  • LZW роняет задачу
  • PNG на выходе — RGB, поэтому прозрачность и мягкие маски отбрасываются
  • Нет OCR
  • Лимит загрузки на сайте: 500 МБ на файл, файлы крупнее примерно 95 МБ отправляются частями. Тело одного прямого запроса к API ограничено 100 МБ.

Примеры

  • PDF с тремя разными фото-XObject даёт в ZIP image_1 … image_3
  • Страница с векторным логотипом может ничего не дать

Конфиденциальность этого инструмента

Файлы загружаются по HTTPS, обрабатываются в памяти или в короткоживущем временном каталоге на наших серверах и удаляются, когда результат готов. Копии для последующего просмотра, обучения моделей или рекламных профилей мы не храним. Сроки хранения и сведения о cookie AdSense указаны в Политике конфиденциальности.

Частые вопросы

Почему не по картинке на страницу?
Извлекаются только встроенные image XObject. Страница из текста и вектора может не дать ни одной.
Чем отличается от PDF в изображения?
PDF в изображения рендерит страницы. Извлечение изображений достаёт уже лежащие в файле объекты изображений.
А LZW?
Декодирование LZW не реализовано. Задача падает с ошибкой, а не пропускает кадр.
Обрабатываются ли маски и SMask?
Считайте экспорт пикселей приблизительным. Мягкие маски и редкие цветовые пространства могут выйти неверно.

Последнее обновление:

Вызов из кода

Каждый инструмент на сайте: обычный REST. Анонимно не нужны ни аккаунт, ни ключ API. И для браузера, и для разработчиков, и для ИИ-агентов.

curl -X POST "https://pdf123.xyz/api/v1/misc/extract-images" \
  -F "[email protected]" \
  -F "format=png" \
  -o output.pdf

Есть и как MCP-инструмент для клиентов на Model Context Protocol (JSON-RPC 2.0, POST /mcp). Полное описание API

Использовать через ИИ-агента

Скилл

С этим скиллом Claude Code, Codex, Cursor и другие ИИ-агенты смогут выполнить «Извлечь изображения» за вас: /skills/pdf123-extract-images.md

Все скиллы для агентов

Файлы нужны только для этой обработки и потом удаляются.