Перейти к основному содержимому
PPDF123

Распознавание отсканированного PDF в Markdown

«OCR в Markdown» читает отсканированный PDF или PDF из картинок и возвращает текст файлом Markdown. Текстовый слой в PDF он не добавляет, а исходный файл остаётся без изменений.

Перетащите файлы сюда или нажмите, чтобы выбрать

Форматы: PDF · до 500.0 MB на файл · до 20 файлов за раз

Файл можно также вставить через Ctrl/Cmd+V или из меню буфера обмена.

OCR читает сканы или PDF из одних изображений и возвращает Markdown (`text/markdown`, имя файла `.md`). Скрытый текстовый слой в PDF не записывается; скан не чистится, не выравнивается и не переписывается.

Сервер склеивает уже имеющийся в PDF нативный текст с результатами оптического распознавания страниц-изображений. Force OCR (`ocrType=force-ocr`, по умолчанию на сайте) заново распознаёт каждую страницу. Normal (всё, что не `force-ocr`) берёт нативный текст, где он есть, и делает OCR только на чисто графических страницах. На чистых электронных PDF режим Auto не загружает среду OCR.

Точность зависит от качества скана, контраста и перекоса. У текущего движка нет параметра языка. Если клиент всё ещё шлёт старые поля Java OCRmyPDF (`languages`, `deskew`, `clean`, `sidecar`), они игнорируются.

Это не предварительный шаг для «PDF в Word» или «PDF в RTF (текст)». Тем инструментам по-прежнему нужен текст внутри PDF. Здесь OCR — параллельное извлечение: вы получаете Markdown, исходный PDF не меняется.

Не запускайте OCR на файлах, которые вам не разрешено оцифровывать или распространять. Извлечённый текст тоже подчиняется авторскому праву и правилам рабочего места.

Кто хочет поисковый PDF — здесь его не получит. Итог — файл Markdown. Откройте в редакторе и выборочно проверьте имена и цифры, которые должны быть точными.

Снимки с телефона по возможности обрежьте и выровняйте до загрузки. Трапециевидные кадры тратят распознавание на фон. OCR — не перевод: символы распознаются, документ на другой язык не переписывается.

Задача идёт на сервере. Скачивайте вовремя. Мы не делаем из ваших файлов библиотеку OCR. Файлы, защищённые паролем, снимаются с защиты прямо на этой странице, как только вы введёте пароль; при работе через API сначала запустите «Снять пароль».

Функции

  • Возвращает Markdown, а не PDF со слоем OCR
  • Force OCR перечитывает каждую страницу; Normal/Auto берут нативный текст, где он есть
  • Исходный PDF не меняется
  • Анонимный API: /api/v1/misc/ocr-pdf

Когда применять

  • Вытащить текст условий из архивного скана
  • Отдать скан агенту или конвейеру, которому нужен Markdown
  • Вернуть текст из PDF без текстового слоя

Как распознать текст в отсканированном PDF?

  1. Загрузите скан или PDF со снимков телефона.
  2. Выберите Force OCR (по умолчанию) или Normal/Auto.
  3. Нажмите «Обработать» и скачайте файл `.md`.
  4. В Markdown выборочно проверьте имена и цифры перед использованием.

Ограничения и особые случаи

  • Точность зависит от качества изображения
  • Много страниц — дольше по времени
  • У текущего движка нет параметра языка
  • Не локальная библиотека OCR и не офлайн-SDK
  • Лимит загрузки на сайте: 500 МБ на файл, файлы крупнее примерно 95 МБ отправляются частями. Тело одного прямого запроса к API ограничено 100 МБ.

Примеры

  • 20-страничный серый скан договора становится Markdown с текстом условий
  • Кривой кадр с телефона может потребовать пересъёмки, прежде чем OCR станет полезен

Конфиденциальность этого инструмента

Файлы загружаются по HTTPS, обрабатываются в памяти или в короткоживущем временном каталоге на наших серверах и удаляются, когда результат готов. Копии для последующего просмотра, обучения моделей или рекламных профилей мы не храним. Сроки хранения и сведения о cookie AdSense указаны в Политике конфиденциальности.

Частые вопросы

OCR меняет внешний вид страниц?
PDF не возвращается. Исходный файл не меняется; отдельно скачивается Markdown.
Это встраиваемая библиотека OCR?
Нет. Это HTTP-задача на /api/v1/misc/ocr-pdf. См. /developers. Это не подключаемый SDK.
После OCR можно сразу в Word?
Не как конвейер PDF. Вывод OCR — Markdown. «PDF в Word» по-прежнему нужен PDF с текстовым слоем.
Нужен ли Force OCR для электронного PDF?
Обычно нет. Normal/Auto используют уже имеющийся текст и пропускают среду OCR. Force — когда текстовый слой повреждён или недостоверен.

Последнее обновление:

Вызов из кода

Каждый инструмент на сайте: обычный REST. Анонимно не нужны ни аккаунт, ни ключ API. И для браузера, и для разработчиков, и для ИИ-агентов.

curl -X POST "https://pdf123.xyz/api/v1/misc/ocr-pdf" \
  -F "[email protected]" \
  -F "ocrType=force-ocr" \
  -o output.pdf

Есть и как MCP-инструмент для клиентов на Model Context Protocol (JSON-RPC 2.0, POST /mcp). Полное описание API

Использовать через ИИ-агента

Скилл

С этим скиллом Claude Code, Codex, Cursor и другие ИИ-агенты смогут выполнить «OCR в Markdown» за вас: /skills/pdf123-ocr.md

Все скиллы для агентов

Файлы нужны только для этой обработки и потом удаляются.