Распознавание отсканированного PDF в Markdown
«OCR в Markdown» читает отсканированный PDF или PDF из картинок и возвращает текст файлом Markdown. Текстовый слой в PDF он не добавляет, а исходный файл остаётся без изменений.
Перетащите файлы сюда или нажмите, чтобы выбрать
Форматы: PDF · до 500.0 MB на файл · до 20 файлов за раз
Файл можно также вставить через Ctrl/Cmd+V или из меню буфера обмена.
OCR читает сканы или PDF из одних изображений и возвращает Markdown (`text/markdown`, имя файла `.md`). Скрытый текстовый слой в PDF не записывается; скан не чистится, не выравнивается и не переписывается.
Сервер склеивает уже имеющийся в PDF нативный текст с результатами оптического распознавания страниц-изображений. Force OCR (`ocrType=force-ocr`, по умолчанию на сайте) заново распознаёт каждую страницу. Normal (всё, что не `force-ocr`) берёт нативный текст, где он есть, и делает OCR только на чисто графических страницах. На чистых электронных PDF режим Auto не загружает среду OCR.
Точность зависит от качества скана, контраста и перекоса. У текущего движка нет параметра языка. Если клиент всё ещё шлёт старые поля Java OCRmyPDF (`languages`, `deskew`, `clean`, `sidecar`), они игнорируются.
Это не предварительный шаг для «PDF в Word» или «PDF в RTF (текст)». Тем инструментам по-прежнему нужен текст внутри PDF. Здесь OCR — параллельное извлечение: вы получаете Markdown, исходный PDF не меняется.
Не запускайте OCR на файлах, которые вам не разрешено оцифровывать или распространять. Извлечённый текст тоже подчиняется авторскому праву и правилам рабочего места.
Кто хочет поисковый PDF — здесь его не получит. Итог — файл Markdown. Откройте в редакторе и выборочно проверьте имена и цифры, которые должны быть точными.
Снимки с телефона по возможности обрежьте и выровняйте до загрузки. Трапециевидные кадры тратят распознавание на фон. OCR — не перевод: символы распознаются, документ на другой язык не переписывается.
Задача идёт на сервере. Скачивайте вовремя. Мы не делаем из ваших файлов библиотеку OCR. Файлы, защищённые паролем, снимаются с защиты прямо на этой странице, как только вы введёте пароль; при работе через API сначала запустите «Снять пароль».
Функции
- Возвращает Markdown, а не PDF со слоем OCR
- Force OCR перечитывает каждую страницу; Normal/Auto берут нативный текст, где он есть
- Исходный PDF не меняется
- Анонимный API: /api/v1/misc/ocr-pdf
Когда применять
- Вытащить текст условий из архивного скана
- Отдать скан агенту или конвейеру, которому нужен Markdown
- Вернуть текст из PDF без текстового слоя
Как распознать текст в отсканированном PDF?
- Загрузите скан или PDF со снимков телефона.
- Выберите Force OCR (по умолчанию) или Normal/Auto.
- Нажмите «Обработать» и скачайте файл `.md`.
- В Markdown выборочно проверьте имена и цифры перед использованием.
Ограничения и особые случаи
- Точность зависит от качества изображения
- Много страниц — дольше по времени
- У текущего движка нет параметра языка
- Не локальная библиотека OCR и не офлайн-SDK
- Лимит загрузки на сайте: 500 МБ на файл, файлы крупнее примерно 95 МБ отправляются частями. Тело одного прямого запроса к API ограничено 100 МБ.
Примеры
- 20-страничный серый скан договора становится Markdown с текстом условий
- Кривой кадр с телефона может потребовать пересъёмки, прежде чем OCR станет полезен
Конфиденциальность этого инструмента
Файлы загружаются по HTTPS, обрабатываются в памяти или в короткоживущем временном каталоге на наших серверах и удаляются, когда результат готов. Копии для последующего просмотра, обучения моделей или рекламных профилей мы не храним. Сроки хранения и сведения о cookie AdSense указаны в Политике конфиденциальности.
Частые вопросы
- OCR меняет внешний вид страниц?
- PDF не возвращается. Исходный файл не меняется; отдельно скачивается Markdown.
- Это встраиваемая библиотека OCR?
- Нет. Это HTTP-задача на /api/v1/misc/ocr-pdf. См. /developers. Это не подключаемый SDK.
- После OCR можно сразу в Word?
- Не как конвейер PDF. Вывод OCR — Markdown. «PDF в Word» по-прежнему нужен PDF с текстовым слоем.
- Нужен ли Force OCR для электронного PDF?
- Обычно нет. Normal/Auto используют уже имеющийся текст и пропускают среду OCR. Force — когда текстовый слой повреждён или недостоверен.
Последнее обновление:
Вызов из кода
Каждый инструмент на сайте: обычный REST. Анонимно не нужны ни аккаунт, ни ключ API. И для браузера, и для разработчиков, и для ИИ-агентов.
curl -X POST "https://pdf123.xyz/api/v1/misc/ocr-pdf" \
-F "[email protected]" \
-F "ocrType=force-ocr" \
-o output.pdfЕсть и как MCP-инструмент для клиентов на Model Context Protocol (JSON-RPC 2.0, POST /mcp). Полное описание API
Использовать через ИИ-агента
СкиллС этим скиллом Claude Code, Codex, Cursor и другие ИИ-агенты смогут выполнить «OCR в Markdown» за вас: /skills/pdf123-ocr.md
Файлы нужны только для этой обработки и потом удаляются.