OCR на сканиран PDF до Markdown
OCR към Markdown чете сканиран или изображенчески PDF и връща текста му като Markdown файл. Не добавя текстов слой към PDF, а оригиналният файл не се променя.
Плъзнете файлове тук или кликнете, за да изберете
Приема PDF · до 500.0 MB на файл · до 20 файла наведнъж
Можете също да поставите файл с Ctrl/Cmd+V или от менюто на клипборда.
OCR към Markdown чете сканиран или чисто изображен PDF и връща Markdown (`text/markdown`, име `.md`). Не записва скрит текстов слой обратно в PDF и не почиства, не изправя и не презаписва скана.
Сървърът комбинира вече наличния нативен текст в PDF с оптичното разпознаване на изображенните страници. Force OCR (`ocrType=force-ocr`, подразбиране на сайта) разпознава отново всяка страница. Normal (всичко, което не е `force-ocr`) ползва нативен текст, когато го има, и прави OCR само на чисто изображенни страници. При чист електронен PDF Auto не зарежда OCR средата.
Точността зависи от качеството на скана, контраста и наклона. Текущият двигател няма параметър за език. Ако клиент още праща стари Java OCRmyPDF полета (`languages`, `deskew`, `clean`, `sidecar`), те се игнорират.
Това не е предварителна стъпка към «PDF към Word» или «PDF към RTF (текст)». Тези инструменти пак искат текст, вече вграден в PDF. Тук OCR е паралелно извличане: получавате Markdown, оригиналният PDF остава непроменен.
Не правете OCR на файлове, които нямате право да дигитализирате или преразпространявате. Извлеченият текст също попада под авторско право и правила на работното място.
Който иска претърсим PDF, тук няма да го получи. Продуктът е Markdown файл. Отворете го в редактор и проверете имената и числата, които трябва да са точни.
Мобилните снимки първо изрежете и изправете, после качвайте. Трапецовидни кадри хабят разпознаването върху фона. OCR не е превод: разпознава знаци, не пренаписва документа на друг език.
Задачата върви на сървъра. Изтеглете навреме. Не правим OCR библиотека от вашите файлове. Файловете, защитени с парола, се отключват вместо вас на тази страница, щом въведете паролата; при API първо пуснете «Премахване на парола».
Възможности
- Връща Markdown, не PDF със слой OCR
- Force OCR препрочита всяка страница; Normal/Auto ползва нативен текст, когато го има
- Оригиналният PDF остава непроменен
- Анонимен API: /api/v1/misc/ocr-pdf
Кога да го използвате
- Извличане на клаузи от архивен скан
- Подаване на скан към агент или конвейер, който приема Markdown
- Връщане на думи от чисто изображен PDF без текстов слой
Как да направя OCR на сканиран PDF?
- Качете сканиран или заснет с телефон PDF.
- Изберете Force OCR (подразбиране) или Normal/Auto.
- Стартирайте обработката и изтеглете `.md` файла.
- В Markdown проверете имена и числа, преди да го ползвате.
Ограничения и крайни случаи
- Точността следва качеството на изображението
- Много страници отнемат повече време
- Текущият двигател няма параметър за език
- Не е локална OCR библиотека и не е офлайн SDK
- Ограничение за качване на този сайт: 500 MB на файл; над около 95 MB файлът се изпраща на части. Тялото на една пряка API заявка е ограничено до 100 MB.
Примери
- 20-страничен сив договор-скан става Markdown с текста на клаузите
- Наклонена телефонна снимка може да иска презаснемане, преди OCR да е полезен
Поверителност при този инструмент
Файловете се качват по HTTPS, обработват се в паметта или в краткоживуща временна директория на нашите сървъри и се изтриват, щом резултатът е готов. Не задържаме копия за по-късен преглед, обучение на модели или рекламни профили. Сроковете за съхранение и обясненията за бисквитките на AdSense са в Политиката за поверителност.
Често задавани въпроси
- Променя ли OCR външния вид на страницата?
- Не връща PDF. Оригиналът остава; получавате отделно Markdown изтегляне.
- Това вграждаема OCR библиотека ли е?
- Не. Това е хоствана HTTP задача на /api/v1/misc/ocr-pdf. Вижте /developers. Не е свързваем SDK.
- Мога ли след OCR да конвертирам към Word?
- Не като PDF конвейер. OCR изходът е Markdown. «PDF към Word» пак иска PDF с текстов слой.
- Трябва ли Force OCR за електронен PDF?
- Обикновено не. Normal/Auto ползва наличния текст и пропуска OCR средата. Ползвайте Force, когато текстовият слой е повреден или ненадежден.
Последна актуализация:
Извикване от код
Всеки инструмент е обикновен REST интерфейс. За анонимна употреба не трябват профил или API ключ. Работи еднакво в браузър, за разработчици и за AI агенти.
curl -X POST "https://pdf123.xyz/api/v1/misc/ocr-pdf" \
-F "[email protected]" \
-F "ocrType=force-ocr" \
-o output.pdfНаличен е и като MCP инструмент за клиенти с Model Context Protocol (JSON-RPC 2.0 през POST /mcp). Пълна API документация
Използвайте го чрез AI агент
СкилС този скил Claude Code, Codex, Cursor и други AI агенти могат да изпълнят „OCR към Markdown“ вместо вас: /skills/pdf123-ocr.md
Файловете служат само за тази обработка и после се изтриват автоматично.