Fazer OCR de um PDF Digitalizado em Markdown
OCR para Markdown lê um PDF digitalizado ou feito de imagens e devolve o texto em um arquivo Markdown. Não adiciona camada de texto ao PDF, e o arquivo original não é alterado.
Arraste arquivos para cá, ou clique para escolher
Aceita PDF · até 500.0 MB por arquivo · até 20 arquivos por vez
Você também pode colar um arquivo com Ctrl/Cmd+V ou pelo menu da área de transferência.
OCR para Markdown lê digitalizações ou PDFs só-imagem e devolve Markdown (`text/markdown`, nome `.md`). Não grava camada de texto oculta de volta no PDF, nem limpa, endireita ou reescreve a digitalização.
O servidor combina o texto nativo já existente no PDF com o reconhecimento óptico das páginas-imagem. Force OCR (`ocrType=force-ocr`, padrão no site) relê cada página. Normal (qualquer valor que não seja `force-ocr`) usa o texto nativo quando existe e só faz OCR em páginas só-imagem. Em PDF eletrônico limpo, Auto não carrega o runtime de OCR.
A precisão depende da qualidade da digitalização, do contraste e da inclinação. O motor atual não tem parâmetro de idioma. Se o cliente ainda enviar campos antigos do Java OCRmyPDF (`languages`, `deskew`, `clean`, `sidecar`), eles são ignorados.
Isto não é etapa prévia de PDF para Word nem de PDF para RTF (texto). Essas ferramentas ainda precisam de texto já existente dentro do PDF. O OCR daqui é extração paralela: você recebe Markdown; o PDF original não muda.
Não faça OCR em arquivos que você não pode digitalizar ou redistribuir. O texto extraído segue as mesmas regras de direitos autorais e de local de trabalho.
Quem quer um PDF pesquisável não encontra isso aqui. O produto pesquisável é o arquivo Markdown. Abra no editor e confira nomes e números que precisam estar certos.
Fotos de celular: recorte e endireite antes de enviar. Páginas em trapézio desperdiçam reconhecimento no fundo. OCR não é tradução: reconhece caracteres e não reescreve o documento em outro idioma.
A tarefa roda no servidor. Baixe a tempo. Não transformamos seus arquivos numa biblioteca de OCR. Arquivos protegidos por senha são desbloqueados para você nesta página assim que você digita a senha; quem chama a API executa Remover senha antes.
Recursos
- Devolve Markdown, não um PDF com camada OCR
- Force OCR relê cada página; Normal/Auto usa texto nativo quando existe
- O PDF original não muda
- API anônima: /api/v1/misc/ocr-pdf
Quando usar esta ferramenta
- Extrair cláusulas de digitalizações de arquivo
- Entregar digitalizações a agentes ou fluxos que pedem Markdown
- Recuperar palavras de PDF só-imagem sem camada de texto
Como fazer OCR de um PDF digitalizado?
- Envie um PDF digitalizado ou fotografado no celular.
- Escolha Force OCR (padrão) ou Normal/Auto.
- Clique em Processar e baixe o arquivo `.md`.
- No Markdown, confira nomes e números antes de usar.
Limites e casos-limite
- A precisão varia com a qualidade da imagem
- Muitas páginas demoram mais
- O motor atual não tem parâmetro de idioma
- Não é biblioteca OCR local nem SDK offline
- Limite de envio neste site: 500 MB por arquivo, enviado em partes acima de cerca de 95 MB. O corpo de uma única requisição direta à API é limitado a 100 MB.
Exemplos
- Contrato digitalizado em escala de cinza com 20 páginas vira arquivo Markdown com o texto das cláusulas
- Foto de página inclinada no celular pode precisar de nova captura para o OCR ser útil
Privacidade desta ferramenta
Os arquivos são enviados por HTTPS, processados em memória ou em um diretório temporário de curta duração nos nossos servidores, e apagados quando o resultado fica pronto. Não guardamos cópias para consulta posterior, treino de modelos ou perfis de publicidade. Consulte a Política de Privacidade para prazos de retenção e cookies do AdSense.
Perguntas frequentes
- OCR muda a aparência das páginas?
- Não devolve PDF. O arquivo original não muda; você recebe um download Markdown à parte.
- Isto é uma biblioteca OCR embutível?
- Não. É uma tarefa HTTP hospedada em /api/v1/misc/ocr-pdf. Veja /developers. Não é um SDK linkável.
- Depois do OCR posso converter para Word?
- Não como pipeline de PDF. O OCR devolve Markdown. PDF para Word ainda precisa de PDF com camada de texto.
- PDF eletrônico precisa de Force OCR?
- Em geral não. Normal/Auto usa o texto existente e pula o runtime de OCR. Use Force quando a camada de texto estiver danificada ou não for confiável.
Última atualização:
Chame pelo código
Cada ferramenta deste site é um endpoint REST. Para uso anônimo não precisa de conta nem de chave de API. Serve para o navegador, para desenvolvedores e para agentes de IA.
curl -X POST "https://pdf123.xyz/api/v1/misc/ocr-pdf" \
-F "[email protected]" \
-F "ocrType=force-ocr" \
-o output.pdfTambém disponível como ferramenta MCP para clientes de agente que falam Model Context Protocol (JSON-RPC 2.0 via POST /mcp). Referência completa da API
Use a partir de um agente de IA
SkillCom esta skill, Claude Code, Codex, Cursor e outros agentes de IA podem usar "OCR para Markdown" para você: /skills/pdf123-ocr.md
Os arquivos servem só para este processamento e são apagados automaticamente depois.