Ir para o conteúdo principal
PPDF123

Fazer OCR de um PDF Digitalizado em Markdown

OCR para Markdown lê um PDF digitalizado ou feito de imagens e devolve o texto em um arquivo Markdown. Não adiciona camada de texto ao PDF, e o arquivo original não é alterado.

Arraste arquivos para cá, ou clique para escolher

Aceita PDF · até 500.0 MB por arquivo · até 20 arquivos por vez

Você também pode colar um arquivo com Ctrl/Cmd+V ou pelo menu da área de transferência.

OCR para Markdown lê digitalizações ou PDFs só-imagem e devolve Markdown (`text/markdown`, nome `.md`). Não grava camada de texto oculta de volta no PDF, nem limpa, endireita ou reescreve a digitalização.

O servidor combina o texto nativo já existente no PDF com o reconhecimento óptico das páginas-imagem. Force OCR (`ocrType=force-ocr`, padrão no site) relê cada página. Normal (qualquer valor que não seja `force-ocr`) usa o texto nativo quando existe e só faz OCR em páginas só-imagem. Em PDF eletrônico limpo, Auto não carrega o runtime de OCR.

A precisão depende da qualidade da digitalização, do contraste e da inclinação. O motor atual não tem parâmetro de idioma. Se o cliente ainda enviar campos antigos do Java OCRmyPDF (`languages`, `deskew`, `clean`, `sidecar`), eles são ignorados.

Isto não é etapa prévia de PDF para Word nem de PDF para RTF (texto). Essas ferramentas ainda precisam de texto já existente dentro do PDF. O OCR daqui é extração paralela: você recebe Markdown; o PDF original não muda.

Não faça OCR em arquivos que você não pode digitalizar ou redistribuir. O texto extraído segue as mesmas regras de direitos autorais e de local de trabalho.

Quem quer um PDF pesquisável não encontra isso aqui. O produto pesquisável é o arquivo Markdown. Abra no editor e confira nomes e números que precisam estar certos.

Fotos de celular: recorte e endireite antes de enviar. Páginas em trapézio desperdiçam reconhecimento no fundo. OCR não é tradução: reconhece caracteres e não reescreve o documento em outro idioma.

A tarefa roda no servidor. Baixe a tempo. Não transformamos seus arquivos numa biblioteca de OCR. Arquivos protegidos por senha são desbloqueados para você nesta página assim que você digita a senha; quem chama a API executa Remover senha antes.

Recursos

  • Devolve Markdown, não um PDF com camada OCR
  • Force OCR relê cada página; Normal/Auto usa texto nativo quando existe
  • O PDF original não muda
  • API anônima: /api/v1/misc/ocr-pdf

Quando usar esta ferramenta

  • Extrair cláusulas de digitalizações de arquivo
  • Entregar digitalizações a agentes ou fluxos que pedem Markdown
  • Recuperar palavras de PDF só-imagem sem camada de texto

Como fazer OCR de um PDF digitalizado?

  1. Envie um PDF digitalizado ou fotografado no celular.
  2. Escolha Force OCR (padrão) ou Normal/Auto.
  3. Clique em Processar e baixe o arquivo `.md`.
  4. No Markdown, confira nomes e números antes de usar.

Limites e casos-limite

  • A precisão varia com a qualidade da imagem
  • Muitas páginas demoram mais
  • O motor atual não tem parâmetro de idioma
  • Não é biblioteca OCR local nem SDK offline
  • Limite de envio neste site: 500 MB por arquivo, enviado em partes acima de cerca de 95 MB. O corpo de uma única requisição direta à API é limitado a 100 MB.

Exemplos

  • Contrato digitalizado em escala de cinza com 20 páginas vira arquivo Markdown com o texto das cláusulas
  • Foto de página inclinada no celular pode precisar de nova captura para o OCR ser útil

Privacidade desta ferramenta

Os arquivos são enviados por HTTPS, processados em memória ou em um diretório temporário de curta duração nos nossos servidores, e apagados quando o resultado fica pronto. Não guardamos cópias para consulta posterior, treino de modelos ou perfis de publicidade. Consulte a Política de Privacidade para prazos de retenção e cookies do AdSense.

Perguntas frequentes

OCR muda a aparência das páginas?
Não devolve PDF. O arquivo original não muda; você recebe um download Markdown à parte.
Isto é uma biblioteca OCR embutível?
Não. É uma tarefa HTTP hospedada em /api/v1/misc/ocr-pdf. Veja /developers. Não é um SDK linkável.
Depois do OCR posso converter para Word?
Não como pipeline de PDF. O OCR devolve Markdown. PDF para Word ainda precisa de PDF com camada de texto.
PDF eletrônico precisa de Force OCR?
Em geral não. Normal/Auto usa o texto existente e pula o runtime de OCR. Use Force quando a camada de texto estiver danificada ou não for confiável.

Última atualização:

Chame pelo código

Cada ferramenta deste site é um endpoint REST. Para uso anônimo não precisa de conta nem de chave de API. Serve para o navegador, para desenvolvedores e para agentes de IA.

curl -X POST "https://pdf123.xyz/api/v1/misc/ocr-pdf" \
  -F "[email protected]" \
  -F "ocrType=force-ocr" \
  -o output.pdf

Também disponível como ferramenta MCP para clientes de agente que falam Model Context Protocol (JSON-RPC 2.0 via POST /mcp). Referência completa da API

Use a partir de um agente de IA

Skill

Com esta skill, Claude Code, Codex, Cursor e outros agentes de IA podem usar "OCR para Markdown" para você: /skills/pdf123-ocr.md

Todas as skills para agentes

Os arquivos servem só para este processamento e são apagados automaticamente depois.