Product2026-09-284 min de leitura

Pacote de digitalização para texto: OCR e depois compressão do PDF que você guarda

Um pacote de digitalização pede duas etapas: o OCR devolve texto em Markdown e o Compress encolhe o PDF original. As saídas e a ordem não se misturam.

PDF123 · Updated 2026-09-28

Um "pacote de digitalização" costuma ser uma pilha de imagens de página montada num único PDF: pesado em disco e vazio para busca e cópia. Duas ferramentas que as pessoas encadeiam não produzem um PDF pesquisável mágico neste site. O OCR devolve Markdown. O Comprimir reescreve o PDF que você continua guardando.

Essa divisão é o fluxo de trabalho inteiro.

O que o OCR entrega de fato aqui

POST /api/v1/misc/ocr-pdf executa o reconhecimento e baixa um arquivo .md (text/markdown): texto nativo do PDF fundido ao OCR das páginas de imagem. Ele não grava uma camada de texto oculta de volta no PDF. Se você esperava selecionar e buscar dentro do mesmo arquivo, isso é um formato de produto diferente (a saída clássica no estilo OCRmyPDF). Este endpoint serve para o texto que um agente ou um pipeline consegue ler.

Auto e Force OCR:

  • Qualquer valor diferente de ocrType=force-ocr (incluindo o rótulo "Normal" do portal) corresponde ao modo Auto: reaproveita o texto existente onde houver e aplica OCR nas páginas que são só imagem.
  • force-ocr relê todas as páginas, inclusive as que já têm camada de texto.

Não há seletor de idioma no formulário do portal. Campos no estilo tessdata que sobraram de caminhos antigos (languages, deskew, opções de limpeza e afins) são ignorados pelo caminho Rust ocr_pdf. Os modos Auto e Force, e o motivo pelo qual o reconhecimento falha em digitalizações ruins, estão em Como o OCR lê um PDF digitalizado.

O OCR não encolhe o PDF. O download em Markdown é um segundo artefato, ao lado do pacote de digitalização original.

Onde o Compress entra

O Comprimir (POST /api/v1/misc/compress-pdf) roda a compressão de streams do qpdf: --compress-streams=y, recompressão Flate e geração de object streams. Ele não inventa camada de texto, não cria subconjuntos de fontes e não promete redução de resolução das imagens. Num arquivo pesado de digitalização, ainda pode encolher o armazenamento empacotando os streams com mais força; num arquivo já apertado, o ganho pode ser pequeno. Para o contexto sobre alavancas de stream e de imagem, veja O que acontece de fato quando você comprime um PDF.

Use o Compress no PDF que você vai arquivar ou enviar por e-mail. Use a saída em Markdown do OCR quando você precisar das palavras. Comprimir primeiro não torna o OCR mais preciso; fazer OCR primeiro não torna o PDF menor.

Uma ordem prática

  1. Se o visualizador não abrir o pacote, use Repair ou Get Info primeiro.
  2. Aplique OCR no pacote de digitalização para obter Markdown e confira por amostragem algumas páginas de texto.
  3. Em separado, use o Compress numa cópia do PDF se o tamanho for o problema que resta.
  4. Guarde o original intocado quando a sua política exigir.

Criptografar um arquivo ainda exige um Desbloquear autorizado antes de qualquer um dos passos. Segredos pedem Sanitize / Auto Redact, não OCR. Uma exportação de tabela que retorna 204 depois de uma digitalização significa que nenhuma coluna de texto foi encontrada: faça o OCR para Markdown primeiro e só então decida se uma ferramenta de planilha chega a se aplicar (Exportação de tabela vazia (204)).

Saídas que você precisa acompanhar

Depois de uma execução típica, você pode ter três artefatos: o pacote de digitalização original, um download .md do OCR e, opcionalmente, uma cópia comprimida do PDF. Etiquete cada um. Enviar só o Markdown perde as imagens das páginas; enviar só o PDF comprimido continua sem a camada de selecionar e buscar deste caminho de OCR. Pipelines que precisam das palavras e de um PDF menor têm de guardar as duas saídas ou executar um dos lados de novo depois.

O Force OCR num pacote nativo digital com camada de texto quebrada ainda pode ser útil; o Auto num pacote nativo digital limpo pode nem carregar o runtime de OCR. Nenhum dos modos grava texto de volta no PDF.

O que este fluxo de trabalho não é

Pacotes de digitalização dão errado quando as equipes supõem que um único botão extrai o texto e encolhe os pixels, como faria um fluxo de desktop no estilo OCRmyPDF. Aqui o texto sai como Markdown; o PDF continua PDF, a menos que você use o Comprimir de propósito. Não existe neste site um passo que devolva "o mesmo PDF, agora pesquisável e menor" numa única chamada.

Para automatizar as mesmas operações via HTTP, veja Desenvolvedores.

Open tool
Process in the browser — no watermark, files removed after the job.
Open tool