Formats2026-09-203 min de leitura

O que há dentro de um PDF: objetos, streams e a tabela de referência cruzada

Um PDF é um grafo de objetos numerados, streams comprimidos e um mapa xref. O Get Info inspeciona tudo isso; o Repair reconstrói a estrutura quando esse mapa quebra.

PDF123 · Updated 2026-09-20

Um PDF não é um amontoado plano de páginas. É um pequeno banco de objetos, muitos guardados como streams comprimidos, localizados por uma tabela de referência cruzada (xref) que permite ao leitor pular direto ao objeto 17 sem varrer o arquivo inteiro. Quando esse mapa quebra, os visualizadores chamam o arquivo de danificado, mesmo que os bytes das páginas ainda estejam no disco.

Objetos

Tudo o que interessa (páginas, fontes, imagens, metadados, o catálogo do documento) é um objeto com um número. As páginas apontam para fluxos de conteúdo e recursos; os recursos apontam para fontes e XObjects; o catálogo aponta para a árvore de páginas. Ferramentas que mesclam, rotacionam ou carimbam em geral reescrevem esse grafo em vez de redesenhar pixels.

Streams

Um stream é um objeto cuja carga útil é uma sequência de bytes, muitas vezes comprimida com Flate: operadores de conteúdo de página, arquivos de fonte embutidos, dados de imagem. É por isso que olhar um PDF num editor de texto revela uma mistura de tokens ASCII e blocos binários. Expandir os streams (sem mudar a aparência das páginas) ajuda na depuração; o Comprimir deste site recomprime esses streams com o qpdf, sem reduzir a resolução de imagens nem subdividir fontes.

A tabela de referência cruzada

Perto do fim de um arquivo típico, uma seção xref (ou um xref stream, em arquivos mais novos) lista o deslocamento em bytes de cada número de objeto. O leitor salta para esses deslocamentos. Downloads truncados, mesclagens malfeitas e gravações interrompidas na metade costumam deixar o trailer apontando para posições que já não batem. Os pixels da página um podem continuar existindo; o mapa que encontra a "página um" não.

É por isso que o reparo estrutural é um trabalho diferente do OCR ou do desbloqueio: o reparo reconstrói a estrutura interna a partir dos restos válidos; ele não inventa o conteúdo gráfico que falta nem adivinha uma senha.

Inspecione antes de reescrever

O Get Info de PDF devolve um relatório em JSON (contagem de páginas, metadados, fontes, detalhes estruturais), não um PDF modificado. Use-o quando precisar saber o que você tem em mãos antes de comprimir, converter ou reparar.

Se o visualizador se recusa a abrir o arquivo, tente o Repair PDF, que reconstrói a estrutura incluindo a recuperação da referência cruzada. Se o arquivo abre, mas o texto digitalizado não pode ser selecionado, isso é um problema de OCR, não de xref.

Uma ordem de decisão curta

  1. O arquivo não abre → Repair primeiro.
  2. O arquivo abre e você precisa de fatos (páginas, fontes, indícios de criptografia) → Get Info.
  3. A estrutura está bem e você quer um arquivo menor ou o texto de uma digitalização → Comprimir para tamanho, ou OCR para texto em Markdown, não outra passagem de reparo.

O Get Info e o Repair rodam sem conta. Para as mesmas operações por HTTP, veja Desenvolvedores. Para entender como o Repair difere dos produtos de "recuperação" de marca para desktop, veja Reparar PDF online vs buscas por Recovery Toolbox.

Open tool
Process in the browser — no watermark, files removed after the job.
Open tool