Formats2026-09-202 min di lettura

Cosa c'è dentro un PDF: oggetti, stream e la tabella cross-reference

Un PDF è un grafo di oggetti numerati, stream compressi e una mappa xref. Get Info lo ispeziona; Repair ricostruisce la struttura quando la mappa si rompe.

PDF123 · Updated 2026-09-20

Un PDF non è una sequenza piatta di pagine. È un piccolo database di oggetti, molti dei quali memorizzati come stream compressi, individuati da una tabella cross-reference (xref), così un lettore può saltare all'oggetto 17 senza scansionare l'intero file. Quando quella mappa si rompe, i visualizzatori dichiarano il file danneggiato anche se i byte delle pagine sono ancora sul disco.

Oggetti

Tutto ciò che conta (pagine, font, immagini, metadati, catalogo del documento) è un oggetto con un numero. Le pagine puntano a stream di contenuto e risorse; le risorse puntano a font e XObject; il catalogo punta all'albero delle pagine. Gli strumenti che uniscono, ruotano o applicano timbri riscrivono per lo più quel grafo, invece di ridisegnare i pixel.

Stream

Uno stream è un oggetto il cui payload è una sequenza di byte, spesso compressa con Flate: operatori di contenuto della pagina, file di font incorporati, dati immagine. Per questo, guardare un PDF in un editor di testo mostra un misto di token ASCII e blocchi binari. Espandere gli stream (senza cambiare l'aspetto delle pagine) è utile per il debug; Comprimi su questo sito ricomprime quegli stream con qpdf: non esegue il downsampling delle immagini né il subsetting dei font.

La tabella cross-reference

Verso la fine di un file tipico, una sezione xref (o uno stream xref nei file più recenti) elenca gli offset in byte di ogni numero di oggetto. I lettori si spostano su quegli offset. Download troncati, merge mal eseguiti e salvataggi interrotti lasciano spesso il trailer con puntatori a offset che non corrispondono più. I pixel della prima pagina possono esistere ancora; la mappa che trova la «prima pagina» no.

Ecco perché la riparazione strutturale è un lavoro diverso dall'OCR o dallo sblocco: Repair ricostruisce la struttura interna dai resti validi, non inventa le immagini di pagina mancanti né indovina una password.

Ispeziona prima di riscrivere

Get Info su PDF restituisce un report JSON (numero di pagine, metadati, font, dettagli strutturali), non un PDF modificato. Usalo quando devi sapere cosa hai in mano prima di comprimere, convertire o riparare.

Se un visualizzatore rifiuta del tutto di aprire il file, prova Ripara PDF, che ricostruisce la struttura, compreso il recupero della cross-reference. Se invece il file si apre ma il testo scansionato non è selezionabile, quello è un problema di OCR, non di xref.

Un breve ordine di decisione

  1. Il file non si apre → prima Ripara.
  2. Il file si apre e ti servono i fatti (pagine, font, indizi sulla cifratura) → Get Info.
  3. La struttura è a posto e vuoi un file più piccolo o testo leggibile da una scansione → Comprimi per la dimensione, oppure OCR per il testo Markdown, non un altro passaggio di riparazione.

Sia Get Info sia Repair funzionano senza account. Per le stesse operazioni via HTTP, vedi Developers. Per capire come Repair si distingue dai prodotti desktop di «recovery» di marca, vedi Riparare un PDF online e le ricerche Recovery Toolbox.

Open tool
Process in the browser — no watermark, files removed after the job.
Open tool