Què hi ha dins d'un PDF: objectes, fluxos i la taula de referències creuades
Un PDF és un graf d'objectes numerats, fluxos comprimits i una taula xref d'offsets de bytes. Get Info l'inspecciona i Repara en reconstrueix l'estructura.

Un PDF no és un abocament pla de pàgines. És una petita base de dades d'objectes, molts dels quals s'emmagatzemen com a fluxos comprimits, localitzats per una taula de referències creuades (xref) perquè un lector pugui saltar a l'objecte 17 sense recórrer tot el fitxer. Quan aquell mapa es trenca, els visors diuen que el fitxer està danyat encara que els bytes de la pàgina siguin al disc.
Objectes
Tot el que té interès (pàgines, fonts, imatges, metadades, el catàleg del document) és un objecte amb un número. Les pàgines apunten a fluxos de contingut i recursos; els recursos apunten a fonts i XObjects; el catàleg apunta a l'arbre de pàgines. Les eines que uneixen, giren o segellen reescriuen sobretot aquest graf en lloc de redibuixar píxels.
Fluxos
Un flux és un objecte la càrrega útil del qual és una seqüència de bytes, sovint comprimida amb Flate: operadors de contingut de pàgina, fitxers de font incrustats, dades d'imatge. Per això, mirar un PDF en un editor de text mostra una barreja de testimonis ASCII i blocs binaris. Expandir els fluxos (sense canviar l'aspecte de les pàgines) és útil per depurar; Comprimeix en aquest lloc recomprimeix aquells fluxos amb qpdf, però no redueix la resolució de les imatges ni fa subconjunts de fonts.
La taula de referències creuades
Cap al final d'un fitxer típic, una secció xref (o un flux xref en els fitxers més nous) llista els offsets de bytes de cada número d'objecte. Els lectors hi busquen aquells offsets. Les descàrregues truncades, les unions dolentes i els desaments a mig escriure sovint deixen el tràiler apuntant a offsets que ja no coincideixen. Els píxels de la pàgina u poden continuar existint; el mapa que troba «la pàgina u», no.
Per això la reparació estructural és una tasca diferent de l'OCR o del desbloqueig: la reparació reconstrueix l'estructura interna a partir de les restes vàlides; no inventa l'art de pàgina que falta ni endevina una contrasenya.
Inspeccioneu abans de reescriure
Informació d'un PDF retorna un informe JSON (recompte de pàgines, metadades, fonts i detalls estructurals), no un PDF modificat. Feu-lo servir quan necessiteu saber què teniu a les mans abans de comprimir, convertir o reparar.
Si un visor es nega a obrir el fitxer de cap manera, proveu Repara PDF, que reconstrueix l'estructura, incloent-hi la recuperació de les referències creuades. Si el fitxer s'obre però el text escanejat no es pot seleccionar, això és un problema d'OCR, no d'xref.
Un ordre de decisió breu
- El fitxer no s'obre → primer Repara.
- El fitxer s'obre i necessiteu dades (pàgines, fonts, indicis de xifratge) → Informació.
- L'estructura està bé i voleu un fitxer més petit o text llegible d'un escaneig → Comprimeix per a la mida, o OCR per a text Markdown, no una altra passada de reparació.
Tant Informació com Repara s'executen sense compte. Per a les mateixes operacions per HTTP, vegeu Desenvolupadors. Per saber en què es diferencia Repara dels productes d'escriptori de «recuperació» amb marca, vegeu Reparar PDF en línia vs cerques de Recovery Toolbox.