Formats2026-09-202 min. lezen

Wat zit er in een PDF: objecten, streams en de cross-referentietabel

Een PDF is een grafiek van genummerde objecten, gecomprimeerde streams en een xref-kaart. Get Info inspecteert; Repair herbouwt structuur als die kaart breekt.

PDF123 · Updated 2026-09-20

Een PDF is geen platte dump van pagina's. Het is een kleine database van objecten, vaak opgeslagen als gecomprimeerde streams, gelokaliseerd via een cross-referentietabel (xref), zodat een lezer naar object 17 kan springen zonder het hele bestand te scannen. Breekt die kaart, dan noemen viewers het bestand beschadigd, ook als de paginabytes nog op schijf staan.

Objecten

Alles wat interessant is (pagina's, fonts, afbeeldingen, metadata, de documentcatalogus) is een object met een nummer. Pagina's wijzen naar contentstreams en resources; resources wijzen naar fonts en XObjects; de catalogus wijst naar de paginaboom. Tools die samenvoegen, roteren of stempelen herschrijven meestal die grafiek in plaats van pixels opnieuw te tekenen.

Streams

Een stream is een object waarvan de payload een reeks bytes is, vaak Flate-gecomprimeerd: operators voor pagina-inhoud, ingebedde fontbestanden, beeldgegevens. Daarom ziet u in een teksteditor een mengeling van ASCII-tokens en binaire blokken. Streams uitvouwen (zonder het uiterlijk van de pagina's te veranderen) is nuttig voor foutopsporing; Compress op deze site hercomprimeert die streams met qpdf en past geen beelddownsampling of font-subsets toe.

De cross-referentietabel

Nabij het einde van een typisch bestand somt een xref-sectie (of een xref-stream in nieuwere bestanden) de byte-offsets op voor elk objectnummer. Lezers zoeken die offsets op. Afgebroken downloads, mislukte samenvoegingen en half weggeschreven saves laten de trailer vaak naar offsets wijzen die niet meer kloppen. De pixels van pagina één kunnen nog bestaan; de kaart die “pagina één” vindt, bestaat niet meer.

Daarom is structurele reparatie een andere taak dan OCR of ontgrendelen: reparatie herbouwt de interne structuur uit geldige resten; het verzint geen ontbrekende pagina-afbeeldingen en raadt geen wachtwoord.

Inspecteer voordat u herschrijft

Get Info on PDF levert een JSON-rapport op (pagina-aantal, metadata, fonts, structurele details), geen gewijzigde PDF. Gebruik het wanneer u wilt weten wat u in handen hebt voordat u comprimeert, converteert of repareert.

Weigert een viewer het bestand helemaal te openen, probeer dan Repair PDF, dat de structuur herbouwt, inclusief herstel van de cross-referentietabel. Opent het bestand wel, maar is gescande tekst niet selecteerbaar, dan is dat een OCR-probleem en geen xref-probleem.

Een korte beslisvolgorde

  1. Het bestand gaat niet open → eerst Repair.
  2. Het bestand opent; u wilt feiten (pagina's, fonts, aanwijzingen over versleuteling) → Get Info.
  3. De structuur is in orde; u wilt een kleiner bestand of leesbare tekst uit een scan → Compress voor de grootte, of OCR voor Markdown-tekst, geen nieuwe reparatieronde.

Zowel Get Info als Repair draaien zonder account. Voor dezelfde bewerkingen via HTTP, zie Developers. Voor het verschil tussen Repair en merkgebonden desktopproducten voor “recovery”, zie PDF Repair Online vs Recovery Toolbox searches.

Open tool
Process in the browser — no watermark, files removed after the job.
Open tool