Formats2026-09-202 Min. Lesezeit

Was in einer PDF steckt: Objekte, Streams und die Querverweistabelle

Eine PDF ist ein Graph nummerierter Objekte, komprimierter Streams und einer xref aus Byte-Offsets. Get Info prüft sie; Reparieren baut die Struktur bei Bruch neu.

PDF123 · Updated 2026-09-20

Eine PDF ist keine flache Sammlung von Seiten. Sie ist eine kleine Datenbank aus Objekten, von denen viele als komprimierte Streams gespeichert sind und die über eine Querverweistabelle (xref) gefunden werden, damit ein Leser direkt zu Objekt 17 springen kann, ohne die ganze Datei zu durchsuchen. Bricht diese Karte, nennen Betrachter die Datei beschädigt, obwohl die Bytes der Seiten noch auf der Festplatte liegen.

Objekte

Alles Interessante (Seiten, Schriften, Bilder, Metadaten, der Katalog des Dokuments) ist ein Objekt mit einer Nummer. Seiten zeigen auf Content-Streams und Ressourcen, Ressourcen zeigen auf Schriften und XObjects, der Katalog zeigt auf den Seitenbaum. Werkzeuge zum Zusammenführen, Drehen oder Stempeln schreiben meist dieses Geflecht um, statt Pixel neu zu zeichnen.

Streams

Ein Stream ist ein Objekt, dessen Nutzlast eine Folge von Bytes ist, oft mit Flate komprimiert: Operatoren des Seiteninhalts, eingebettete Schriftdateien, Bilddaten. Deshalb zeigt eine PDF in einem Texteditor eine Mischung aus ASCII-Tokens und binären Blöcken. Streams zu entpacken (ohne das Aussehen der Seiten zu ändern) hilft bei der Fehlersuche; Komprimieren auf dieser Website komprimiert diese Streams mit qpdf neu, es tastet keine Bilder ab und subsettet keine Schriften.

Die Querverweistabelle

Nahe dem Ende einer typischen Datei listet ein Abschnitt der xref (oder in neueren Dateien ein xref-Stream) die Byte-Offsets für jede Objektnummer auf. Leser springen zu diesen Offsets. Abgebrochene Downloads, fehlerhafte Zusammenführungen und halb geschriebene Speicherungen lassen den Trailer oft auf Offsets zeigen, die nicht mehr passen. Die Pixel der ersten Seite mögen noch vorhanden sein; die Karte, die „Seite eins“ findet, ist es nicht.

Deshalb ist die strukturelle Reparatur eine andere Aufgabe als OCR oder das Entsperren: Die Reparatur baut die interne Struktur aus gültigen Resten neu auf, sie erfindet keine fehlende Seitenkunst und errät kein Passwort.

Erst prüfen, dann umschreiben

Get Info zu PDF liefert einen Bericht in JSON (Seitenzahl, Metadaten, Schriften, strukturelle Details) und keine veränderte PDF. Nutze ihn, wenn du wissen musst, was du in der Hand hältst, bevor du komprimierst, konvertierst oder reparierst.

Wenn sich die Datei in einem Betrachter überhaupt nicht öffnen lässt, versuche PDF reparieren, das die Struktur einschließlich der Wiederherstellung der Querverweise neu aufbaut. Öffnet sich die Datei, lässt sich gescannter Text aber nicht markieren, ist das ein Problem von OCR und keines der xref.

Eine kurze Reihenfolge der Entscheidungen

  1. Die Datei lässt sich nicht öffnen → zuerst Reparieren.
  2. Die Datei öffnet sich und du brauchst Fakten (Seiten, Schriften, Hinweise auf Verschlüsselung) → Get Info.
  3. Die Struktur ist in Ordnung und du willst eine kleinere Datei oder lesbaren Text aus einem Scan → Komprimieren für die Größe oder OCR für Text in Markdown, und keinen weiteren Durchlauf der Reparatur.

Get Info und Reparieren laufen ohne Konto. Dieselben Operationen über HTTP beschreibt Entwickler. Wie sich die Reparatur von markenbezogenen Desktopprodukten zur „Wiederherstellung“ unterscheidet, steht in PDF-Reparatur online gegenüber Suchen nach Recovery Toolbox.

Open tool
Process in the browser — no watermark, files removed after the job.
Open tool