Formats2026-09-203 min de lecture

Ce qu’il y a dans un PDF : objets, flux et table de références croisées

Un PDF est un graphe d’objets numérotés et de flux compressés, indexés par une table xref. Get Info l’analyse ; Réparer la reconstruit quand cette carte casse.

PDF123 · Updated 2026-09-20

Un PDF n’est pas un simple empilement de pages. C’est une petite base de données d’objets, souvent stockés sous forme de flux compressés et localisés grâce à une table de références croisées (xref), pour qu’un lecteur puisse atteindre l’objet 17 sans parcourir tout le fichier. Quand cette carte casse, les lecteurs déclarent le fichier endommagé même si les octets des pages sont toujours sur le disque.

Les objets

Tout ce qui compte (pages, polices, images, métadonnées, catalogue du document) est un objet doté d’un numéro. Les pages pointent vers des flux de contenu et des ressources ; les ressources pointent vers des polices et des XObjects ; le catalogue pointe vers l’arbre des pages. Les outils qui fusionnent, font pivoter ou apposent un tampon réécrivent surtout ce graphe, plutôt que de redessiner des pixels.

Les flux

Un flux est un objet dont la charge utile est une suite d’octets, souvent compressée en Flate : opérateurs de contenu de page, fichiers de polices intégrés, données d’image. C’est pourquoi un PDF ouvert dans un éditeur de texte affiche un mélange de jetons ASCII et de blocs binaires. Déplier les flux (sans changer l’apparence des pages) aide au débogage ; Compresser sur ce site recompresse ces flux avec qpdf : il ne sous-échantillonne pas les images et ne réduit pas les polices.

La table de références croisées

Vers la fin d’un fichier typique, une section xref (ou un flux xref dans les fichiers récents) énumère les décalages d’octets de chaque numéro d’objet. Les lecteurs se positionnent à ces décalages. Un téléchargement tronqué, une mauvaise fusion ou un enregistrement interrompu laisse souvent le trailer pointer vers des décalages qui ne correspondent plus. Les pixels de la première page peuvent encore exister ; la carte qui permet de la trouver, non.

C’est pourquoi la réparation structurelle est une autre tâche que l’OCR ou le déverrouillage : réparer reconstruit la structure interne à partir des fragments valides ; l’opération n’invente pas les images de page manquantes et ne devine aucun mot de passe.

Inspecter avant de réécrire

Get Info sur PDF renvoie un rapport JSON (nombre de pages, métadonnées, polices, détails structurels), et non un PDF modifié. Utilisez-le lorsque vous devez savoir ce que vous tenez avant de compresser, convertir ou réparer.

Si un lecteur refuse complètement d’ouvrir le fichier, essayez Réparer PDF, qui reconstruit la structure, y compris la table de références croisées. Si le fichier s’ouvre mais que le texte d’un scan n’est pas sélectionnable, c’est un problème d’OCR, pas de xref.

Un ordre de décision en trois temps

  1. Le fichier ne s’ouvre pas → Réparer d’abord.
  2. Le fichier s’ouvre et vous avez besoin de faits (pages, polices, indices de chiffrement) → Get Info.
  3. La structure est saine et vous voulez un fichier plus léger ou du texte lisible depuis un scan → Compresser pour la taille, ou OCR pour du texte Markdown, et non une nouvelle passe de réparation.

Get Info et Réparer fonctionnent sans compte. Pour les mêmes opérations en HTTP, voir Développeurs. Pour savoir en quoi Réparer diffère des produits de « récupération » de bureau de marque, voir Réparation PDF en ligne vs recherches Recovery Toolbox.

Open tool
Process in the browser — no watermark, files removed after the job.
Open tool