Formats2026-09-202 λεπ. ανάγνωση

Τι περιέχει ένα PDF: αντικείμενα, ροές και ο πίνακας διασταύρωσης αναφορών

Ένα PDF είναι γράφος αντικειμένων, συμπιεσμένων ροών και πίνακα xref με μετατοπίσεις bytes. Το Get Info το επιθεωρεί και το Repair ξαναχτίζει τη δομή όταν σπάσει.

PDF123 · Updated 2026-09-20

Ένα PDF δεν είναι επίπεδη συσσώρευση σελίδων. Είναι μια μικρή βάση δεδομένων από αντικείμενα, πολλά αποθηκευμένα ως συμπιεσμένες ροές, εντοπισμένα μέσω ενός πίνακα διασταύρωσης αναφορών (xref), ώστε ο αναγνώστης να πηγαίνει στο αντικείμενο 17 χωρίς να σαρώσει ολόκληρο το αρχείο. Όταν αυτός ο χάρτης σπάσει, τα προγράμματα προβολής αποκαλούν το αρχείο κατεστραμμένο ακόμη κι αν τα bytes των σελίδων βρίσκονται ακόμη στον δίσκο.

Αντικείμενα

Κάθε ενδιαφέρον στοιχείο (σελίδες, γραμματοσειρές, εικόνες, μεταδεδομένα, ο κατάλογος του εγγράφου) είναι ένα αντικείμενο με αριθμό. Οι σελίδες δείχνουν σε ροές περιεχομένου και πόρους· οι πόροι δείχνουν σε γραμματοσειρές και XObjects· ο κατάλογος δείχνει στο δέντρο σελίδων. Τα εργαλεία που συγχωνεύουν, περιστρέφουν ή σφραγίζουν συνήθως ξαναγράφουν αυτόν τον γράφο αντί να ξαναζωγραφίζουν εικονοστοιχεία.

Ροές

Μια ροή είναι ένα αντικείμενο του οποίου το φορτίο είναι ακολουθία bytes, συχνά συμπιεσμένη με Flate: τελεστές περιεχομένου σελίδας, ενσωματωμένα αρχεία γραμματοσειρών, δεδομένα εικόνων. Γι' αυτόν τον λόγο το άνοιγμα ενός PDF σε επεξεργαστή κειμένου δείχνει μείγμα από διακριτικά ASCII και δυαδικά τμήματα. Η επέκταση των ροών (χωρίς αλλαγή στην εμφάνιση των σελίδων) είναι χρήσιμη για αποσφαλμάτωση· η Συμπίεση σε αυτόν τον ιστότοπο επανασυμπιέζει εκείνες τις ροές με qpdf, χωρίς υποδειγματοληψία εικόνων ή υποσυνολοποίηση γραμματοσειρών.

Ο πίνακας διασταύρωσης αναφορών

Προς το τέλος ενός τυπικού αρχείου, ένα τμήμα xref (ή ροή xref σε νεότερα αρχεία) απαριθμεί μετατοπίσεις bytes για κάθε αριθμό αντικειμένου. Οι αναγνώστες μετακινούνται σε εκείνες τις μετατοπίσεις. Οι κολοβωμένες λήψεις, οι κακές συγχωνεύσεις και οι μισογραμμένες αποθηκεύσεις αφήνουν συχνά το trailer να δείχνει σε μετατοπίσεις που δεν ταιριάζουν πια. Τα εικονοστοιχεία της πρώτης σελίδας μπορεί να υπάρχουν ακόμη· ο χάρτης που βρίσκει την «πρώτη σελίδα» όχι.

Γι' αυτό η δομική επισκευή είναι διαφορετική δουλειά από το OCR ή το ξεκλείδωμα: η επισκευή ξαναχτίζει την εσωτερική δομή από έγκυρα υπολείμματα· δεν επινοεί γραφικά σελίδων που λείπουν ούτε μαντεύει κωδικό.

Επιθεωρήστε πριν ξαναγράψετε

Το Get Info on PDF επιστρέφει αναφορά JSON (πλήθος σελίδων, μεταδεδομένα, γραμματοσειρές, δομικές λεπτομέρειες), όχι τροποποιημένο PDF. Χρησιμοποιήστε το όταν θέλετε να ξέρετε τι κρατάτε πριν από συμπίεση, μετατροπή ή επισκευή.

Αν ένα πρόγραμμα προβολής αρνείται εντελώς να ανοίξει το αρχείο, δοκιμάστε το Repair PDF, που ξαναχτίζει τη δομή, μαζί με την ανάκτηση του πίνακα διασταύρωσης αναφορών. Αν το αρχείο ανοίγει αλλά το σαρωμένο κείμενο δεν είναι επιλέξιμο, αυτό είναι πρόβλημα OCR, όχι πρόβλημα xref.

Μια σύντομη σειρά αποφάσεων

  1. Το αρχείο δεν ανοίγει → πρώτα Repair.
  2. Το αρχείο ανοίγει· χρειάζεστε στοιχεία (σελίδες, γραμματοσειρές, ενδείξεις κρυπτογράφησης) → Get Info.
  3. Η δομή είναι εντάξει· θέλετε μικρότερο αρχείο ή αναγνώσιμο κείμενο από σάρωση → Συμπίεση για μέγεθος ή OCR για κείμενο Markdown, όχι άλλο πέρασμα επισκευής.

Τα Get Info και Repair εκτελούνται χωρίς λογαριασμό. Για τις ίδιες λειτουργίες μέσω HTTP, δείτε τους Προγραμματιστές. Για το πώς διαφέρει το Repair από τα εμπορικά προϊόντα «ανάκτησης» για υπολογιστή, δείτε το Διαδικτυακή επισκευή PDF και αναζητήσεις για Recovery Toolbox.

Open tool
Process in the browser — no watermark, files removed after the job.
Open tool