Formats2026-09-202 мин четене

Какво има вътре в PDF: обекти, потоци и таблицата с кръстосани препратки

PDF е граф от номерирани обекти, компресирани потоци и xref с отмествания в байтове. Get Info го преглежда; Repair възстановява структурата, когато картата се счупи.

PDF123 · Updated 2026-09-20

PDF не е плосък набор от страници. Той е малка база данни от обекти, много от които се съхраняват като компресирани потоци, намирани чрез таблица с кръстосани препратки (xref), така че читателят да скочи до обект 17, без да обхожда целия файл. Когато тази карта се счупи, програмите за преглед обявяват файла за повреден, дори когато байтовете на страниците още са на диска.

Обекти

Всичко интересно (страници, шрифтове, изображения, метаданни, каталогът на документа) е обект с номер. Страниците сочат към потоци със съдържание и ресурси; ресурсите сочат към шрифтове и XObjects; каталогът сочи към дървото на страниците. Инструментите, които сливат, завъртат или поставят печат, най-вече пренаписват този граф, вместо да прерисуват пиксели.

Потоци

Потокът е обект, чието съдържание е последователност от байтове, често компресирана с Flate: оператори за съдържанието на страницата, вградени файлове на шрифтове, данни за изображения. Затова погледнат в текстов редактор, PDF показва смесица от ASCII токени и двоични блокове. Разгъването на потоците (без да се променя как изглеждат страниците) е полезно за отстраняване на грешки; Compress на този сайт прекомпресира тези потоци с qpdf, а не намалява разделителната способност на изображенията или прави подмножество на шрифтове.

Таблицата с кръстосани препратки

Близо до края на типичния файл секция xref (или xref поток в по-новите файлове) изброява отместванията в байтове за всеки номер на обект. Читателите търсят на тези отмествания. Прекъснати изтегляния, лоши сливания и наполовина записани файлове често оставят trailer-а да сочи към отмествания, които вече не съвпадат. Пикселите на първата страница може още да съществуват; картата, която намира „първата страница“, не.

Затова структурната поправка е различна задача от OCR или отключването: поправката възстановява вътрешната структура от валидните остатъци; тя не създава липсваща графика на страница или не отгатва парола.

Прегледайте, преди да пренаписвате

Get Info on PDF връща JSON отчет (брой страници, метаданни, шрифтове, структурни подробности), а не променен PDF. Използвайте го, когато трябва да знаете какво държите, преди да компресирате, преобразувате или поправяте.

Ако програма за преглед откаже да отвори файла изобщо, опитайте Repair PDF, който възстановява структурата, включително възстановяване на кръстосаните препратки. Ако файлът се отваря, но сканираният текст не може да се маркира, това е проблем за OCR, а не за xref.

Кратък ред за решения

  1. Файлът не се отваря → първо Repair.
  2. Файлът се отваря; трябват ви факти (страници, шрифтове, следи за шифроване) → Get Info.
  3. Структурата е наред; искате по-малък файл или четим текст от сканиране → Compress за размер или OCR за текст Markdown, а не още едно поправяне.

И Get Info, и Repair работят без акаунт. За същите операции по HTTP вижте Developers. За това как Repair се различава от брандираните настолни продукти за „възстановяване“ вижте PDF Repair онлайн срещу търсения за Recovery Toolbox.

Open tool
Process in the browser — no watermark, files removed after the job.
Open tool