PPDF123
Formats2026-09-202 хв читання

Що всередині PDF: об’єкти, потоки й таблиця перехресних посилань

PDF — це граф пронумерованих об’єктів, стиснутих потоків і таблиці перехресних посилань. Get Info його оглядає, а Repair відбудовує структуру, коли карта ламається.

PDF123 · Updated 2026-09-20

PDF — це не плаский набір сторінок. Це невелика база даних із об’єктів, багато з яких зберігаються як стиснуті потоки, а знаходять їх за таблицею перехресних посилань (xref), тож читач може стрибнути до об’єкта 17, не скануючи весь файл. Коли ця карта ламається, переглядачі називають файл пошкодженим, навіть якщо байти сторінок усе ще лежать на диску.

Об’єкти

Усе цікаве (сторінки, шрифти, зображення, метадані, каталог документа) є об’єктом із номером. Сторінки вказують на потоки вмісту й ресурси; ресурси вказують на шрифти та XObject-и; каталог вказує на дерево сторінок. Інструменти, які об’єднують, обертають чи ставлять штамп, здебільшого переписують цей граф, а не перемальовують пікселі.

Потоки

Потік — це об’єкт, чиє корисне навантаження є послідовністю байтів, часто стиснутою Flate: оператори вмісту сторінки, вбудовані файли шрифтів, дані зображень. Саме тому PDF у текстовому редакторі виглядає як суміш ASCII-токенів і бінарних блоків. Розгортання потоків (без зміни вигляду сторінок) корисне для зневадження; Стиснути на цьому сайті перестискає ці потоки через qpdf — воно не зменшує роздільність зображень і не субсетує шрифти.

Таблиця перехресних посилань

Ближче до кінця типового файлу розділ xref (або потік xref у новіших файлах) перелічує зсуви в байтах для кожного номера об’єкта. Читачі переходять за цими зсувами. Обрізані звантаження, невдалі об’єднання й наполовину записані збереження часто лишають трейлер, що вказує на зсуви, які вже не відповідають дійсності. Пікселі першої сторінки можуть усе ще існувати; карти, яка знаходить «першу сторінку», немає.

Тому структурне відновлення — інша задача, ніж OCR чи розблокування: відновлення відбудовує внутрішню структуру з цілих залишків; воно не вигадує відсутню графіку сторінок і не вгадує пароль.

Огляд перед переписуванням

Отримати інформацію про PDF повертає звіт у JSON (кількість сторінок, метадані, шрифти, структурні подробиці), а не змінений PDF. Скористайтеся ним, коли потрібно знати, що саме у вас в руках, перш ніж стискати, конвертувати чи відновлювати.

Якщо переглядач узагалі відмовляється відкривати файл, спробуйте Відновити PDF, який відбудовує структуру, зокрема відновлює перехресні посилання. Якщо файл відкривається, але відсканований текст не виділяється, це проблема OCR, а не xref.

Короткий порядок рішень

  1. Файл не відкривається → спершу Відновлення.
  2. Файл відкривається; потрібні факти (сторінки, шрифти, натяки на шифрування) → Отримати інформацію.
  3. Структура ціла; потрібен менший файл або читабельний текст зі скану → Стиснути для розміру або OCR для тексту Markdown, а не ще один прохід відновлення.

І Get Info, і Repair працюють без облікового запису. Про ті самі операції через HTTP див. Розробникам. Про те, чим Repair відрізняється від брендових настільних продуктів «відновлення», див. Відновлення PDF онлайн проти пошуку Recovery Toolbox.

Open tool
Process in the browser — no watermark, files removed after the job.
Open tool