Co jest w środku PDF: obiekty, strumienie i tabela odsyłaczy
PDF to graf numerowanych obiektów, skompresowanych strumieni i tabeli odsyłaczy z przesunięciami bajtów. Gdy mapa się psuje, Repair odbudowuje strukturę.

PDF nie jest płaskim zrzutem stron. To niewielka baza obiektów, z których wiele jest przechowywanych jako skompresowane strumienie, a położenie każdego wskazuje tabela odsyłaczy (xref), dzięki czemu czytnik może przeskoczyć do obiektu 17 bez przeszukiwania całego pliku. Gdy ta mapa się psuje, przeglądarki uznają plik za uszkodzony, nawet jeśli bajty stron wciąż leżą na dysku.
Obiekty
Wszystko, co ciekawe (strony, fonty, obrazy, metadane, katalog dokumentu), jest obiektem z numerem. Strony wskazują na strumienie treści i zasoby, zasoby na fonty i obiekty XObject, a katalog na drzewo stron. Narzędzia do scalania, obracania czy stemplowania w większości przepisują ten graf, a nie przerysowują piksele.
Strumienie
Strumień to obiekt, którego ładunkiem jest sekwencja bajtów, często skompresowana Flate: operatory treści strony, osadzone pliki fontów, dane obrazów. Dlatego otwarcie PDF-a w edytorze tekstu pokazuje mieszaninę tokenów ASCII i binarnych bloków. Rozwijanie strumieni (bez zmiany wyglądu stron) przydaje się przy debugowaniu; Compress w tym serwisie kompresuje te strumienie ponownie przez qpdf, ale nie zmniejsza rozdzielczości obrazów ani nie zawęża fontów.
Tabela odsyłaczy
Pod koniec typowego pliku sekcja xref (albo strumień xref w nowszych plikach) wymienia przesunięcia bajtowe dla każdego numeru obiektu. Czytniki przeskakują pod te przesunięcia. Przerwane pobierania, błędne scalenia i połowicznie zapisane pliki często zostawiają trailer wskazujący przesunięcia, które już nie pasują. Piksele pierwszej strony mogą wciąż istnieć, ale mapa, która je odnajduje, już nie.
Dlatego naprawa struktury to inne zadanie niż OCR albo odblokowanie: odbudowuje wewnętrzną strukturę z zachowanych, poprawnych fragmentów, nie wymyśla brakującej grafiki stron i nie zgaduje hasła.
Najpierw sprawdź, potem przepisuj
Pobierz informacje o PDF zwraca raport JSON (liczbę stron, metadane, fonty, szczegóły struktury), a nie zmodyfikowany PDF. Użyj go, gdy przed kompresją, konwersją albo naprawą musisz wiedzieć, co masz w ręku.
Jeśli przeglądarka w ogóle odmawia otwarcia pliku, wypróbuj Napraw PDF, które odbudowuje strukturę, w tym odzyskuje tabelę odsyłaczy. Jeśli plik się otwiera, ale zeskanowanego tekstu nie da się zaznaczyć, to problem OCR, a nie xref.
Krótka kolejność działań
- Plik się nie otwiera → najpierw Napraw.
- Plik się otwiera i potrzebujesz faktów (liczby stron, fontów, informacji o szyfrowaniu) → Pobierz informacje.
- Struktura jest w porządku, a chcesz mniejszy plik albo czytelny tekst ze skanu → Compress w celu zmniejszenia rozmiaru albo OCR po tekst w Markdown, a nie kolejną naprawę.
Get Info i Repair działają bez konta. Te same operacje przez HTTP opisuje Dla programistów. Czym naprawa różni się od markowych, desktopowych produktów „do odzyskiwania”, wyjaśnia Naprawa PDF online a wyszukiwania „Recovery Toolbox”.