Qué hay dentro de un PDF: objetos, streams y la tabla de referencias cruzadas
Un PDF es un grafo de objetos numerados, streams comprimidos y un mapa xref. Get Info lo inspecciona; Repair reconstruye la estructura cuando ese mapa se rompe.

Un PDF no es un volcado plano de páginas, sino una pequeña base de datos de objetos, muchos guardados como streams comprimidos y localizados mediante una tabla de referencias cruzadas (xref), de modo que un lector puede saltar al objeto 17 sin recorrer todo el archivo. Cuando ese mapa se rompe, los visores declaran el archivo dañado aunque los bytes de las páginas sigan en disco.
Objetos
Todo lo interesante (páginas, fuentes, imágenes, metadatos, el catálogo del documento) es un objeto con un número. Las páginas apuntan a los streams de contenido y a los recursos; los recursos apuntan a fuentes y XObjects; el catálogo apunta al árbol de páginas. Las herramientas que combinan, giran o estampan en su mayoría reescriben ese grafo en lugar de redibujar píxeles.
Streams
Un stream es un objeto cuyo contenido es una secuencia de bytes, a menudo comprimida con Flate: operadores de contenido de página, archivos de fuente incrustados, datos de imagen. Por eso, ver un PDF en un editor de texto muestra una mezcla de tokens ASCII y bloques binarios. Expandir los streams (sin cambiar el aspecto de las páginas) resulta útil para depurar; Comprimir en este sitio recomprime esos streams con qpdf: no reduce la resolución de las imágenes ni aplica subsetting a las fuentes.
La tabla de referencias cruzadas
Cerca del final de un archivo típico, una sección xref (o un stream xref en los archivos más nuevos) enumera los desplazamientos en bytes de cada número de objeto. Los lectores saltan a esos desplazamientos. Las descargas truncadas, las combinaciones defectuosas y los guardados a medias suelen dejar el trailer apuntando a desplazamientos que ya no coinciden. Los píxeles de la primera página pueden seguir existiendo; el mapa que encuentra la «primera página» no.
Por eso la reparación estructural es una tarea distinta del OCR o del desbloqueo: reconstruye la estructura interna a partir de los restos válidos, no inventa ilustraciones de página que faltan ni adivina una contraseña.
Inspeccionar antes de reescribir
Get Info on PDF devuelve un informe JSON (número de páginas, metadatos, fuentes, detalles estructurales), no un PDF modificado. Úsalo cuando necesites saber qué tienes entre manos antes de comprimir, convertir o reparar.
Si un visor se niega a abrir el archivo, prueba Reparar PDF, que reconstruye la estructura, incluida la recuperación de las referencias cruzadas. Si el archivo abre pero el texto escaneado no se puede seleccionar, eso es un problema de OCR, no de xref.
Un orden de decisión breve
- El archivo no abre → Reparar primero.
- El archivo abre y necesitas datos (páginas, fuentes, indicios de cifrado) → Get Info.
- La estructura está bien y quieres un archivo más pequeño o texto legible de un escaneo → Comprimir para el tamaño, o OCR para obtener texto Markdown, no otra pasada de reparación.
Get Info y Repair se ejecutan sin cuenta. Para las mismas ops por HTTP, consulta Desarrolladores. Para ver en qué se diferencia Repair de los productos de «recuperación» de escritorio con marca, consulta Reparar PDF online frente a búsquedas de Recovery Toolbox.