Product2026-09-284 min de lectura

Paquete de escaneo a texto: OCR y luego comprimir el PDF que aún conservas

Un paquete de escaneo necesita dos pasos: el OCR devuelve texto Markdown, no un PDF buscable, y Compress reduce el PDF original con recompresión de streams.

PDF123 · Updated 2026-09-28

Un «paquete de escaneo» suele ser una pila de imágenes de páginas unidas en un solo PDF: pesado en disco y vacío para buscar y copiar. Las dos herramientas que la gente encadena no producen aquí un PDF buscable mágico. OCR devuelve Markdown y Comprimir reescribe el PDF que sigues conservando.

Esa separación es todo el flujo.

Qué te da realmente el OCR aquí

POST /api/v1/misc/ocr-pdf ejecuta el reconocimiento y descarga un archivo .md (text/markdown): texto nativo del PDF fusionado con el OCR de las páginas de imagen. No escribe una capa de texto oculta dentro del PDF. Si esperabas poder seleccionar y buscar dentro del mismo archivo, eso es otra forma de producto (la salida clásica al estilo OCRmyPDF). Este endpoint sirve para texto que un agente o un pipeline puedan leer.

Auto frente a Force OCR:

  • Cualquier valor distinto de ocrType=force-ocr (incluida la etiqueta «Normal» del portal) corresponde a Auto: usa el texto existente donde lo haya y aplica OCR a las páginas que son solo imagen.
  • force-ocr vuelve a leer todas las páginas, incluidas las que ya tienen capa de texto.

No hay selector de idioma en el formulario del portal. Los campos residuales de estilo tessdata que quedaron de rutas antiguas (languages, enderezado, flags de limpieza y similares) los ignora la ruta ocr_pdf de Rust. En Cómo lee OCR un PDF escaneado se explican Auto frente a Force y por qué el reconocimiento falla con escaneos malos.

El OCR no reduce el PDF. La descarga Markdown es un segundo artefacto que acompaña al paquete de escaneo original.

Dónde encaja Compress

Comprimir (POST /api/v1/misc/compress-pdf) ejecuta la compresión de streams de qpdf: --compress-streams=y, recompresión flate y object streams generados. No inventa una capa de texto, no aplica subsetting a las fuentes y no promete reducir la resolución de las imágenes. En un archivo con muchos escaneos puede aun así ahorrar almacenamiento empaquetando mejor los streams; en uno ya ajustado la ganancia puede ser pequeña. Contexto sobre las palancas de streams frente a las de imagen: Qué ocurre realmente al comprimir un PDF.

Usa Compress en el PDF que vayas a archivar o enviar. Usa la salida Markdown del OCR cuando necesites las palabras. Comprimir primero no mejora la precisión del OCR, y aplicar OCR primero no reduce el PDF.

Un orden práctico

  1. Si el visor no abre el paquete, usa Reparar o Get Info primero.
  2. Aplica OCR al paquete y revisa el texto de unas cuantas páginas.
  3. Aparte, aplica Compress a una copia del PDF si el tamaño sigue siendo el problema.
  4. Conserva el original intacto cuando tu política lo exija.

Cifrar un archivo sigue necesitando un Desbloquear autorizado antes de cualquiera de los dos pasos. Los secretos requieren Sanitize / Auto Redact, no OCR. Que la exportación de tablas devuelva 204 tras un escaneo significa que no se encontraron columnas de texto: primero el Markdown del OCR y luego decides si una hoja de cálculo tiene sentido (Exportación de tabla vacía (204)).

Los resultados que conviene controlar

Tras una ejecución típica puedes acabar con tres artefactos: el paquete de escaneo original, una descarga OCR en .md y, opcionalmente, una copia comprimida del PDF. Ponles etiquetas. Enviar solo el Markdown hace perder las imágenes de las páginas; enviar solo el PDF comprimido sigue sin capa de selección y búsqueda de esta ruta de OCR. Los pipelines que necesiten las palabras y un PDF más pequeño tendrán que guardar ambos resultados o volver a ejecutar una de las partes más adelante.

Force OCR en un paquete nativo digital con la capa de texto rota puede seguir siendo útil; Auto en un paquete nativo digital limpio puede saltarse por completo el runtime de OCR. Ninguno de los dos modos escribe texto dentro del PDF.

Qué no es este flujo

Los paquetes de escaneo fallan cuando los equipos dan por hecho que un solo botón extrae el texto y reduce los píxeles, como podría hacer un proceso de escritorio con OCRmyPDF. Aquí el texto sale como Markdown y el PDF sigue siendo un PDF salvo que lo comprimas a propósito. No hay ningún paso en este sitio que devuelva «el mismo PDF, ahora buscable y más pequeño» con una sola llamada.

Para automatizar las mismas ops por HTTP, consulta Desarrolladores.

Open tool
Process in the browser — no watermark, files removed after the job.
Open tool