Ir al contenido principal
PPDF123

OCR de un PDF escaneado a Markdown

OCR a Markdown lee un PDF escaneado o basado en imágenes y devuelve su texto como archivo Markdown. No añade una capa de texto al PDF y el archivo original no cambia.

Arrastra archivos aquí, o haz clic para elegir

Admite PDF · hasta 500.0 MB por archivo · hasta 20 archivos a la vez

También puedes pegar un archivo con Ctrl/Cmd+V o desde el menú del portapapeles.

El OCR lee un PDF escaneado o hecho de imágenes y te entrega Markdown (`text/markdown`, archivo `.md`). No incrusta una capa de texto oculta en el PDF, ni limpia, endereza ni reescribe el escaneo.

El servidor combina el texto nativo que ya hay en el PDF con el reconocimiento óptico de las páginas imagen. Force OCR (`ocrType=force-ocr`, valor por defecto del sitio) vuelve a reconocer cada página. Normal (cualquier valor que no sea `force-ocr`) usa el texto nativo cuando existe y solo aplica OCR a páginas solo imagen. En un PDF electrónico limpio, Auto no carga el runtime de OCR.

La precisión depende de la calidad del escaneo, el contraste y la inclinación. El motor actual no tiene parámetro de idioma. Si el cliente aún envía campos antiguos de OCRmyPDF en Java (`languages`, `deskew`, `clean`, `sidecar`), se ignoran.

Esto no es un paso previo a PDF a Word ni a PDF a RTF (texto). Esas herramientas siguen necesitando texto ya presente en el PDF. El OCR aquí es una extracción paralela: obtienes Markdown y el PDF original no cambia.

No hagas OCR de archivos que no tienes derecho a digitalizar o redistribuir. El texto extraído también está sujeto a derechos de autor y a las normas del lugar de trabajo.

Si buscas un PDF searchable, aquí no lo hay. El producto searchable es el archivo Markdown. Ábrelo en un editor y comprueba nombres y cifras que deban ser exactos.

Las fotos de móvil conviene recortarlas y enderezarlas antes de subirlas. Una página en perspectiva malgasta el reconocimiento en el fondo. El OCR no traduce: reconoce caracteres; no reescribe el documento en otro idioma.

El trabajo corre en el servidor. Descarga a tiempo. No convertimos tus archivos en una biblioteca de OCR. Los archivos protegidos con contraseña se descifran por ti en esta página cuando introduces la contraseña; quien use la API debe pasar antes por Quitar contraseña.

Funciones

  • Devuelve Markdown, no un PDF con capa OCR
  • Force OCR relee cada página; Normal/Auto usan el texto nativo cuando existe
  • El PDF original no cambia
  • API anónima: /api/v1/misc/ocr-pdf

Cuándo usarla

  • Sacar el texto de cláusulas de un escaneo de archivo
  • Entregar un escaneo a un agente o tubería que pide Markdown
  • Recuperar palabras de un PDF solo imagen sin capa de texto

¿Cómo hago OCR de un PDF escaneado?

  1. Sube un PDF escaneado o fotografiado con el móvil.
  2. Elige Force OCR (por defecto) o Normal/Auto.
  3. Pulsa Procesar y descarga el archivo `.md`.
  4. Revisa nombres y cifras en el Markdown antes de usarlo.

Límites y casos límite

  • La precisión varía con la calidad de la imagen
  • Muchas páginas tardan más
  • El motor actual no tiene parámetro de idioma
  • No es una biblioteca OCR local ni un SDK sin conexión
  • Límite de subida en este sitio web: 500 MB por archivo, enviado por partes a partir de unos 95 MB. El cuerpo de una sola petición directa a la API está limitado a 100 MB.

Ejemplos

  • Un contrato escaneado en escala de grises de 20 páginas se convierte en un Markdown con el texto de las cláusulas
  • Una foto de móvil inclinada puede necesitar una nueva toma para que el OCR sea útil

Privacidad de esta herramienta

Los archivos se suben por HTTPS, se procesan en memoria o en un directorio temporal de corta duración en nuestros servidores, y se eliminan cuando el resultado está listo. No conservamos copias para consultarlas después, entrenar modelos ni crear perfiles publicitarios. Consulte la Política de privacidad para los plazos de retención y las cookies de AdSense.

Preguntas frecuentes

¿El OCR cambia el aspecto de las páginas?
No devuelve un PDF. El archivo original no cambia; obtienes una descarga Markdown aparte.
¿Es una biblioteca OCR que pueda incrustar?
No. Es un trabajo HTTP alojado en /api/v1/misc/ocr-pdf. Ver /developers. No es un SDK enlazable.
¿Después del OCR puedo pasar a Word?
No como tubería de PDF. La salida del OCR es Markdown. PDF a Word sigue necesitando un PDF con capa de texto.
¿Un PDF electrónico necesita Force OCR?
Suele no. Normal/Auto usan el texto existente y omiten el runtime de OCR. Usa Force cuando la capa de texto esté dañada o no sea fiable.

Última actualización:

Llámalo desde el código

Cada herramienta del sitio es un endpoint REST. Para uso anónimo no hace falta cuenta ni clave de API. Sirve igual para el navegador, para desarrolladores y para agentes de IA.

curl -X POST "https://pdf123.xyz/api/v1/misc/ocr-pdf" \
  -F "[email protected]" \
  -F "ocrType=force-ocr" \
  -o output.pdf

También está disponible como herramienta MCP para clientes de agentes que hablan Model Context Protocol (JSON-RPC 2.0 por POST /mcp). Referencia completa de la API

Úsalo desde un agente de IA

Skill

Con esta skill, Claude Code, Codex, Cursor y otros agentes de IA pueden usar «OCR a Markdown» por ti: /skills/pdf123-ocr.md

Todas las skills para agentes

Los archivos se usan solo para este trabajo y se borran automáticamente después.