Ir al contenido principal
PPDF123

Convertir PDF a HTML

PDF a HTML convierte un PDF con pdftohtml de Poppler y entrega un ZIP con las páginas HTML y sus imágenes. Es un volcado de maquetación y no marcado web limpio, y no hace OCR.

Arrastra archivos aquí, o haz clic para elegir

Admite PDF · hasta 500.0 MB por archivo · hasta 20 archivos a la vez

También puedes pegar un archivo con Ctrl/Cmd+V o desde el menú del portapapeles.

PDF a HTML ejecuta Poppler `pdftohtml -c` y empaqueta lo que esa herramienta escribe en el directorio de salida en un ZIP. El nombre de descarga es `{base}ToHtml.zip`, no un único `.html`. El objetivo no es CSS de navegador, sino el HTML y las imágenes de Poppler.

Esta página no tiene campos de formulario. Se convierte cada página. Si `pdftohtml` no escribe nada, la API responde con error interno, no con un ZIP vacío.

Esto no es OCR. Un escaneo solo imagen acaba como imágenes dentro del paquete HTML, no como texto seleccionable. Los archivos protegidos con contraseña se descifran por ti en esta página cuando introduces la contraseña; quien use la API debe pasar antes por Quitar contraseña.

Si solo quieres palabras, usa PDF a RTF (texto). Si quieres un artículo para un CMS, usa PDF a Markdown.

La subida es temporal. No guardamos tu biblioteca de HTML.

Funciones

  • Poppler `pdftohtml -c`; ZIP con HTML y recursos
  • Sin intervalo de páginas ni tema
  • No es OCR; el escaneo sigue siendo imagen en el paquete
  • API anónima: /api/v1/convert/pdf/html

Cuándo usarla

  • Sacar un HTML tosco de un PDF con capa de texto
  • Llevarte las imágenes de página que extrae pdftohtml
  • Ver cómo entiende Poppler el archivo antes de montar tu propia tubería

¿Cómo convierto un PDF a HTML?

  1. Sube un PDF. Esta página no tiene opciones de conversión.
  2. Pulsa Procesar y descarga `{name}ToHtml.zip`.
  3. Descomprime y abre el HTML en el navegador.
  4. Revisa imágenes y texto. Un escaneo no se convierte en HTML de verdad.

Límites y casos límite

  • El resultado es un ZIP, no un HTML suelto
  • No es impresión de Chromium ni exportación HTML de tagged-PDF
  • Una salida vacía de pdftohtml es un error, no un 204
  • Límite de subida en este sitio web: 500 MB por archivo, enviado por partes a partir de unos 95 MB. El cuerpo de una sola petición directa a la API está limitado a 100 MB.

Ejemplos

  • Un memorándum de texto sencillo suele descomprimirse en un HTML y unas cuantas imágenes
  • Un PDF solo escaneo suele dar HTML que envuelve esas capturas de página

Privacidad de esta herramienta

Los archivos se suben por HTTPS, se procesan en memoria o en un directorio temporal de corta duración en nuestros servidores, y se eliminan cuando el resultado está listo. No conservamos copias para consultarlas después, entrenar modelos ni crear perfiles publicitarios. Consulte la Política de privacidad para los plazos de retención y las cookies de AdSense.

Preguntas frecuentes

¿Por qué el resultado es un ZIP?
pdftohtml escribe HTML más las imágenes extraídas en una carpeta. El servidor empaqueta esa carpeta.
¿El HTML coincide con el PDF?
Solo hasta donde llega el modo `-c` de Poppler. Revistas a varias columnas y mucho vector suelen descuadrar.
¿Puedo convertir un escaneo en texto HTML?
No. Esta ruta no hace OCR. Si necesitas texto, usa OCR a Markdown.
¿Se convierte en el navegador?
No. El servidor llama a pdftohtml.

Última actualización:

Llámalo desde el código

Cada herramienta del sitio es un endpoint REST. Para uso anónimo no hace falta cuenta ni clave de API. Sirve igual para el navegador, para desarrolladores y para agentes de IA.

curl -X POST "https://pdf123.xyz/api/v1/convert/pdf/html" \
  -F "[email protected]" \
  -o output.pdf

También está disponible como herramienta MCP para clientes de agentes que hablan Model Context Protocol (JSON-RPC 2.0 por POST /mcp). Referencia completa de la API

Úsalo desde un agente de IA

Skill

Con esta skill, Claude Code, Codex, Cursor y otros agentes de IA pueden usar «PDF a HTML» por ti: /skills/pdf123-pdf-to-html.md

Todas las skills para agentes

Los archivos se usan solo para este trabajo y se borran automáticamente después.