Ir al contenido principal
PPDF123

Extraer tablas de un PDF a CSV

PDF a CSV encuentra filas de tabla alineadas en el texto de un PDF y escribe cada tabla detectada como archivo CSV; varias tablas vuelven en un ZIP. Necesita capa de texto y no devuelve nada para prosa o escaneos.

Arrastra archivos aquí, o haz clic para elegir

Admite PDF · hasta 500.0 MB por archivo · hasta 20 archivos a la vez

También puedes pegar un archivo con Ctrl/Cmd+V o desde el menú del portapapeles.

PDF a CSV ejecuta `pdftotext -layout`, busca líneas con dos o más espacios seguidos y escribe esas filas en CSV. Cada tabla detectada sale como `{base}_pN_tM.csv`. Sirve en PDF digitales donde las columnas ya alinean en el texto extraído.

Una tabla necesita al menos dos líneas tabulares seguidas. Prosa, una sola fila de encabezado o un escaneo sin capa de texto dan `no_content`: HTTP 204 y ningún archivo. El resultado vacío es a propósito, no un fallo silencioso.

Este convertidor ignora los parámetros de la petición. El campo de intervalo de páginas de esta página no se lee: se recorren todas. Una tabla es un `text/csv`; varias, un ZIP llamado `{base}_extracted.zip`. Las columnas se parten en rachas de dos o más espacios; un solo espacio dentro de una celda se queda. Los campos van entrecomillados según RFC 4180.

Esto no es OCR. Un escaneo solo imagen no tiene nada que `pdftotext` pueda leer. El OCR de este sitio devuelve Markdown, que no puedes reenviar aquí. Si el texto solo existe en píxeles, no hay archivo de tabla.

PDF a Excel usa la misma heurística de maquetado. Excel guarda esas tablas como hojas de un mismo libro. CSV escribe un archivo por tabla. Ninguno reconstruye celdas combinadas, encabezados de color ni hojas ocultas del PDF.

Abre la descarga en Excel o LibreOffice Calc y comprueba los cortes de columna en unas cuantas filas. Las tablas apretadas sin un hueco de dos espacios suelen caer en una sola columna. Los archivos protegidos con contraseña se descifran por ti en esta página cuando introduces la contraseña; quien use la API debe pasar antes por Quitar contraseña.

La subida es temporal. No guardamos tu biblioteca de CSV.

Funciones

  • `pdftotext -layout` más una heurística de columnas de dos espacios
  • Un CSV por tabla; varias, un ZIP; si no hay detección, HTTP 204
  • No es OCR; el Markdown del OCR no entra aquí
  • API anónima: /api/v1/convert/pdf/csv

Cuándo usarla

  • Llevar una tabla de factura digital a Excel o LibreOffice Calc
  • Tener un CSV por tabla en un documento de varias páginas, no una sola hoja
  • Alimentar un script que solo acepta CSV

¿Cómo extraigo una tabla de un PDF a CSV?

  1. Sube un PDF con texto seleccionable y columnas que ya se vean en el texto extraído.
  2. Pulsa Procesar. El intervalo de páginas está, pero el convertidor no lo lee. No hay opción OCR.
  3. Si hay una tabla, descarga `.csv`. Si hay varias, un ZIP. Si no hay, el éxito llega vacío; cambia a un origen con capa de texto.
  4. Abre el archivo en Excel o LibreOffice Calc y comprueba los cortes. Un PDF de prosa no genera archivo.

Límites y casos límite

  • Hace falta texto seleccionable y un hueco de dos espacios entre columnas
  • No hay OCR y el control de páginas no funciona
  • No reconstruye celdas combinadas ni estilos
  • Límite de subida en este sitio web: 500 MB por archivo, enviado por partes a partir de unos 95 MB. El cuerpo de una sola petición directa a la API está limitado a 100 MB.

Ejemplos

  • Un PDF de texto con una tarifa de tres columnas suele dar un CSV con esas columnas
  • Un extracto bancario escaneado sin capa de texto da HTTP 204

Privacidad de esta herramienta

Los archivos se suben por HTTPS, se procesan en memoria o en un directorio temporal de corta duración en nuestros servidores, y se eliminan cuando el resultado está listo. No conservamos copias para consultarlas después, entrenar modelos ni crear perfiles publicitarios. Consulte la Política de privacidad para los plazos de retención y las cookies de AdSense.

Preguntas frecuentes

¿Por qué no hay CSV?
No hubo dos o más líneas tabulares seguidas. Escaneos, prosa y tablas sin un hueco de dos espacios hacen fallar la heurística. La API responde 204 `no_content`.
¿Puedo hacer OCR y luego CSV?
No. El OCR devuelve Markdown. Esta herramienta solo lee PDF con pdftotext.
¿En qué se diferencia de PDF a Excel?
La detección es la misma. CSV escribe un archivo por tabla (uno solo, o un ZIP si hay varias). Excel pone cada tabla en su propia hoja del mismo libro.
¿Lee todas las páginas?
Sí. pdftotext pagina por saltos de página y recorre cada bloque. El campo de intervalo de esta página no se lee.

Última actualización:

Llámalo desde el código

Cada herramienta del sitio es un endpoint REST. Para uso anónimo no hace falta cuenta ni clave de API. Sirve igual para el navegador, para desarrolladores y para agentes de IA.

curl -X POST "https://pdf123.xyz/api/v1/convert/pdf/csv" \
  -F "[email protected]" \
  -F "pageNumbers=all" \
  -o output.pdf

También está disponible como herramienta MCP para clientes de agentes que hablan Model Context Protocol (JSON-RPC 2.0 por POST /mcp). Referencia completa de la API

Úsalo desde un agente de IA

Skill

Con esta skill, Claude Code, Codex, Cursor y otros agentes de IA pueden usar «PDF a CSV» por ti: /skills/pdf123-pdf-to-csv.md

Todas las skills para agentes

Los archivos se usan solo para este trabajo y se borran automáticamente después.