Ves al contingut principal
PPDF123

Extreu les taules d'un PDF en CSV

PDF a CSV troba files de taula alineades al text d'un PDF i escriu cada taula detectada com a fitxer CSV; diverses taules tornen en un ZIP. Cal una capa de text i no torna res per a prosa ni escaneigs.

Arrossega arxius aquí, o fes clic per triar-los

Admet PDF · fins a 500.0 MB per arxiu · fins a 20 arxius alhora

També pots enganxar un fitxer amb Ctrl/Cmd+V o des del menú del porta-retalls.

PDF a CSV executa `pdftotext -layout`, busca files amb dos o més espais consecutius i escriu aquestes files com a CSV. Cada taula detectada esdevé un fitxer anomenat `{base}_pN_tM.csv`. Va bé amb PDF electrònics on les columnes ja queden alineades al text extret.

Calen com a mínim dues files consecutives amb aspecte de taula. La prosa, una sola fila de capçalera o un escaneig sense capa de text donen `no_content`: HTTP 204, sense fitxer. El resultat buit és intencionat, no un fracàs silenciós.

Aquesta eina ignora els paràmetres de la petició. El camp d'interval de pàgines d'aquesta pàgina no es llegeix: es revisen totes. Una sola taula dóna un `text/csv`; diverses taules van en un ZIP anomenat `{base}_extracted.zip`. Les columnes es tallen per dos o més espais consecutius; un espai sol dins la cel·la hi roman. Els camps es citen segons RFC 4180.

Això no és OCR. Un escaneig només imatge no té res que `pdftotext` pugui llegir. L'OCR d'aquest lloc torna Markdown i no es pot tornar a enviar a PDF a CSV. Si les lletres només existeixen als píxels, aquí no sortiran fitxers de taula.

«PDF a Excel» usa la mateixa heurística de maquetació. Excel posa aquestes taules en fulls del mateix llibre. CSV fa un fitxer per taula. Cap dels dos restaura cel·les fusionades, capçaleres de color ni fulls ocults del PDF.

Obriu la baixada amb Excel o LibreOffice Calc i contrastueu unes quantes files. Les taules estretes sense forats de doble espai sovint cauen en una sola columna. Els fitxers protegits amb contrasenya es desbloquegen per vosaltres en aquesta pàgina un cop n'escriviu la clau; els clients d'API executen primer «Treu la contrasenya».

Les pujades són temporals. No guardem la vostra biblioteca de CSV.

Funcions

  • `pdftotext -layout` més una heurística de columnes per doble espai
  • Un CSV per taula; ZIP si n'hi ha diverses; HTTP 204 si no se'n detecta cap
  • No és OCR; el Markdown de l'OCR no es pot enviar aquí
  • API anònima: /api/v1/convert/pdf/csv

Quan fer-la servir

  • Portar taules de factures electròniques a Excel o LibreOffice Calc
  • Treure un CSV per taula en pàgines diferents, no un sol full
  • Donar entrada a scripts que només accepten CSV

Com extrec una taula d'un PDF a CSV?

  1. Pugeu un PDF amb text seleccionable i columnes amb aspecte de taula.
  2. Feu clic a Processar. El camp d'interval de pàgines hi és, però el convertidor no el llegeix. No hi ha opció d'OCR.
  3. Si es troba una taula, baixeu el `.csv`. Si n'hi ha diverses, baixeu el ZIP. Si no n'hi ha cap, rebreu un èxit buit; canvieu a una font amb capa de text.
  4. Obriu-lo amb Excel o LibreOffice Calc i reviseu el tall. Un PDF només de prosa no genera fitxer.

Límits i casos límit

  • Cal text seleccionable i forats de columna amb doble espai
  • Sense OCR; el control d'interval de pàgines no fa res
  • No restaura cel·les fusionades ni estils
  • Límit de pujada en aquest web: 500 MB per fitxer, enviat per parts a partir d'uns 95 MB. El cos d'una sola petició directa a l'API està limitat a 100 MB.

Exemples

  • Un PDF de text amb una llista de preus de tres columnes sovint esdevé un CSV amb aquestes columnes
  • Un extracte bancari escanejat sense capa de text dóna HTTP 204

Privadesa d'aquesta eina

Els fitxers pugen per HTTPS, es processen a la memòria del servidor o en un directori temporal de curta vida, i s'esborren quan el resultat és a punt. No en guardem còpies per consultar-les després, per entrenar models ni per a perfils publicitaris. Els terminis de retenció i les galetes d'AdSense consten a la Política de privacitat.

Preguntes freqüents

Per què no hi ha CSV?
No s'han trobat dues o més files consecutives amb aspecte de taula. Escaneigs, prosa i taules sense forats de doble espai fan fallar aquesta heurística. L'API respon 204 `no_content`.
Puc fer OCR abans i després passar a CSV?
No. L'OCR torna Markdown. Aquesta eina només llegeix PDF via pdftotext.
En què es diferencia de «PDF a Excel»?
La detecció és la mateixa. CSV fa un fitxer per taula (un CSV sol o un ZIP). Excel escriu cada taula en un full del mateix llibre.
Es llegeixen totes les pàgines?
Sí. pdftotext pagina amb salts de pàgina i cada pàgina es revisa. El camp d'interval d'aquesta pàgina no es llegeix.

Darrera actualització:

Crida-ho des del codi

Cada eina del lloc és una interfície REST normal. Per a ús anònim no cal compte ni clau API. Pensat per a agents d'IA i desenvolupadors, igual que per al navegador.

curl -X POST "https://pdf123.xyz/api/v1/convert/pdf/csv" \
  -F "[email protected]" \
  -F "pageNumbers=all" \
  -o output.pdf

També hi ha una eina MCP per a clients d'agents que parlen Model Context Protocol (JSON-RPC 2.0 amb POST /mcp). Referència completa de l'API

Fes-lo servir des d'un agent d'IA

Skill

Amb aquest skill, Claude Code, Codex, Cursor i altres agents d'IA poden executar «PDF a CSV» per tu: /skills/pdf123-pdf-to-csv.md

Tots els skills per a agents

Els arxius només serveixen per a aquest processament i s'esborren sols després.