Ir para o conteúdo principal
PPDF123

Extrair Tabelas de um PDF para CSV

PDF para CSV encontra linhas de tabela alinhadas no texto de um PDF e grava cada tabela detectada como um arquivo CSV; várias tabelas voltam em um ZIP. Precisa de camada de texto e não devolve nada para prosa ou digitalizações.

Arraste arquivos para cá, ou clique para escolher

Aceita PDF · até 500.0 MB por arquivo · até 20 arquivos por vez

Você também pode colar um arquivo com Ctrl/Cmd+V ou pelo menu da área de transferência.

PDF para CSV executa `pdftotext -layout`, procura linhas com dois ou mais espaços seguidos e grava essas linhas como CSV. Cada tabela detectada vira um arquivo `{base}_pN_tM.csv`. Serve para PDFs eletrônicos em que as colunas já estão alinhadas no texto extraído.

Uma tabela precisa de pelo menos duas linhas seguidas com cara de tabela. Prosa, um cabeçalho sozinho ou digitalização sem camada de texto resulta em `no_content`: HTTP 204, sem arquivo. Resultado vazio é intencional, não falha silenciosa.

Esta ferramenta ignora parâmetros da requisição. O campo de intervalo de páginas desta página não é lido; todas as páginas são varridas. Uma tabela vira um `text/csv`; várias tabelas viram um ZIP `{base}_extracted.zip`. Colunas separam-se por dois ou mais espaços seguidos; espaço único dentro da célula fica na célula. Campos seguem aspas RFC 4180.

Isto não é OCR. Digitalizações só-imagem não têm conteúdo para o `pdftotext` ler. O OCR do site devolve Markdown e não pode ser enviado de novo a PDF para CSV. Quando as palavras só existem em pixels, aqui não sai arquivo de tabela.

PDF para Excel usa a mesma heurística de layout. O Excel coloca essas tabelas em planilhas do mesmo livro. CSV dá um arquivo por tabela. Nenhum dos dois reconstrói células mescladas, cabeçalhos coloridos ou planilhas ocultas a partir do PDF.

Abra o download no Excel ou LibreOffice Calc e confira algumas linhas de divisão de colunas. Tabelas apertadas sem gap de dois espaços costumam cair numa coluna só. Arquivos protegidos por senha são desbloqueados para você nesta página assim que você digita a senha; quem chama a API executa Remover senha antes.

O envio é temporário. Não guardamos a sua biblioteca de CSV.

Recursos

  • `pdftotext -layout` mais heurística de colunas por dois espaços
  • Um CSV por tabela; várias viram ZIP; detecção vazia → HTTP 204
  • Não é OCR; Markdown do OCR não entra aqui
  • API anônima: /api/v1/convert/pdf/csv

Quando usar esta ferramenta

  • Puxar tabelas de fatura eletrônica para Excel ou LibreOffice Calc
  • Deixar tabelas de várias páginas cada uma no seu CSV
  • Alimentar scripts que só aceitam CSV

Como extrair uma tabela de um PDF para CSV?

  1. Envie um PDF com texto selecionável e colunas em formato de tabela.
  2. Clique em Processar. O campo de intervalo de páginas existe, mas o conversor não lê. Sem opção de OCR.
  3. Se achar uma tabela, baixe `.csv`. Se várias, baixe ZIP. Se nenhuma, você recebe sucesso vazio; troque a fonte por uma com camada de texto.
  4. Abra no Excel ou LibreOffice Calc e confira a divisão. PDF só de prosa não gera arquivo.

Limites e casos-limite

  • Precisa de texto selecionável e gaps de coluna com dois espaços
  • Sem OCR; controle de intervalo de páginas não vale
  • Não reconstrói células mescladas nem estilos
  • Limite de envio neste site: 500 MB por arquivo, enviado em partes acima de cerca de 95 MB. O corpo de uma única requisição direta à API é limitado a 100 MB.

Exemplos

  • PDF de texto com tabela de preços em três colunas costuma virar um CSV nessas colunas
  • Extrato bancário digitalizado sem camada de texto recebe HTTP 204

Privacidade desta ferramenta

Os arquivos são enviados por HTTPS, processados em memória ou em um diretório temporário de curta duração nos nossos servidores, e apagados quando o resultado fica pronto. Não guardamos cópias para consulta posterior, treino de modelos ou perfis de publicidade. Consulte a Política de Privacidade para prazos de retenção e cookies do AdSense.

Perguntas frequentes

Por que não veio CSV?
Não foram encontradas duas ou mais linhas de tabela seguidas. Digitalizações, prosa e tabelas sem gap de dois espaços fazem a heurística falhar. A API responde 204 `no_content`.
Dá para fazer OCR e depois CSV?
Não. O OCR devolve Markdown. Esta ferramenta só lê PDF via pdftotext.
Qual a diferença para PDF para Excel?
A detecção é a mesma. CSV dá um arquivo por tabela (um CSV sozinho ou ZIP de vários). Excel escreve cada tabela numa planilha do mesmo livro.
Lê todas as páginas?
Sim. O pdftotext pagina por quebra de formulário e cada página é varrida em busca de blocos de tabela. O campo de intervalo desta página não é lido.

Última atualização:

Chame pelo código

Cada ferramenta deste site é um endpoint REST. Para uso anônimo não precisa de conta nem de chave de API. Serve para o navegador, para desenvolvedores e para agentes de IA.

curl -X POST "https://pdf123.xyz/api/v1/convert/pdf/csv" \
  -F "[email protected]" \
  -F "pageNumbers=all" \
  -o output.pdf

Também disponível como ferramenta MCP para clientes de agente que falam Model Context Protocol (JSON-RPC 2.0 via POST /mcp). Referência completa da API

Use a partir de um agente de IA

Skill

Com esta skill, Claude Code, Codex, Cursor e outros agentes de IA podem usar "PDF para CSV" para você: /skills/pdf123-pdf-to-csv.md

Todas as skills para agentes

Os arquivos servem só para este processamento e são apagados automaticamente depois.