Ir para o conteúdo principal
PPDF123

Converter PDF em HTML

PDF para HTML converte um PDF com o pdftohtml do Poppler e entrega um ZIP com as páginas HTML e as suas imagens. É um despejo de layout, não marcação web limpa, e não faz OCR.

Arraste arquivos para cá, ou clique para escolher

Aceita PDF · até 500.0 MB por arquivo · até 20 arquivos por vez

Você também pode colar um arquivo com Ctrl/Cmd+V ou pelo menu da área de transferência.

PDF para HTML executa o Poppler `pdftohtml -c` e empacota num ZIP o que a ferramenta escreve no diretório de saída. O nome do download é `{base}ToHtml.zip`, não um `.html` isolado. O alvo não é CSS de nível de navegador, e sim a exportação HTML e imagens do Poppler.

Nesta página não há campos de formulário. Todas as páginas são convertidas. Se `pdftohtml` não escrever nada, a API devolve erro interno, não um ZIP vazio.

Isto não é OCR. Digitalizações só-imagem viram imagens no pacote HTML, não texto selecionável. Arquivos protegidos por senha são desbloqueados para você nesta página assim que você digita a senha; quem chama a API executa Remover senha antes.

Se só quer texto, use PDF para RTF (texto). Se quer artigo adequado a CMS, use PDF para Markdown.

O envio é temporário. Não guardamos a sua biblioteca de HTML.

Recursos

  • Poppler `pdftohtml -c`, saída ZIP com HTML e recursos
  • Sem opções de intervalo de páginas ou tema
  • Não é OCR; digitalizações continuam imagem no pacote
  • API anônima: /api/v1/convert/pdf/html

Quando usar esta ferramenta

  • Obter HTML grosseiro a partir de PDF com camada de texto
  • Levar embora as imagens de página que o pdftohtml extrai
  • Ver como o Poppler entende o arquivo antes de um fluxo próprio

Como converter um PDF em HTML?

  1. Envie o PDF. Nesta página não há opções de conversão.
  2. Clique em Processar e baixe `{name}ToHtml.zip`.
  3. Descompacte e abra o HTML no navegador.
  4. Confira imagens e texto. Digitalizações não viram texto HTML de verdade.

Limites e casos-limite

  • A saída é ZIP, não um HTML isolado
  • Não é impressão Chromium nem exportação HTML de PDF marcado
  • Saída vazia do pdftohtml é erro, não 204
  • Limite de envio neste site: 500 MB por arquivo, enviado em partes acima de cerca de 95 MB. O corpo de uma única requisição direta à API é limitado a 100 MB.

Exemplos

  • Memorando de texto simples costuma descompactar num HTML mais algumas imagens
  • PDF só digitalizado gera HTML que em geral só embrulha as imagens das páginas

Privacidade desta ferramenta

Os arquivos são enviados por HTTPS, processados em memória ou em um diretório temporário de curta duração nos nossos servidores, e apagados quando o resultado fica pronto. Não guardamos cópias para consulta posterior, treino de modelos ou perfis de publicidade. Consulte a Política de Privacidade para prazos de retenção e cookies do AdSense.

Perguntas frequentes

Por que o resultado é ZIP?
pdftohtml grava HTML mais imagens extraídas numa pasta. O servidor empacota essa pasta.
O HTML bate com o layout do PDF?
Só até o modo `-c` do Poppler. Revistas em várias colunas e muito vetor costumam desalinhar.
Dá para transformar digitalização em texto HTML?
Não. Este caminho não faz OCR. Se precisa de texto, use OCR para Markdown.
A conversão roda no navegador?
Não. O servidor chama pdftohtml.

Última atualização:

Chame pelo código

Cada ferramenta deste site é um endpoint REST. Para uso anônimo não precisa de conta nem de chave de API. Serve para o navegador, para desenvolvedores e para agentes de IA.

curl -X POST "https://pdf123.xyz/api/v1/convert/pdf/html" \
  -F "[email protected]" \
  -o output.pdf

Também disponível como ferramenta MCP para clientes de agente que falam Model Context Protocol (JSON-RPC 2.0 via POST /mcp). Referência completa da API

Use a partir de um agente de IA

Skill

Com esta skill, Claude Code, Codex, Cursor e outros agentes de IA podem usar "PDF para HTML" para você: /skills/pdf123-pdf-to-html.md

Todas as skills para agentes

Os arquivos servem só para este processamento e são apagados automaticamente depois.