跳到主要内容
PPDF123

把 PDF 转成 HTML

PDF 转 HTML 用 Poppler 的 pdftohtml 转换 PDF,交付一个含 HTML 页面及其图片的 ZIP。它是版面导出,而不是整洁的网页标记,也不做 OCR。

把文件拖到这里,或点击选择

支持 PDF · 单个文件不超过 500.0 MB · 一次最多 20 个文件

也可以按 Ctrl/Cmd+V 或从剪贴板菜单粘贴文件。

PDF 转 HTML 运行 Poppler `pdftohtml -c`,把该工具写进输出目录的内容打成 ZIP。下载名是 `{base}ToHtml.zip`,不是单个 `.html`。目标不是浏览器级 CSS,而是 Poppler 的 HTML 和图片导出。

本页没有表单字段。每一页都会转。若 `pdftohtml` 什么都没写,接口返回内部错误,而不是空 ZIP。

这不是 OCR。纯图像扫描件会变成 HTML 包里的图片,不是可选取文字。有密码保护的文件,在你输入密码后会在本页为你解锁;API 调用方需先运行移除密码。

若只要文字,用 PDF 转文本。若要适合 CMS 的文章,用 PDF 转 Markdown。

上传是临时的。我们不会保存你的 HTML 文库。

功能

  • Poppler `pdftohtml -c`,产出 HTML 与资源的 ZIP
  • 没有页范围或主题选项
  • 不是 OCR;扫描件在包里仍是图
  • 匿名 API:/api/v1/convert/pdf/html

适用场景

  • 从带文字层的 PDF 得到一份粗糙 HTML
  • 拿走 pdftohtml 抽出的页面图
  • 在自建流水线前,看看 Poppler 如何理解这份文件

如何把 PDF 转成 HTML?

  1. 上传 PDF。本页没有转换选项。
  2. 点击处理,下载 `{name}ToHtml.zip`。
  3. 解压后在浏览器打开 HTML。
  4. 检查图和字。扫描件不会变成真正的 HTML 文字。

限制与边界

  • 产出是 ZIP,不是单个 HTML
  • 不是 Chromium 打印,也不是 tagged-PDF 的 HTML 导出
  • pdftohtml 空输出是错误,不是 204
  • 本网站的上传上限:每个文件 500 MB,超过约 95 MB 时分块上传。直接调用 API 时,单个请求体上限为 100 MB。

示例

  • 简单文字备忘录常常解压出一份 HTML 加几张图
  • 纯扫描 PDF 得到的 HTML 多半是在包那些页图

本工具的隐私说明

文件经 HTTPS 上传,在服务器内存或短期临时目录中处理,结果就绪后即删除。我们不会为日后浏览、训练或广告画像保留副本。留存期限与 AdSense Cookie 说明见隐私政策。

常见问题

为什么结果是 ZIP?
pdftohtml 把 HTML 加上抽出的图写进一个文件夹。服务器把那个文件夹打包。
HTML 会和 PDF 版式一致吗?
只到 Poppler `-c` 模式的程度。多栏杂志和大量矢量常常对不齐。
能把扫描件转成 HTML 文字吗?
不能。这条路径不做 OCR。需要文字请用 OCR 转 Markdown。
是在浏览器里转的吗?
不是。服务器调用 pdftohtml。

最后更新:

用代码调用

本站每个工具都是普通 REST 接口。匿名使用不需要账号或 API Key,给浏览器、开发者和智能体同样可用。

curl -X POST "https://pdf123.xyz/api/v1/convert/pdf/html" \
  -F "[email protected]" \
  -o output.pdf

也提供 MCP 工具,供说 Model Context Protocol 的客户端调用(JSON-RPC 2.0,POST /mcp)。 完整 API 文档

在 AI 代理中使用

Skill

装上这个 Skill,Claude Code、Codex、Cursor 等 AI 代理就能替你完成「PDF 转 HTML」: /skills/pdf123-pdf-to-html.md

全部 Agent Skill

文件只用于本次处理,完成后自动删除。