把 PDF 转成 HTML
PDF 转 HTML 用 Poppler 的 pdftohtml 转换 PDF,交付一个含 HTML 页面及其图片的 ZIP。它是版面导出,而不是整洁的网页标记,也不做 OCR。
把文件拖到这里,或点击选择
支持 PDF · 单个文件不超过 500.0 MB · 一次最多 20 个文件
也可以按 Ctrl/Cmd+V 或从剪贴板菜单粘贴文件。
PDF 转 HTML 运行 Poppler `pdftohtml -c`,把该工具写进输出目录的内容打成 ZIP。下载名是 `{base}ToHtml.zip`,不是单个 `.html`。目标不是浏览器级 CSS,而是 Poppler 的 HTML 和图片导出。
本页没有表单字段。每一页都会转。若 `pdftohtml` 什么都没写,接口返回内部错误,而不是空 ZIP。
这不是 OCR。纯图像扫描件会变成 HTML 包里的图片,不是可选取文字。有密码保护的文件,在你输入密码后会在本页为你解锁;API 调用方需先运行移除密码。
若只要文字,用 PDF 转文本。若要适合 CMS 的文章,用 PDF 转 Markdown。
上传是临时的。我们不会保存你的 HTML 文库。
功能
- Poppler `pdftohtml -c`,产出 HTML 与资源的 ZIP
- 没有页范围或主题选项
- 不是 OCR;扫描件在包里仍是图
- 匿名 API:/api/v1/convert/pdf/html
适用场景
- 从带文字层的 PDF 得到一份粗糙 HTML
- 拿走 pdftohtml 抽出的页面图
- 在自建流水线前,看看 Poppler 如何理解这份文件
如何把 PDF 转成 HTML?
- 上传 PDF。本页没有转换选项。
- 点击处理,下载 `{name}ToHtml.zip`。
- 解压后在浏览器打开 HTML。
- 检查图和字。扫描件不会变成真正的 HTML 文字。
限制与边界
- 产出是 ZIP,不是单个 HTML
- 不是 Chromium 打印,也不是 tagged-PDF 的 HTML 导出
- pdftohtml 空输出是错误,不是 204
- 本网站的上传上限:每个文件 500 MB,超过约 95 MB 时分块上传。直接调用 API 时,单个请求体上限为 100 MB。
示例
- 简单文字备忘录常常解压出一份 HTML 加几张图
- 纯扫描 PDF 得到的 HTML 多半是在包那些页图
本工具的隐私说明
文件经 HTTPS 上传,在服务器内存或短期临时目录中处理,结果就绪后即删除。我们不会为日后浏览、训练或广告画像保留副本。留存期限与 AdSense Cookie 说明见隐私政策。
常见问题
- 为什么结果是 ZIP?
- pdftohtml 把 HTML 加上抽出的图写进一个文件夹。服务器把那个文件夹打包。
- HTML 会和 PDF 版式一致吗?
- 只到 Poppler `-c` 模式的程度。多栏杂志和大量矢量常常对不齐。
- 能把扫描件转成 HTML 文字吗?
- 不能。这条路径不做 OCR。需要文字请用 OCR 转 Markdown。
- 是在浏览器里转的吗?
- 不是。服务器调用 pdftohtml。
最后更新:
用代码调用
本站每个工具都是普通 REST 接口。匿名使用不需要账号或 API Key,给浏览器、开发者和智能体同样可用。
curl -X POST "https://pdf123.xyz/api/v1/convert/pdf/html" \
-F "[email protected]" \
-o output.pdf也提供 MCP 工具,供说 Model Context Protocol 的客户端调用(JSON-RPC 2.0,POST /mcp)。 完整 API 文档
在 AI 代理中使用
Skill装上这个 Skill,Claude Code、Codex、Cursor 等 AI 代理就能替你完成「PDF 转 HTML」: /skills/pdf123-pdf-to-html.md
文件只用于本次处理,完成后自动删除。