跳到主要内容
PPDF123

把 PDF 表格转成 Excel

PDF 转 Excel 在 PDF 文字里找出对齐的表格行,把每张表写进 .xlsx 工作簿的各自工作表。它需要文字层,遇到散文或扫描页不会有输出。

把文件拖到这里,或点击选择

支持 PDF · 单个文件不超过 500.0 MB · 一次最多 20 个文件

也可以按 Ctrl/Cmd+V 或从剪贴板菜单粘贴文件。

PDF 转 Excel 运行 `pdftotext -layout`,寻找含有连续两个或更多空格的行,把那些行写入 `.xlsx` 工作簿。每张检测到的表成为名为 `Page N` 或 `Page N Table M` 的工作表。适合列在抽出文字里已经对齐的电子版 PDF。

一张表至少要有连续两行像表格。散文、单独一行表头,或没有文字层的扫描件,会得到 `no_content`:没有工作簿。空结果是有意的,不是静默失败。

本工具忽略请求参数。本页没有页范围字段。列按连续两个或更多空格切开;单元格内的单个空格留在单元格里。

这不是 OCR。纯图像扫描件没有可供 `pdftotext` 读取的内容。本站 OCR 返回 Markdown,不能再送进 PDF 转 Excel。字只存在于像素时,这里给不出电子表格。

PDF 转 CSV 用同一套版面启发式。一张表变成一份 CSV;多张表变成 CSV 的 ZIP。Excel 把那些表放在同一工作簿的各工作表里。两者都不会从 PDF 还原合并单元格、彩色表头或隐藏工作表。

用 Excel 或 LibreOffice Calc 打开下载,抽几行核对列切分。没有双空格间隙的紧表常常落进一列。有密码保护的文件,在你输入密码后会在本页为你解锁;API 调用方需先运行移除密码。

双空格规则就是全部检测机制,所以工作簿质量完全取决于 PDF 怎么排版。报表生成器按固定宽度给每个单元格补空格的表格,能干净地抽出来。列间只用一个空格、或用比例字体让列几乎贴在一起的表格,根本不算表格,可能不返回工作簿。责怪工具之前,先在 PDF 里选中一行,确认文字本身可以选取。

工作表命名按位置,不按内容。每个检测到的块按扫描顺序成为 `Page N` 或 `Page N Table M`。每页一张表的报告,得到每页一张工作表;一页堆了三张表,就得到三张带编号的工作表。没有按表头单元格命名的选项,也没有合并成单张工作表的输出。

所有值都按文本写入,和 PDF 保留版面的抽取结果完全一致。数字不会转成数值单元格,所以前导零得以保留,货币符号和千位分隔符仍留在字符串里。对账号和邮编来说通常正合需要,对你想要求和的金额列则有点麻烦。要么在电子表格里转换类型,要么复制该列,用目标软件的分列或数值转换处理。

行不会去重,重复的表头也不会删除。表格跨页断开时,表头行常常在下一页重复,续接部分自成一个工作表。合并单元格不会重建;在 PDF 里跨两列的单元格,文字只落在最左列,右列留空。多行单元格会变成多行,而不是一个自动换行的值。

上传是临时的。我们不会保存你的工作簿文库。

功能

  • `pdftotext -layout` 加上双空格分列启发式
  • 每张检测到的表一张工作表;检测为空则不返回文件
  • 不是 OCR;OCR 的 Markdown 不能送到这里
  • 所有值按文本存储;不做类型推断,也不重建合并单元格
  • 匿名 API:/api/v1/convert/pdf/xlsx

适用场景

  • 把抽出的表直接在 Excel 或 LibreOffice Calc 里打开
  • 把电子版发票表拉进工作簿
  • 让多页上的表各成工作表,而不是一份 CSV
  • 抽出定宽财务报表,供进一步分析

如何把 PDF 表格转成 Excel?

  1. 上传已有可选取文字、且呈表格式分列的 PDF。
  2. 点击处理。本工具没有页范围或 OCR 选项。
  3. 若找到表,下载 `.xlsx`。若没有,你会得到空成功;请换带文字层的源文件。
  4. 打开工作簿核对切分。纯散文 PDF 不会产生工作表。

限制与边界

  • 需要可选取文字,以及双空格列间隙
  • 没有 OCR,也没有页范围控件
  • 不还原合并单元格和样式
  • 所有值都是文本,没有数字或日期类型
  • 跨页的表格会拆成多张工作表
  • 本网站的上传上限:每个文件 500 MB,超过约 95 MB 时分块上传。直接调用 API 时,单个请求体上限为 100 MB。

示例

  • 带三列价目表的文字 PDF,常常变成那些列的一张工作表
  • 没有文字层的扫描银行对账单,不会返回工作簿
  • 一份十页报告每页一张表,会得到十张名为 Page 1 到 Page 10 的工作表

本工具的隐私说明

文件经 HTTPS 上传,在服务器内存或短期临时目录中处理,结果就绪后即删除。我们不会为日后浏览、训练或广告画像保留副本。留存期限与 AdSense Cookie 说明见隐私政策。

常见问题

为什么没有电子表格?
没有找到连续两行或更多的表格行。扫描件、散文,以及没有双空格间隙的表,都会让这套启发式失败。
可以先 OCR 再转 Excel 吗?
不可以。OCR 返回 Markdown。本工具只通过 pdftotext 读 PDF。
和 PDF 转 CSV 有什么不同?
检测相同。Excel 把每张表写进同一工作簿的各自工作表。CSV 每张表一份文件(一张就是一份 CSV,多张则打成 ZIP)。
会读每一页吗?
会。pdftotext 按换页符分页。每一页都扫描表块。没有页范围参数。
为什么数字被存成文本?
值按抽取原样写入,所以前导零和格式得以保留。若要用它计算,请在电子表格里把该列转换为数值。
合并单元格会重建吗?
不会。合并单元格的文字落在最左列,其余列为空。多行单元格会变成多行,而不是一个自动换行的值。
为什么一张表会有多张工作表?
跨到新页的表格会在那一页被再次检测,成为另一张工作表。表头行常常重复,本工具不会合并这些片段。

最后更新:

用代码调用

本站每个工具都是普通 REST 接口。匿名使用不需要账号或 API Key,给浏览器、开发者和智能体同样可用。

curl -X POST "https://pdf123.xyz/api/v1/convert/pdf/xlsx" \
  -F "[email protected]" \
  -o output.pdf

也提供 MCP 工具,供说 Model Context Protocol 的客户端调用(JSON-RPC 2.0,POST /mcp)。 完整 API 文档

在 AI 代理中使用

Skill

装上这个 Skill,Claude Code、Codex、Cursor 等 AI 代理就能替你完成「PDF 转 Excel」: /skills/pdf123-pdf-to-xlsx.md

全部 Agent Skill

文件只用于本次处理,完成后自动删除。