把 PDF 转成文本
PDF 转文本提取 PDF 中已有的文字,以纯文本 .txt 文件返回,也可选 RTF。它不运行 OCR,所以纯图像扫描件提取出来是空的。
把文件拖到这里,或点击选择
支持 PDF · 单个文件不超过 500.0 MB · 一次最多 20 个文件
也可以按 Ctrl/Cmd+V 或从剪贴板菜单粘贴文件。
PDF 转文本抽出已经作为文字对象存在的词。默认 `txt` 路径用与其他 pdf-core 操作相同的本地抽取器(`pdfio::extract_text`),返回 `text/plain`。不跑 OCR,也不调用 LibreOffice。
选 `rtf` 时,文件改走 LibreOffice `writer_pdf_import`。那条路径需要服务器上的 `soffice`,并重建一份粗糙的富文本。字体替换和表错位是常态。把 RTF 当草稿。
纯图像扫描件会得到空的或几乎为空的 `.txt`。本站 OCR 返回 Markdown,不是可再送回这里的可搜索 PDF。
本页没有页范围字段。每一页都会读。有密码保护的文件,在你输入密码后会在本页为你解锁;API 调用方需先运行移除密码。
若要标题和列表而不是纯文本,用 PDF 转 Markdown。若要表格成行,用 PDF 转 CSV 或 PDF 转 Excel。
上传是临时的。我们不会保存你的文本文库。
功能
- 默认 TXT 走本地文字抽取,不是 pdftotext,也不是 OCR
- 可选 RTF,经 LibreOffice `writer_pdf_import`
- 读每一页;没有页范围参数
- 匿名 API:/api/v1/convert/pdf/text
适用场景
- 把带文字层的报告倒进 grep 或脚本
- 从电子版备忘录得到一份粗糙 RTF 草稿
- 检查一份 PDF 到底有没有文字层
如何提取 PDF 中的文字?
- 上传已有可选取文字的 PDF。
- 保留 TXT,或在需要 LibreOffice 富文本草稿时选 RTF。
- 点击处理,下载 `.txt` 或 `.rtf`。
- 抽几段核对。没有文字层的扫描件会看起来是空的。
限制与边界
- 不是 OCR;扫描件几乎抽不出字
- 没有页范围控件
- TXT 不重建多栏的视觉阅读顺序
- 本网站的上传上限:每个文件 500 MB,超过约 95 MB 时分块上传。直接调用 API 时,单个请求体上限为 100 MB。
示例
- 可选取的年报通常会得到一份很长的 .txt
- 白板拍照 PDF 通常得到空白或极小的文件
本工具的隐私说明
文件经 HTTPS 上传,在服务器内存或短期临时目录中处理,结果就绪后即删除。我们不会为日后浏览、训练或广告画像保留副本。留存期限与 AdSense Cookie 说明见隐私政策。
常见问题
- 为什么文本文件是空的?
- PDF 里没有可供抽取器读取的文字对象。扫描件需要 OCR 成 Markdown。那份 Markdown 不能再送进本工具。
- TXT 和从阅读器复制一样吗?
- 接近,但不相同。顺序跟随页面内容流里文字的存放方式。多栏版面可能和视觉阅读顺序不一致。
- 什么时候该选 RTF?
- 只有在你想让 LibreOffice 重建文档时。TXT 是直接抽取,不需要 soffice。
- 会保留字体和版式吗?
- TXT 是纯文本。RTF 是尽力重建,不是像素级匹配。
最后更新:
用代码调用
本站每个工具都是普通 REST 接口。匿名使用不需要账号或 API Key,给浏览器、开发者和智能体同样可用。
curl -X POST "https://pdf123.xyz/api/v1/convert/pdf/text" \
-F "[email protected]" \
-F "outputFormat=txt" \
-o output.pdf也提供 MCP 工具,供说 Model Context Protocol 的客户端调用(JSON-RPC 2.0,POST /mcp)。 完整 API 文档
在 AI 代理中使用
Skill装上这个 Skill,Claude Code、Codex、Cursor 等 AI 代理就能替你完成「PDF 转文本」: /skills/pdf123-pdf-to-text.md
文件只用于本次处理,完成后自动删除。