跳到主要内容
PPDF123

把 PDF 转成文本

PDF 转文本提取 PDF 中已有的文字,以纯文本 .txt 文件返回,也可选 RTF。它不运行 OCR,所以纯图像扫描件提取出来是空的。

把文件拖到这里,或点击选择

支持 PDF · 单个文件不超过 500.0 MB · 一次最多 20 个文件

也可以按 Ctrl/Cmd+V 或从剪贴板菜单粘贴文件。

PDF 转文本抽出已经作为文字对象存在的词。默认 `txt` 路径用与其他 pdf-core 操作相同的本地抽取器(`pdfio::extract_text`),返回 `text/plain`。不跑 OCR,也不调用 LibreOffice。

选 `rtf` 时,文件改走 LibreOffice `writer_pdf_import`。那条路径需要服务器上的 `soffice`,并重建一份粗糙的富文本。字体替换和表错位是常态。把 RTF 当草稿。

纯图像扫描件会得到空的或几乎为空的 `.txt`。本站 OCR 返回 Markdown,不是可再送回这里的可搜索 PDF。

本页没有页范围字段。每一页都会读。有密码保护的文件,在你输入密码后会在本页为你解锁;API 调用方需先运行移除密码。

若要标题和列表而不是纯文本,用 PDF 转 Markdown。若要表格成行,用 PDF 转 CSV 或 PDF 转 Excel。

上传是临时的。我们不会保存你的文本文库。

功能

  • 默认 TXT 走本地文字抽取,不是 pdftotext,也不是 OCR
  • 可选 RTF,经 LibreOffice `writer_pdf_import`
  • 读每一页;没有页范围参数
  • 匿名 API:/api/v1/convert/pdf/text

适用场景

  • 把带文字层的报告倒进 grep 或脚本
  • 从电子版备忘录得到一份粗糙 RTF 草稿
  • 检查一份 PDF 到底有没有文字层

如何提取 PDF 中的文字?

  1. 上传已有可选取文字的 PDF。
  2. 保留 TXT,或在需要 LibreOffice 富文本草稿时选 RTF。
  3. 点击处理,下载 `.txt` 或 `.rtf`。
  4. 抽几段核对。没有文字层的扫描件会看起来是空的。

限制与边界

  • 不是 OCR;扫描件几乎抽不出字
  • 没有页范围控件
  • TXT 不重建多栏的视觉阅读顺序
  • 本网站的上传上限:每个文件 500 MB,超过约 95 MB 时分块上传。直接调用 API 时,单个请求体上限为 100 MB。

示例

  • 可选取的年报通常会得到一份很长的 .txt
  • 白板拍照 PDF 通常得到空白或极小的文件

本工具的隐私说明

文件经 HTTPS 上传,在服务器内存或短期临时目录中处理,结果就绪后即删除。我们不会为日后浏览、训练或广告画像保留副本。留存期限与 AdSense Cookie 说明见隐私政策。

常见问题

为什么文本文件是空的?
PDF 里没有可供抽取器读取的文字对象。扫描件需要 OCR 成 Markdown。那份 Markdown 不能再送进本工具。
TXT 和从阅读器复制一样吗?
接近,但不相同。顺序跟随页面内容流里文字的存放方式。多栏版面可能和视觉阅读顺序不一致。
什么时候该选 RTF?
只有在你想让 LibreOffice 重建文档时。TXT 是直接抽取,不需要 soffice。
会保留字体和版式吗?
TXT 是纯文本。RTF 是尽力重建,不是像素级匹配。

最后更新:

用代码调用

本站每个工具都是普通 REST 接口。匿名使用不需要账号或 API Key,给浏览器、开发者和智能体同样可用。

curl -X POST "https://pdf123.xyz/api/v1/convert/pdf/text" \
  -F "[email protected]" \
  -F "outputFormat=txt" \
  -o output.pdf

也提供 MCP 工具,供说 Model Context Protocol 的客户端调用(JSON-RPC 2.0,POST /mcp)。 完整 API 文档

在 AI 代理中使用

Skill

装上这个 Skill,Claude Code、Codex、Cursor 等 AI 代理就能替你完成「PDF 转文本」: /skills/pdf123-pdf-to-text.md

全部 Agent Skill

文件只用于本次处理,完成后自动删除。