跳至主要內容
PPDF123

把 PDF 轉成文字

PDF 轉文字擷取 PDF 中已有的文字,以純文字 .txt 檔案回傳,也可選 RTF。它不執行 OCR,所以純影像掃描檔擷取出來是空的。

把檔案拖到這裡,或點一下選擇

支援 PDF · 每個檔案上限 500.0 MB · 一次最多 20 個檔案

也可以按 Ctrl/Cmd+V 或從剪貼簿選單貼上檔案。

PDF 轉文字抽出已經作為文字物件存在的詞。預設 `txt` 路徑用與其他 pdf-core 操作相同的本機抽取器(`pdfio::extract_text`),回傳 `text/plain`。不跑 OCR,也不呼叫 LibreOffice。

選 `rtf` 時,檔案改走 LibreOffice `writer_pdf_import`。那條路徑需要伺服器上的 `soffice`,並重建一份粗糙的豐富文字。字型替換與表錯位是常態。把 RTF 當草稿。

純影像掃描檔會得到空的或幾乎為空的 `.txt`。本站 OCR 回傳 Markdown,不是可再送回這裡的可搜尋 PDF。

本頁沒有頁範圍欄位。每一頁都會讀。有密碼保護的檔案,在你輸入密碼後會在本頁為你解鎖;API 呼叫端需先執行移除密碼。

若要標題與清單而不是純文字,用 PDF 轉 Markdown。若要表格成列,用 PDF 轉 CSV 或 PDF 轉 Excel。

上傳是暫時的。我們不會保存你的文字文庫。

功能

  • 預設 TXT 走本機文字抽取,不是 pdftotext,也不是 OCR
  • 可選 RTF,經 LibreOffice `writer_pdf_import`
  • 讀每一頁;沒有頁範圍參數
  • 匿名 API:/api/v1/convert/pdf/text

適用情境

  • 把帶文字層的報告倒進 grep 或腳本
  • 從電子版備忘錄得到一份粗糙 RTF 草稿
  • 檢查一份 PDF 到底有沒有文字層

如何擷取 PDF 中的文字?

  1. 上傳已有可選取文字的 PDF。
  2. 保留 TXT,或在需要 LibreOffice 豐富文字草稿時選 RTF。
  3. 點選處理,下載 `.txt` 或 `.rtf`。
  4. 抽幾段核對。沒有文字層的掃描檔會看起來是空的。

限制與邊界

  • 不是 OCR;掃描檔幾乎抽不出字
  • 沒有頁範圍控制項
  • TXT 不重建多欄的視覺閱讀順序
  • 本網站的上傳上限:每個檔案 500 MB,超過約 95 MB 時分塊上傳。直接呼叫 API 時,單一請求本文上限為 100 MB。

示例

  • 可選取的年報通常會得到一份很長的 .txt
  • 白板拍照 PDF 通常得到空白或極小的檔案

本工具的隱私說明

檔案經 HTTPS 上傳,在伺服器記憶體或短期暫存目錄中處理,結果就緒後即刪除。我們不會為日後瀏覽、訓練或廣告輪廓保留副本。留存期限與 AdSense Cookie 說明見隱私權政策。

常見問題

為什麼文字檔是空的?
PDF 裡沒有可供抽取器讀取的文字物件。掃描檔需要 OCR 成 Markdown。那份 Markdown 不能再送進本工具。
TXT 和從檢視器複製一樣嗎?
接近,但不相同。順序跟隨頁面內容串流裡文字的存放方式。多欄版面可能和視覺閱讀順序不一致。
什麼時候該選 RTF?
只有在你想讓 LibreOffice 重建文件時。TXT 是直接抽取,不需要 soffice。
會保留字型與版式嗎?
TXT 是純文字。RTF 是盡力重建,不是像素級相符。

最後更新:

用程式碼呼叫

本站每個工具都是普通 REST 介面。匿名使用不需要帳號或 API Key,給瀏覽器、開發者與 AI 代理同樣可用。

curl -X POST "https://pdf123.xyz/api/v1/convert/pdf/text" \
  -F "[email protected]" \
  -F "outputFormat=txt" \
  -o output.pdf

也提供 MCP 工具,供說 Model Context Protocol 的用戶端呼叫(JSON-RPC 2.0,POST /mcp)。 完整 API 文件

在 AI 代理中使用

Skill

裝上這個 Skill,Claude Code、Codex、Cursor 等 AI 代理就能替你完成「PDF 轉文字」: /skills/pdf123-pdf-to-text.md

全部 Agent Skill

檔案只用於本次處理,完成後自動刪除。