把 PDF 轉成文字
PDF 轉文字擷取 PDF 中已有的文字,以純文字 .txt 檔案回傳,也可選 RTF。它不執行 OCR,所以純影像掃描檔擷取出來是空的。
把檔案拖到這裡,或點一下選擇
支援 PDF · 每個檔案上限 500.0 MB · 一次最多 20 個檔案
也可以按 Ctrl/Cmd+V 或從剪貼簿選單貼上檔案。
PDF 轉文字抽出已經作為文字物件存在的詞。預設 `txt` 路徑用與其他 pdf-core 操作相同的本機抽取器(`pdfio::extract_text`),回傳 `text/plain`。不跑 OCR,也不呼叫 LibreOffice。
選 `rtf` 時,檔案改走 LibreOffice `writer_pdf_import`。那條路徑需要伺服器上的 `soffice`,並重建一份粗糙的豐富文字。字型替換與表錯位是常態。把 RTF 當草稿。
純影像掃描檔會得到空的或幾乎為空的 `.txt`。本站 OCR 回傳 Markdown,不是可再送回這裡的可搜尋 PDF。
本頁沒有頁範圍欄位。每一頁都會讀。有密碼保護的檔案,在你輸入密碼後會在本頁為你解鎖;API 呼叫端需先執行移除密碼。
若要標題與清單而不是純文字,用 PDF 轉 Markdown。若要表格成列,用 PDF 轉 CSV 或 PDF 轉 Excel。
上傳是暫時的。我們不會保存你的文字文庫。
功能
- 預設 TXT 走本機文字抽取,不是 pdftotext,也不是 OCR
- 可選 RTF,經 LibreOffice `writer_pdf_import`
- 讀每一頁;沒有頁範圍參數
- 匿名 API:/api/v1/convert/pdf/text
適用情境
- 把帶文字層的報告倒進 grep 或腳本
- 從電子版備忘錄得到一份粗糙 RTF 草稿
- 檢查一份 PDF 到底有沒有文字層
如何擷取 PDF 中的文字?
- 上傳已有可選取文字的 PDF。
- 保留 TXT,或在需要 LibreOffice 豐富文字草稿時選 RTF。
- 點選處理,下載 `.txt` 或 `.rtf`。
- 抽幾段核對。沒有文字層的掃描檔會看起來是空的。
限制與邊界
- 不是 OCR;掃描檔幾乎抽不出字
- 沒有頁範圍控制項
- TXT 不重建多欄的視覺閱讀順序
- 本網站的上傳上限:每個檔案 500 MB,超過約 95 MB 時分塊上傳。直接呼叫 API 時,單一請求本文上限為 100 MB。
示例
- 可選取的年報通常會得到一份很長的 .txt
- 白板拍照 PDF 通常得到空白或極小的檔案
本工具的隱私說明
檔案經 HTTPS 上傳,在伺服器記憶體或短期暫存目錄中處理,結果就緒後即刪除。我們不會為日後瀏覽、訓練或廣告輪廓保留副本。留存期限與 AdSense Cookie 說明見隱私權政策。
常見問題
- 為什麼文字檔是空的?
- PDF 裡沒有可供抽取器讀取的文字物件。掃描檔需要 OCR 成 Markdown。那份 Markdown 不能再送進本工具。
- TXT 和從檢視器複製一樣嗎?
- 接近,但不相同。順序跟隨頁面內容串流裡文字的存放方式。多欄版面可能和視覺閱讀順序不一致。
- 什麼時候該選 RTF?
- 只有在你想讓 LibreOffice 重建文件時。TXT 是直接抽取,不需要 soffice。
- 會保留字型與版式嗎?
- TXT 是純文字。RTF 是盡力重建,不是像素級相符。
最後更新:
用程式碼呼叫
本站每個工具都是普通 REST 介面。匿名使用不需要帳號或 API Key,給瀏覽器、開發者與 AI 代理同樣可用。
curl -X POST "https://pdf123.xyz/api/v1/convert/pdf/text" \
-F "[email protected]" \
-F "outputFormat=txt" \
-o output.pdf也提供 MCP 工具,供說 Model Context Protocol 的用戶端呼叫(JSON-RPC 2.0,POST /mcp)。 完整 API 文件
在 AI 代理中使用
Skill裝上這個 Skill,Claude Code、Codex、Cursor 等 AI 代理就能替你完成「PDF 轉文字」: /skills/pdf123-pdf-to-text.md
檔案只用於本次處理,完成後自動刪除。