把掃描版 PDF 用 OCR 轉成 Markdown
OCR 轉 Markdown 讀取掃描版或純影像的 PDF,把其中的文字以 Markdown 檔案回傳。它不會為 PDF 加入文字層,原始檔案保持不變。
把檔案拖到這裡,或點一下選擇
支援 PDF · 每個檔案上限 500.0 MB · 一次最多 20 個檔案
也可以按 Ctrl/Cmd+V 或從剪貼簿選單貼上檔案。
OCR 轉 Markdown 讀取掃描檔或純影像 PDF,回傳 Markdown(`text/markdown`,檔名 `.md`)。它不會把隱藏文字層寫回 PDF,也不會清理、糾偏或改寫掃描檔。
伺服器把 PDF 裡既有的原生文字,與影像頁的光學辨識結果拼在一起。Force OCR(`ocrType=force-ocr`,網站預設)會重新辨識每一頁。Normal(只要不是 `force-ocr`)有原生文字就用原生文字,只對純圖頁做 OCR。乾淨的電子版 PDF 上,Auto 不會載入 OCR 執行環境。
準確度取決於掃描品質、對比與傾斜。目前引擎沒有語言參數。用戶端若仍送出舊 Java OCRmyPDF 欄位(`languages`、`deskew`、`clean`、`sidecar`),會被忽略。
這不是轉 Word 或 PDF 轉文字的前置步驟。那些工具仍然需要 PDF 內部已有文字。這裡的 OCR 是平行抽取:你得到 Markdown,原 PDF 不變。
不要對無權數位化或再散布的檔案做 OCR。抽出的文字同樣受著作權與職場規範約束。
想要一份可搜尋 PDF 的人,這裡給不了。可搜尋的產物是 Markdown 檔。用編輯器打開,抽查必須準確的姓名與數字。
手機拍照盡量先裁切、擺正再上傳。梯形拍頁會把辨識浪費在背景上。OCR 不是翻譯:它辨識字元,不會把文件改寫成另一種語言。
工作在伺服器端執行。請及時下載。我們不會把你的檔案做成 OCR 文庫。有密碼保護的檔案,在你輸入密碼後會在本頁為你解鎖;API 呼叫端需先執行移除密碼。
功能
- 回傳 Markdown,不是帶 OCR 層的 PDF
- Force OCR 重讀每一頁;Normal/Auto 有原生文字就用原生文字
- 原 PDF 不變
- 匿名 API:/api/v1/misc/ocr-pdf
適用情境
- 從典藏掃描檔抽出條款文字
- 把掃描檔交給需要 Markdown 的代理或管線
- 純影像 PDF 沒有文字層時把字取回來
如何對掃描版 PDF 做 OCR?
- 上傳掃描檔或手機拍攝的 PDF。
- 選擇 Force OCR(預設)或 Normal/Auto。
- 點選處理,下載 `.md` 檔。
- 在 Markdown 裡抽查姓名與數字後再使用。
限制與邊界
- 準確度隨影像品質變化
- 頁數很多時耗時更長
- 目前引擎沒有語言參數
- 不是本機 OCR 程式庫,也不是離線 SDK
- 本網站的上傳上限:每個檔案 500 MB,超過約 95 MB 時分塊上傳。直接呼叫 API 時,單一請求本文上限為 100 MB。
示例
- 一份 20 頁灰階合約掃描檔,變成條款文字的 Markdown 檔
- 傾斜的手機拍頁可能要重拍,OCR 才有用
本工具的隱私說明
檔案經 HTTPS 上傳,在伺服器記憶體或短期暫存目錄中處理,結果就緒後即刪除。我們不會為日後瀏覽、訓練或廣告輪廓保留副本。留存期限與 AdSense Cookie 說明見隱私權政策。
常見問題
- OCR 會改變頁面外觀嗎?
- 它不回傳 PDF。原始檔不變;你另外得到一份 Markdown 下載。
- 這是可以嵌入的 OCR 程式庫嗎?
- 不是。這是託管在 /api/v1/misc/ocr-pdf 的 HTTP 工作。見 /developers。它不是可連結的 SDK。
- OCR 之後能再轉 Word 嗎?
- 不能當成 PDF 管線來接。OCR 輸出是 Markdown。轉 Word 仍然需要帶文字層的 PDF。
- 電子版 PDF 需要 Force OCR 嗎?
- 通常不需要。Normal/Auto 會用既有文字並跳過 OCR 執行環境。文字層損壞或不可信時再用 Force。
最後更新:
用程式碼呼叫
本站每個工具都是普通 REST 介面。匿名使用不需要帳號或 API Key,給瀏覽器、開發者與 AI 代理同樣可用。
curl -X POST "https://pdf123.xyz/api/v1/misc/ocr-pdf" \
-F "[email protected]" \
-F "ocrType=force-ocr" \
-o output.pdf也提供 MCP 工具,供說 Model Context Protocol 的用戶端呼叫(JSON-RPC 2.0,POST /mcp)。 完整 API 文件
在 AI 代理中使用
Skill裝上這個 Skill,Claude Code、Codex、Cursor 等 AI 代理就能替你完成「OCR 轉 Markdown」: /skills/pdf123-ocr.md
檔案只用於本次處理,完成後自動刪除。