跳至主要內容
PPDF123

把 PDF 轉成 HTML

PDF 轉 HTML 用 Poppler 的 pdftohtml 轉換 PDF,交付一個含 HTML 頁面及其圖片的 ZIP。它是版面匯出,而不是整潔的網頁標記,也不做 OCR。

把檔案拖到這裡,或點一下選擇

支援 PDF · 每個檔案上限 500.0 MB · 一次最多 20 個檔案

也可以按 Ctrl/Cmd+V 或從剪貼簿選單貼上檔案。

PDF 轉 HTML 執行 Poppler `pdftohtml -c`,把該工具寫進輸出目錄的內容打成 ZIP。下載名是 `{base}ToHtml.zip`,不是單個 `.html`。目標不是瀏覽器級 CSS,而是 Poppler 的 HTML 與圖片匯出。

本頁沒有表單欄位。每一頁都會轉。若 `pdftohtml` 什麼都沒寫,介面回傳內部錯誤,而不是空 ZIP。

這不是 OCR。純影像掃描檔會變成 HTML 包裡的圖片,不是可選取文字。有密碼保護的檔案,在你輸入密碼後會在本頁為你解鎖;API 呼叫端需先執行移除密碼。

若只要文字,用 PDF 轉文字。若要適合 CMS 的文章,用 PDF 轉 Markdown。

上傳是暫時的。我們不會保存你的 HTML 文庫。

功能

  • Poppler `pdftohtml -c`,產出 HTML 與資源的 ZIP
  • 沒有頁範圍或主題選項
  • 不是 OCR;掃描檔在包裡仍是圖
  • 匿名 API:/api/v1/convert/pdf/html

適用情境

  • 從帶文字層的 PDF 得到一份粗糙 HTML
  • 拿走 pdftohtml 抽出的頁面圖
  • 在自建管線前,看看 Poppler 如何理解這份檔案

如何把 PDF 轉成 HTML?

  1. 上傳 PDF。本頁沒有轉換選項。
  2. 點選處理,下載 `{name}ToHtml.zip`。
  3. 解壓後在瀏覽器打開 HTML。
  4. 檢查圖與字。掃描檔不會變成真正的 HTML 文字。

限制與邊界

  • 產出是 ZIP,不是單個 HTML
  • 不是 Chromium 列印,也不是 tagged-PDF 的 HTML 匯出
  • pdftohtml 空輸出是錯誤,不是 204
  • 本網站的上傳上限:每個檔案 500 MB,超過約 95 MB 時分塊上傳。直接呼叫 API 時,單一請求本文上限為 100 MB。

示例

  • 簡單文字備忘錄常常解壓出一份 HTML 加幾張圖
  • 純掃描 PDF 得到的 HTML 多半是在包那些頁圖

本工具的隱私說明

檔案經 HTTPS 上傳,在伺服器記憶體或短期暫存目錄中處理,結果就緒後即刪除。我們不會為日後瀏覽、訓練或廣告輪廓保留副本。留存期限與 AdSense Cookie 說明見隱私權政策。

常見問題

為什麼結果是 ZIP?
pdftohtml 把 HTML 加上抽出的圖寫進一個資料夾。伺服器把那個資料夾打包。
HTML 會和 PDF 版式一致嗎?
只到 Poppler `-c` 模式的程度。多欄雜誌與大量向量常常對不齊。
能把掃描檔轉成 HTML 文字嗎?
不能。這條路徑不做 OCR。需要文字請用 OCR 轉 Markdown。
是在瀏覽器裡轉的嗎?
不是。伺服器呼叫 pdftohtml。

最後更新:

用程式碼呼叫

本站每個工具都是普通 REST 介面。匿名使用不需要帳號或 API Key,給瀏覽器、開發者與 AI 代理同樣可用。

curl -X POST "https://pdf123.xyz/api/v1/convert/pdf/html" \
  -F "[email protected]" \
  -o output.pdf

也提供 MCP 工具,供說 Model Context Protocol 的用戶端呼叫(JSON-RPC 2.0,POST /mcp)。 完整 API 文件

在 AI 代理中使用

Skill

裝上這個 Skill,Claude Code、Codex、Cursor 等 AI 代理就能替你完成「PDF 轉 HTML」: /skills/pdf123-pdf-to-html.md

全部 Agent Skill

檔案只用於本次處理,完成後自動刪除。