Chuyển PDF sang HTML
PDF sang HTML chuyển PDF bằng pdftohtml của Poppler và giao một ZIP chứa các trang HTML cùng ảnh của chúng. Đây là bản chụp bố cục chứ không phải mã web sạch, và công cụ không OCR.
Kéo tệp vào đây, hoặc nhấp để chọn
Nhận PDF · tối đa 500.0 MB mỗi tệp · tối đa 20 tệp mỗi lần
Bạn cũng có thể dán tệp bằng Ctrl/Cmd+V hoặc từ menu clipboard.
PDF sang HTML chạy Poppler `pdftohtml -c`, đóng nội dung công cụ ghi vào thư mục đầu ra thành ZIP. Tên tải là `{base}ToHtml.zip`, không phải một `.html` đơn. Mục tiêu không phải CSS cấp trình duyệt, mà xuất HTML và ảnh của Poppler.
Trang này không có trường biểu mẫu. Mọi trang đều chuyển. Nếu `pdftohtml` không ghi gì, API trả lỗi nội bộ chứ không phải ZIP trống.
Đây không phải OCR. Bản quét thuần ảnh thành ảnh trong gói HTML, không phải chữ chọn được. Tệp có mật khẩu được mở khóa giúp bạn ngay trên trang này khi bạn nhập mật khẩu; người gọi API chạy Gỡ mật khẩu trước.
Chỉ cần chữ thì dùng PDF sang văn bản. Muốn bài phù hợp CMS thì dùng PDF sang Markdown.
Tải lên là tạm thời. Chúng tôi không lưu thư viện HTML của bạn.
Tính năng
- Poppler `pdftohtml -c`, đầu ra ZIP HTML kèm tài nguyên
- Không có phạm vi trang hay tùy chọn chủ đề
- Không OCR; bản quét trong gói vẫn là ảnh
- API ẩn danh: /api/v1/convert/pdf/html
Khi nào nên dùng
- Từ PDF có lớp chữ lấy HTML thô
- Lấy ảnh trang mà pdftohtml trích
- Trước đường ống tự dựng, xem Poppler hiểu tệp thế nào
Làm thế nào để chuyển PDF sang HTML?
- Tải lên PDF. Trang này không có tùy chọn chuyển.
- Nhấp xử lý, tải `{name}ToHtml.zip`.
- Giải nén rồi mở HTML trong trình duyệt.
- Kiểm ảnh và chữ. Bản quét không thành chữ HTML thật.
Giới hạn và ngoại lệ
- Đầu ra là ZIP, không phải một HTML đơn
- Không phải in Chromium, cũng không xuất HTML tagged-PDF
- pdftohtml trống là lỗi, không phải 204
- Giới hạn tải lên trên trang web này: 500 MB mỗi tệp, tệp lớn hơn khoảng 95 MB được gửi theo từng phần. Một yêu cầu API trực tiếp bị giới hạn ở 100 MB.
Ví dụ
- Biên bản chữ đơn giản thường giải nén ra một HTML kèm vài ảnh
- PDF thuần quét nhận HTML chủ yếu bao các ảnh trang đó
Quyền riêng tư của công cụ này
Tệp được tải lên qua HTTPS, xử lý trong bộ nhớ hoặc thư mục tạm ngắn hạn trên máy chủ của chúng tôi, rồi bị xóa khi kết quả sẵn sàng. Chúng tôi không giữ bản sao để xem lại sau, huấn luyện mô hình hay lập hồ sơ quảng cáo. Thời hạn lưu giữ và cookie AdSense nằm trong Chính sách quyền riêng tư.
Câu hỏi thường gặp
- Vì sao kết quả là ZIP?
- pdftohtml ghi HTML cộng ảnh trích vào một thư mục. Máy chủ đóng thư mục đó.
- HTML có khớp bố cục PDF không?
- Chỉ đến mức chế độ `-c` của Poppler. Tạp chí nhiều cột và nhiều vector thường lệch.
- Chuyển bản quét thành chữ HTML được không?
- Không. Đường này không OCR. Cần chữ hãy dùng OCR sang Markdown.
- Có chuyển trong trình duyệt không?
- Không. Máy chủ gọi pdftohtml.
Cập nhật lần cuối:
Gọi bằng mã
Mỗi công cụ trên trang là một API REST thông thường. Dùng ẩn danh không cần tài khoản hay API key. Trình duyệt, lập trình viên và agent đều gọi được.
curl -X POST "https://pdf123.xyz/api/v1/convert/pdf/html" \
-F "[email protected]" \
-o output.pdfCũng có dạng công cụ MCP cho client dùng Model Context Protocol (JSON-RPC 2.0, POST /mcp). Tài liệu API đầy đủ
Dùng từ AI agent
SkillVới skill này, Claude Code, Codex, Cursor và các AI agent khác có thể chạy "PDF sang HTML" thay bạn: /skills/pdf123-pdf-to-html.md
Tệp chỉ dùng cho lần xử lý này, xong là tự xóa.