OCR PDF bản quét sang Markdown
OCR sang Markdown đọc PDF bản quét hoặc PDF dạng ảnh và trả về chữ dưới dạng tệp Markdown. Công cụ không thêm lớp chữ vào PDF, và tệp gốc không bị thay đổi.
Kéo tệp vào đây, hoặc nhấp để chọn
Nhận PDF · tối đa 500.0 MB mỗi tệp · tối đa 20 tệp mỗi lần
Bạn cũng có thể dán tệp bằng Ctrl/Cmd+V hoặc từ menu clipboard.
OCR sang Markdown đọc bản quét hoặc PDF thuần ảnh và trả về Markdown (`text/markdown`, tên tệp `.md`). Không ghi lớp chữ ẩn trở lại PDF, cũng không làm sạch, chỉnh lệch hay viết lại bản quét.
Máy chủ ghép chữ gốc sẵn có trong PDF với nhận dạng quang học trên trang ảnh. Force OCR (`ocrType=force-ocr`, mặc định trên web) nhận dạng lại mọi trang. Normal (mọi giá trị khác `force-ocr`) dùng chữ gốc nếu có, chỉ OCR trang thuần ảnh. PDF điện tử sạch với Auto không tải runtime OCR.
Độ chính xác phụ thuộc chất lượng quét, độ tương phản và độ nghiêng. Engine hiện tại không có tham số ngôn ngữ. Client nếu vẫn gửi trường Java OCRmyPDF cũ (`languages`, `deskew`, `clean`, `sidecar`) sẽ bị bỏ qua.
Đây không phải bước trước của PDF sang Word hay PDF sang văn bản. Các công cụ đó vẫn cần chữ đã có trong PDF. OCR ở đây là trích xuất song song: bạn nhận Markdown, PDF gốc không đổi.
Đừng OCR tệp bạn không có quyền số hóa hoặc phát hành lại. Chữ trích ra cũng chịu bản quyền và quy tắc nơi làm việc.
Ai muốn PDF tìm kiếm được sẽ không nhận được ở đây. Sản phẩm tìm kiếm được là tệp Markdown. Mở bằng trình soạn thảo, kiểm tra tên và số phải đúng.
Ảnh điện thoại nên cắt và chỉnh thẳng trước khi tải. Trang chụp hình thang lãng phí nhận dạng vào nền. OCR không phải dịch: nó nhận ký tự, không viết lại tài liệu sang ngôn ngữ khác.
Tác vụ chạy trên máy chủ. Hãy tải kịp thời. Chúng tôi không biến tệp của bạn thành thư viện OCR. Tệp có mật khẩu được mở khóa giúp bạn ngay trên trang này khi bạn nhập mật khẩu; người gọi API chạy Gỡ mật khẩu trước.
Tính năng
- Trả về Markdown, không phải PDF có lớp OCR
- Force OCR đọc lại mọi trang; Normal/Auto dùng chữ gốc nếu có
- PDF gốc không đổi
- API ẩn danh: /api/v1/misc/ocr-pdf
Khi nào nên dùng
- Trích điều khoản từ bản quét lưu trữ
- Đưa bản quét cho agent hoặc pipeline cần Markdown
- Lấy lại chữ khi PDF thuần ảnh không có lớp chữ
Làm thế nào để OCR PDF bản quét?
- Tải lên bản quét hoặc PDF chụp bằng điện thoại.
- Chọn Force OCR (mặc định) hoặc Normal/Auto.
- Nhấp Bắt đầu xử lý, tải tệp `.md`.
- Trong Markdown, kiểm tra tên và số trước khi dùng.
Giới hạn và ngoại lệ
- Độ chính xác phụ thuộc chất lượng ảnh
- Nhiều trang thì mất nhiều thời gian hơn
- Engine hiện tại không có tham số ngôn ngữ
- Không phải thư viện OCR cục bộ hay SDK ngoại tuyến
- Giới hạn tải lên trên trang web này: 500 MB mỗi tệp, tệp lớn hơn khoảng 95 MB được gửi theo từng phần. Một yêu cầu API trực tiếp bị giới hạn ở 100 MB.
Ví dụ
- Hợp đồng quét xám 20 trang thành tệp Markdown chứa chữ điều khoản
- Trang chụp điện thoại bị nghiêng có thể phải chụp lại mới OCR hữu ích
Quyền riêng tư của công cụ này
Tệp được tải lên qua HTTPS, xử lý trong bộ nhớ hoặc thư mục tạm ngắn hạn trên máy chủ của chúng tôi, rồi bị xóa khi kết quả sẵn sàng. Chúng tôi không giữ bản sao để duyệt sau, huấn luyện hay lập hồ sơ quảng cáo. Thời hạn lưu giữ và thông báo cookie AdSense nằm trong Chính sách quyền riêng tư.
Câu hỏi thường gặp
- OCR có đổi giao diện trang không?
- Không trả về PDF. Tệp gốc không đổi; bạn nhận thêm bản tải Markdown.
- Đây có phải thư viện OCR nhúng được không?
- Không. Đây là tác vụ HTTP tại /api/v1/misc/ocr-pdf. Xem /developers. Không phải SDK liên kết được.
- Sau OCR có chuyển Word được không?
- Không nối như pipeline PDF. Đầu ra OCR là Markdown. PDF sang Word vẫn cần PDF có lớp chữ.
- PDF điện tử có cần Force OCR không?
- Thường không. Normal/Auto dùng chữ sẵn có và bỏ qua runtime OCR. Dùng Force khi lớp chữ hỏng hoặc không đáng tin.
Cập nhật lần cuối:
Gọi bằng mã
Mỗi công cụ trên trang là một API REST thông thường. Dùng ẩn danh không cần tài khoản hay API key. Trình duyệt, lập trình viên và agent đều gọi được.
curl -X POST "https://pdf123.xyz/api/v1/misc/ocr-pdf" \
-F "[email protected]" \
-F "ocrType=force-ocr" \
-o output.pdfCũng có dạng công cụ MCP cho client dùng Model Context Protocol (JSON-RPC 2.0, POST /mcp). Tài liệu API đầy đủ
Dùng từ AI agent
SkillVới skill này, Claude Code, Codex, Cursor và các AI agent khác có thể chạy "OCR sang Markdown" thay bạn: /skills/pdf123-ocr.md
Tệp chỉ dùng cho lần xử lý này, xong là tự xóa.