Chuyển đến nội dung chính
PPDF123

Chuyển PDF sang văn bản

PDF sang văn bản trích phần chữ đã có sẵn trong PDF và trả về tệp .txt thuần hoặc RTF. Công cụ không chạy OCR, nên bản quét chỉ gồm ảnh sẽ ra trống.

Kéo tệp vào đây, hoặc nhấp để chọn

Nhận PDF · tối đa 500.0 MB mỗi tệp · tối đa 20 tệp mỗi lần

Bạn cũng có thể dán tệp bằng Ctrl/Cmd+V hoặc từ menu clipboard.

PDF sang văn bản trích các từ đã tồn tại dưới dạng đối tượng chữ. Đường `txt` mặc định dùng bộ trích cục bộ giống các thao tác pdf-core khác (`pdfio::extract_text`), trả về `text/plain`. Không chạy OCR, cũng không gọi LibreOffice.

Chọn `rtf` thì tệp đi LibreOffice `writer_pdf_import`. Đường đó cần `soffice` trên máy chủ và dựng lại văn bản phong phú thô. Thay phông và lệch bảng là thường. Hãy coi RTF là bản thảo.

Bản quét thuần ảnh nhận `.txt` trống hoặc gần trống. OCR trên trang này trả về Markdown, không phải PDF tìm kiếm được để đưa lại vào đây.

Trang này không có trường phạm vi trang. Mọi trang đều đọc. Tệp có mật khẩu được mở khóa giúp bạn ngay trên trang này khi bạn nhập mật khẩu; người gọi API chạy Gỡ mật khẩu trước.

Muốn tiêu đề và danh sách thay vì văn bản thuần, dùng PDF sang Markdown. Muốn bảng thành hàng, dùng PDF sang CSV hoặc PDF sang Excel.

Tải lên là tạm thời. Chúng tôi không lưu thư viện văn bản của bạn.

Tính năng

  • TXT mặc định đi trích chữ cục bộ, không phải pdftotext, cũng không OCR
  • RTF tùy chọn qua LibreOffice `writer_pdf_import`
  • Đọc mọi trang; không có tham số phạm vi trang
  • API ẩn danh: /api/v1/convert/pdf/text

Khi nào nên dùng

  • Đổ báo cáo có lớp chữ vào grep hoặc script
  • Từ biên bản điện tử lấy bản thảo RTF thô
  • Kiểm PDF có lớp chữ hay không

Làm thế nào để trích chữ từ PDF?

  1. Tải lên PDF đã có chữ chọn được.
  2. Giữ TXT, hoặc chọn RTF khi cần bản thảo giàu văn bản LibreOffice.
  3. Nhấp xử lý, tải `.txt` hoặc `.rtf`.
  4. Kiểm vài đoạn. Bản quét không có lớp chữ sẽ trông trống.

Giới hạn và ngoại lệ

  • Không OCR; bản quét hầu như không trích được chữ
  • Không điều khiển phạm vi trang
  • TXT không dựng lại thứ tự đọc nhìn nhiều cột
  • Giới hạn tải lên trên trang web này: 500 MB mỗi tệp, tệp lớn hơn khoảng 95 MB được gửi theo từng phần. Một yêu cầu API trực tiếp bị giới hạn ở 100 MB.

Ví dụ

  • Báo cáo năm chọn được chữ thường cho .txt rất dài
  • PDF ảnh bảng trắng thường cho tệp trống hoặc rất nhỏ

Quyền riêng tư của công cụ này

Tệp được tải lên qua HTTPS, xử lý trong bộ nhớ hoặc thư mục tạm ngắn hạn trên máy chủ của chúng tôi, rồi bị xóa khi kết quả sẵn sàng. Chúng tôi không giữ bản sao để xem lại sau, huấn luyện mô hình hay lập hồ sơ quảng cáo. Thời hạn lưu giữ và cookie AdSense nằm trong Chính sách quyền riêng tư.

Câu hỏi thường gặp

Vì sao tệp văn bản trống?
PDF không có đối tượng chữ để bộ trích đọc. Bản quét cần OCR thành Markdown. Markdown đó không đưa lại vào công cụ này.
TXT có giống sao chép từ trình đọc không?
Gần, nhưng không giống hệt. Thứ tự theo cách chữ nằm trong luồng nội dung trang. Bố cục nhiều cột có thể không khớp thứ tự đọc nhìn.
Khi nào chọn RTF?
Chỉ khi bạn muốn LibreOffice dựng lại tài liệu. TXT là trích trực tiếp, không cần soffice.
Có giữ phông và bố cục không?
TXT là văn bản thuần. RTF là dựng lại càng tốt càng hay, không khớp từng pixel.

Cập nhật lần cuối:

Gọi bằng mã

Mỗi công cụ trên trang là một API REST thông thường. Dùng ẩn danh không cần tài khoản hay API key. Trình duyệt, lập trình viên và agent đều gọi được.

curl -X POST "https://pdf123.xyz/api/v1/convert/pdf/text" \
  -F "[email protected]" \
  -F "outputFormat=txt" \
  -o output.pdf

Cũng có dạng công cụ MCP cho client dùng Model Context Protocol (JSON-RPC 2.0, POST /mcp). Tài liệu API đầy đủ

Dùng từ AI agent

Skill

Với skill này, Claude Code, Codex, Cursor và các AI agent khác có thể chạy "PDF sang văn bản" thay bạn: /skills/pdf123-pdf-to-text.md

Tất cả skill cho agent

Tệp chỉ dùng cho lần xử lý này, xong là tự xóa.