ข้ามไปยังเนื้อหาหลัก
PPDF123

OCR PDF สแกนแล้วได้ Markdown

OCR เป็น Markdown คือเครื่องมือที่อ่านไฟล์ PDF สแกนหรือ PDF ที่เป็นภาพ แล้วส่งข้อความกลับมาเป็นไฟล์ Markdown ไม่ได้เพิ่มชั้นข้อความให้ PDF และไฟล์ต้นฉบับไม่เปลี่ยนแปลง

ลากไฟล์มาที่นี่ หรือคลิกเพื่อเลือก

รองรับ PDF · ไม่เกิน 500.0 MB ต่อไฟล์ · สูงสุด 20 ไฟล์ต่อครั้ง

คุณวางไฟล์ด้วย Ctrl/Cmd+V หรือจากเมนูคลิปบอร์ดได้เช่นกัน

OCR อ่านสแกนหรือ PDF ภาพล้วน แล้วคืน Markdown (`text/markdown` ชื่อไฟล์ `.md`) ไม่เขียนชั้นข้อความซ่อนกลับเข้า PDF และไม่ล้าง แก้เอียง หรือเขียนสแกนใหม่

เซิร์ฟเวอร์รวมข้อความที่มีอยู่แล้วใน PDF กับผลรู้จำจากหน้าภาพ Force OCR (`ocrType=force-ocr` ค่าเริ่มต้นบนเว็บ) รู้จำทุกหน้าใหม่ Normal (ทุกค่าที่ไม่ใช่ `force-ocr`) ใช้ข้อความที่มีอยู่ถ้ามี และทำ OCR เฉพาะหน้าภาพล้วน บน PDF อิเล็กทรอนิกส์ที่สะอาด Auto จะไม่โหลดรันไทม์ OCR

ความแม่นยำขึ้นกับคุณภาพสแกน คอนทราสต์ และการเอียง เอนจินปัจจุบันไม่มีพารามิเตอร์ภาษา หากไคลเอนต์ยังส่งฟิลด์ Java OCRmyPDF เก่า (`languages`, `deskew`, `clean`, `sidecar`) จะถูกละเว้น

นี่ไม่ใช่ขั้นก่อนแปลงเป็น Word หรือ PDF เป็นข้อความ เครื่องมือเหล่านั้นยังต้องการข้อความที่มีอยู่แล้วใน PDF OCR ที่นี่เป็นการดึงคู่ขนาน คุณได้ Markdown ต้น PDF ไม่เปลี่ยน

อย่าทำ OCR กับไฟล์ที่คุณไม่มีสิทธิ์แปลงเป็นดิจิทัลหรือแจกจ่ายต่อ ข้อความที่ดึงออกยังอยู่ภายใต้ลิขสิทธิ์และกฎที่ทำงาน

ผู้ที่ต้องการ PDF ค้นหาได้ จะไม่ได้นี่ ผลที่ค้นหาได้คือไฟล์ Markdown เปิดในตัวแก้ไข แล้วสุ่มตรวจชื่อและตัวเลขที่ต้องแม่น

ภาพมือถือควรตัดขอบและตั้งตรงก่อนอัปโหลด หน้าถ่ายแบบสี่เหลี่ยมคางหมูจะเสียการรู้จำไปกับพื้นหลัง OCR ไม่ใช่การแปล มันรู้จำตัวอักษร ไม่เขียนเอกสารเป็นภาษาอื่น

งานรันบนเซิร์ฟเวอร์ ให้ดาวน์โหลดทันเวลา เราไม่ทำคลัง OCR จากไฟล์ของคุณ ไฟล์ที่มีรหัสผ่านจะถูกปลดล็อกให้ในหน้านี้เมื่อคุณใส่รหัสผ่าน ส่วนผู้เรียก API ให้รันถอดรหัสผ่านก่อน

ความสามารถ

  • คืน Markdown ไม่ใช่ PDF ที่มีชั้น OCR
  • Force OCR อ่านทุกหน้าใหม่ Normal/Auto ใช้ข้อความที่มีอยู่ถ้ามี
  • ต้น PDF ไม่เปลี่ยน
  • API แบบไม่ระบุตัวตน: /api/v1/misc/ocr-pdf

ใช้เมื่อไหร่

  • ดึงข้อความข้อจากสแกนเอกสารเก่า
  • ส่งสแกนเข้าเอเจนต์หรือท่อที่ต้องการ Markdown
  • เอาข้อความกลับจาก PDF ภาพล้วนที่ไม่มีชั้นข้อความ

ทำ OCR ไฟล์ PDF สแกนได้อย่างไร

  1. อัปโหลด PDF สแกนหรือถ่ายด้วยมือถือ
  2. เลือก Force OCR (ค่าเริ่มต้น) หรือ Normal/Auto
  3. คลิกเริ่มประมวลผล แล้วดาวน์โหลดไฟล์ `.md`
  4. สุ่มตรวจชื่อและตัวเลขใน Markdown ก่อนใช้งาน

ข้อจำกัดและกรณีพิเศษ

  • ความแม่นยำตามคุณภาพภาพ
  • หน้าเยอะใช้เวลานานกว่า
  • เอนจินปัจจุบันไม่มีพารามิเตอร์ภาษา
  • ไม่ใช่ไลบรารี OCR ท้องถิ่น และไม่ใช่ SDK ออฟไลน์
  • ขีดจำกัดการอัปโหลดบนเว็บไซต์นี้: ไฟล์ละ 500 MB โดยไฟล์ที่ใหญ่กว่าประมาณ 95 MB จะถูกส่งเป็นส่วน ๆ ส่วนเนื้อหาของคำขอ API โดยตรงหนึ่งครั้งจำกัดที่ 100 MB

ตัวอย่าง

  • สแกนสัญญาโทนเทา 20 หน้ากลายเป็นไฟล์ Markdown ของข้อความข้อ
  • ภาพมือถือเอียงอาจต้องถ่ายใหม่ OCR จึงมีประโยชน์

ความเป็นส่วนตัวของเครื่องมือนี้

ไฟล์อัปโหลดผ่าน HTTPS ประมวลผลในหน่วยความจำหรือไดเรกทอรีชั่วคราวอายุสั้นบนเซิร์ฟเวอร์ของเรา และลบเมื่อผลลัพธ์พร้อม เราไม่เก็บสำเนาไว้เปิดดูภายหลัง ฝึกโมเดล หรือสร้างโปรไฟล์โฆษณา รายละเอียดการเก็บรักษาและการเปิดเผยคุกกี้ AdSense อยู่ในนโยบายความเป็นส่วนตัว

คำถามที่พบบ่อย

OCR เปลี่ยนรูปลักษณ์หน้าหรือไม่
ไม่คืน PDF ต้นไฟล์ไม่เปลี่ยน คุณได้ Markdown ดาวน์โหลดแยก
นี่คือไลบรารี OCR ที่ฝังได้หรือไม่
ไม่ นี่คืองาน HTTP ที่โฮสต์ที่ /api/v1/misc/ocr-pdf ดู /developers ไม่ใช่ SDK ที่ลิงก์ได้
หลัง OCR แปลงเป็น Word ต่อได้ไหม
ต่อเป็นท่อ PDF ไม่ได้ OCR ออกเป็น Markdown การแปลงเป็น Word ยังต้องการ PDF ที่มีชั้นข้อความ
PDF อิเล็กทรอนิกส์ต้อง Force OCR หรือไม่
โดยปกติไม่ต้อง Normal/Auto ใช้ข้อความที่มีอยู่และข้ามรันไทม์ OCR ใช้ Force เมื่อชั้นข้อความเสียหรือเชื่อถือไม่ได้

อัปเดตล่าสุด:

เรียกจากโค้ด

เครื่องมือทุกตัวบนเว็บนี้เป็น REST endpoint ธรรมดา ไม่ต้องมีบัญชีหรือคีย์ API ก็เรียกได้ ใช้ได้ทั้งเบราว์เซอร์ นักพัฒนา และเอเจนต์

curl -X POST "https://pdf123.xyz/api/v1/misc/ocr-pdf" \
  -F "[email protected]" \
  -F "ocrType=force-ocr" \
  -o output.pdf

มีเป็นเครื่องมือ MCP สำหรับไคลเอนต์เอเจนต์ที่รองรับ Model Context Protocol (JSON-RPC 2.0 ผ่าน POST /mcp) เอกสาร API ฉบับเต็ม

ใช้งานผ่านเอเจนต์ AI

สกิล

เมื่อติดตั้งสกิลนี้ Claude Code, Codex, Cursor และเอเจนต์ AI อื่น ๆ จะใช้ "OCR เป็น Markdown" แทนคุณได้: /skills/pdf123-ocr.md

สกิลสำหรับเอเจนต์ทั้งหมด

ไฟล์ใช้เฉพาะงานนี้ เสร็จแล้วลบอัตโนมัติ