Langkau ke kandungan utama
PPDF123

OCR PDF Imbasan ke Markdown

OCR ke Markdown membaca PDF imbasan atau berasaskan imej dan memulangkan teksnya sebagai fail Markdown. Ia tidak menambah lapisan teks pada PDF, dan fail asal tidak diubah.

Seret dan lepaskan fail di sini, atau klik untuk pilih

Menerima PDF · sehingga 500.0 MB setiap fail · sehingga 20 fail sekali gus

Anda juga boleh menampal fail dengan Ctrl/Cmd+V atau dari menu papan keratan.

OCR ke Markdown membaca imbasan atau PDF imej tulen dan mengembalikan Markdown (`text/markdown`, nama fail `.md`). Ia tidak menulis lapisan teks tersembunyi kembali ke PDF, dan tidak membersihkan, meluruskan atau menulis semula imbasan.

Pelayan mencantum teks asli yang sudah ada dalam PDF dengan hasil pengecaman optik daripada halaman imej. Force OCR (`ocrType=force-ocr`, lalai tapak) mengenal semula setiap halaman. Normal (apa-apa selain `force-ocr`) menggunakan teks asli jika ada, dan hanya OCR halaman imej tulen. Pada PDF elektronik yang bersih, Auto tidak memuatkan masa jalan OCR.

Ketepatan bergantung pada kualiti imbasan, kontras dan kecondongan. Enjin semasa tiada parameter bahasa. Jika klien masih menghantar medan Java OCRmyPDF lama (`languages`, `deskew`, `clean`, `sidecar`), medan itu diabaikan.

Ini bukan langkah pra untuk PDF ke Word atau PDF ke RTF (Teks). Alat-alat itu masih memerlukan teks yang sudah ada dalam PDF. OCR di sini ialah ekstrak selari: anda mendapat Markdown, PDF asal tidak berubah.

Jangan OCR fail yang anda tidak berhak digitkan atau edarkan semula. Teks yang diekstrak juga tertakluk kepada hak cipta dan peraturan tempat kerja.

Mereka yang mahu PDF boleh dicari tidak mendapatnya di sini. Hasil yang boleh dicari ialah fail Markdown. Buka dalam editor dan semak nama serta nombor yang mesti tepat.

Foto telefon sebaiknya dipangkas dan diluruskan dahulu sebelum dimuat naik. Halaman yang diambil secara trapezoid membazirkan pengecaman pada latar. OCR bukan terjemahan: ia mengecam aksara, tidak menulis semula dokumen dalam bahasa lain.

Tugas dijalankan di pelayan. Muat turun tepat pada masanya. Kami tidak menjadikan fail anda perpustakaan OCR. Fail yang dilindungi kata laluan dibuka untuk anda pada halaman ini sebaik sahaja anda memasukkan kata laluan; pemanggil API perlu menjalankan Buang kata laluan dahulu.

Ciri

  • Mengembalikan Markdown, bukan PDF dengan lapisan OCR
  • Force OCR membaca semula setiap halaman; Normal/Auto menggunakan teks asli jika ada
  • PDF asal tidak berubah
  • API tanpa nama: /api/v1/misc/ocr-pdf

Bila menggunakan alat ini

  • Ekstrak teks klausa daripada imbasan arkib
  • Serahkan imbasan kepada ejen atau saluran paip yang memerlukan Markdown
  • Ambil semula teks apabila PDF imej tulen tiada lapisan teks

Bagaimana cara melakukan OCR pada PDF imbasan?

  1. Muat naik PDF imbasan atau rakaman telefon.
  2. Pilih Force OCR (lalai) atau Normal/Auto.
  3. Klik proses, kemudian muat turun fail `.md`.
  4. Semak nama dan nombor dalam Markdown sebelum digunakan.

Had dan kes khas

  • Ketepatan berubah mengikut kualiti imej
  • Banyak halaman mengambil masa lebih lama
  • Enjin semasa tiada parameter bahasa
  • Bukan pustaka OCR tempatan, juga bukan SDK luar talian
  • Had muat naik di tapak web ini: 500 MB setiap fail, dihantar berketul-ketul melebihi kira-kira 95 MB. Satu badan permintaan API langsung dihadkan pada 100 MB.

Contoh

  • Imbasan kontrak skala kelabu 20 halaman menjadi fail Markdown teks klausa
  • Halaman foto telefon yang condong mungkin perlu diambil semula supaya OCR berguna

Privasi untuk alat ini

Fail dimuat naik melalui HTTPS, diproses dalam memori atau direktori sementara singkat di pelayan kami, kemudian dipadam apabila hasil sedia. Kami tidak menyimpan salinan untuk semakan kemudian, latihan, atau profil iklan. Lihat Dasar Privasi untuk pengekalan dan pendedahan kuki AdSense.

Soalan lazim

Adakah OCR mengubah rupa halaman?
Ia tidak mengembalikan PDF. Fail asal tidak berubah; anda mendapat muat turun Markdown berasingan.
Adakah ini pustaka OCR yang boleh dibenamkan?
Tidak. Ini tugas HTTP yang dihos di /api/v1/misc/ocr-pdf. Lihat /developers. Ia bukan SDK yang boleh dipautkan.
Bolehkah tukar ke Word selepas OCR?
Tidak sebagai saluran paip PDF. Output OCR ialah Markdown. PDF ke Word masih memerlukan PDF dengan lapisan teks.
Adakah PDF elektronik memerlukan Force OCR?
Biasanya tidak. Normal/Auto menggunakan teks sedia ada dan melangkau masa jalan OCR. Guna Force apabila lapisan teks rosak atau tidak dipercayai.

Kemas kini terakhir:

Panggil dari kod

Setiap alat di laman ini ialah panggilan REST biasa. Penggunaan tanpa nama tidak perlukan akaun atau kunci API. Untuk pelayar, pembangun dan ejen AI sama-sama.

curl -X POST "https://pdf123.xyz/api/v1/misc/ocr-pdf" \
  -F "[email protected]" \
  -F "ocrType=force-ocr" \
  -o output.pdf

Juga tersedia sebagai alat MCP untuk klien ejen yang menggunakan Model Context Protocol (JSON-RPC 2.0 melalui POST /mcp). Rujukan API penuh

Gunakan melalui ejen AI

Skill

Dengan skill ini, Claude Code, Codex, Cursor dan ejen AI lain boleh menjalankan "OCR ke Markdown" bagi pihak anda: /skills/pdf123-ocr.md

Semua skill ejen

Fail hanya digunakan untuk pemprosesan ini dan dipadam secara automatik selepas itu.