Lewati ke konten utama
PPDF123

OCR PDF Pindaian ke Markdown

OCR ke Markdown membaca PDF hasil pindai atau berbasis gambar lalu mengembalikan teksnya sebagai berkas Markdown. Alat ini tidak menambahkan lapisan teks ke PDF, dan berkas asli tidak berubah.

Seret file ke sini, atau klik untuk memilih

Menerima PDF · maksimal 500.0 MB per file · hingga 20 file sekaligus

Anda juga dapat menempelkan file dengan Ctrl/Cmd+V atau dari menu papan klip.

OCR ke Markdown membaca PDF pindaian atau hanya-gambar dan mengembalikan Markdown (`text/markdown`, nama berkas `.md`). Alat ini tidak menulis lapisan teks tersembunyi kembali ke PDF, dan tidak membersihkan, meluruskan, atau menulis ulang pindaian.

Server menggabungkan teks asli yang sudah ada di PDF dengan hasil pengenalan optik pada halaman gambar. Force OCR (`ocrType=force-ocr`, bawaan situs) mengenali ulang setiap halaman. Normal (apa pun selain `force-ocr`) memakai teks asli bila ada, dan hanya OCR pada halaman murni gambar. Pada PDF elektronik yang bersih, Auto tidak memuat runtime OCR.

Akurasi bergantung pada kualitas pindaian, kontras, dan kemiringan. Mesin saat ini tidak punya parameter bahasa. Jika klien masih mengirim bidang lama Java OCRmyPDF (`languages`, `deskew`, `clean`, `sidecar`), bidang itu diabaikan.

Ini bukan langkah awal untuk PDF ke Word atau PDF ke RTF (teks). Alat-alat itu tetap butuh teks yang sudah ada di dalam PDF. OCR di sini adalah ekstraksi paralel: Anda mendapat Markdown; PDF asli tidak berubah.

Jangan OCR berkas yang tidak berhak Anda digitalkan atau sebar ulang. Teks yang diekstrak tetap tunduk pada hak cipta dan aturan tempat kerja.

Siapa yang menginginkan PDF yang dapat dicari tidak mendapatkannya di sini. Hasil yang dapat dicari adalah berkas Markdown. Buka di editor dan spot-check nama serta angka yang harus akurat.

Foto ponsel sebaiknya dipotong dan diluruskan dulu sebelum diunggah. Halaman yang miring membuang pengenalan ke latar. OCR bukan terjemahan: ia mengenali karakter, tidak menulis ulang dokumen ke bahasa lain.

Tugas berjalan di server. Unduh tepat waktu. Kami tidak menjadikan berkas Anda pustaka OCR. Berkas yang dilindungi kata sandi dibuka untuk Anda di halaman ini setelah Anda memasukkan kata sandinya; pengguna API harus menjalankan Hapus kata sandi lebih dulu.

Fitur

  • Mengembalikan Markdown, bukan PDF berlapisan OCR
  • Force OCR membaca ulang setiap halaman; Normal/Auto memakai teks asli bila ada
  • PDF asli tidak berubah
  • API anonim: /api/v1/misc/ocr-pdf

Kapan memakai alat ini

  • Mengubah pindaian kontrak menjadi Markdown untuk diedit
  • Mengekstrak teks dari foto dokumen untuk pencarian
  • Mendapatkan teks dari PDF hanya-gambar tanpa menulis ulang PDF

Bagaimana cara melakukan OCR pada PDF hasil pindai?

  1. Unggah PDF pindaian atau foto ponsel.
  2. Pilih Force OCR (bawaan) atau Normal/Auto.
  3. Klik proses, unduh berkas `.md`.
  4. Di Markdown, spot-check nama dan angka sebelum dipakai.

Batasan dan kasus khusus

  • Tidak menulis lapisan teks kembali ke PDF
  • Tidak ada parameter bahasa; bidang OCRmyPDF lama diabaikan
  • Akurasi bergantung pada kualitas pindaian
  • Berkas yang dilindungi kata sandi memerlukan kata sandinya; pengguna API harus menjalankan Hapus kata sandi lebih dulu
  • Batas unggah di situs ini: 500 MB per berkas, dikirim bertahap (per potongan) di atas sekitar 95 MB. Satu permintaan API langsung dibatasi 100 MB.

Contoh

  • Force OCR pada pindaian 3 halaman menghasilkan satu `.md` dengan teks dari ketiga halaman
  • Normal pada PDF elektronik bersih biasanya memakai teks asli tanpa memuat OCR

Privasi alat ini

File diunggah lewat HTTPS, diproses di memori atau direktori sementara singkat di server kami, lalu dihapus saat hasil siap. Kami tidak menyimpan salinan untuk ditelusuri nanti, pelatihan, atau profil iklan. Lihat Kebijakan Privasi untuk retensi dan pengungkapan cookie AdSense.

Pertanyaan umum

Apakah OCR mengubah tampilan halaman?
Tidak mengembalikan PDF. Berkas asli tetap; Anda mendapat unduhan Markdown terpisah.
Apakah ini pustaka OCR yang bisa disematkan?
Bukan. Ini tugas HTTP di /api/v1/misc/ocr-pdf. Lihat /developers. Bukan SDK yang bisa di-link.
Setelah OCR, bisakah dilanjutkan ke Word?
Tidak sebagai pipeline PDF. OCR mengembalikan Markdown. PDF ke Word tetap butuh PDF berlapisan teks.
Bahasa apa yang didukung?
Tidak ada pemilih bahasa di mesin saat ini. Bidang languages lama diabaikan.

Terakhir diperbarui:

Panggil dari kode

Setiap alat di situs ini adalah antarmuka REST biasa. Pemakaian anonim tidak butuh akun atau kunci API. Bisa dipakai dari browser, oleh pengembang, maupun agen AI.

curl -X POST "https://pdf123.xyz/api/v1/misc/ocr-pdf" \
  -F "[email protected]" \
  -F "ocrType=force-ocr" \
  -o output.pdf

Juga tersedia sebagai alat MCP untuk klien agen yang memakai Model Context Protocol (JSON-RPC 2.0 lewat POST /mcp). Referensi API lengkap

Gunakan dari agen AI

Skill

Dengan skill ini, Claude Code, Codex, Cursor, dan agen AI lainnya bisa menjalankan "OCR ke Markdown" untuk Anda: /skills/pdf123-ocr.md

Semua skill agen

File hanya dipakai untuk pemrosesan ini, lalu dihapus otomatis.