Lewati ke konten utama
PPDF123

Ubah PDF Menjadi HTML

PDF ke HTML mengonversi PDF dengan pdftohtml milik Poppler dan mengirim ZIP berisi halaman HTML beserta gambarnya. Hasilnya dump tata letak, bukan markup web yang bersih, dan tidak ada OCR.

Seret file ke sini, atau klik untuk memilih

Menerima PDF · maksimal 500.0 MB per file · hingga 20 file sekaligus

Anda juga dapat menempelkan file dengan Ctrl/Cmd+V atau dari menu papan klip.

PDF ke HTML menjalankan Poppler `pdftohtml -c` dan mengemas isi yang ditulis alat itu ke direktori keluaran menjadi ZIP. Nama unduhan `{base}ToHtml.zip`, bukan satu `.html`. Targetnya bukan CSS kelas browser, melainkan ekspor HTML dan gambar Poppler.

Halaman ini tanpa bidang formulir. Setiap halaman dikonversi. Jika `pdftohtml` tidak menulis apa pun, API mengembalikan error internal, bukan ZIP kosong.

Ini bukan OCR. Pindaian hanya-gambar menjadi gambar di dalam paket HTML, bukan teks yang bisa dipilih. Berkas yang dilindungi kata sandi dibuka untuk Anda di halaman ini setelah Anda memasukkan kata sandinya; pengguna API harus menjalankan Hapus kata sandi lebih dulu.

Jika hanya butuh teks, pakai PDF ke RTF (teks). Jika butuh artikel cocok CMS, pakai PDF ke Markdown.

Unggahan bersifat sementara. Kami tidak menyimpan pustaka HTML Anda.

Fitur

  • Poppler `pdftohtml -c`, ZIP HTML plus aset
  • Tanpa rentang halaman atau opsi tema
  • Bukan OCR; pindaian tetap gambar di paket
  • API anonim: /api/v1/convert/pdf/html

Kapan memakai alat ini

  • Mendapatkan HTML kasar dari PDF berlapisan teks
  • Mengambil gambar halaman yang diekstrak pdftohtml
  • Melihat bagaimana Poppler memahami berkas sebelum pipeline sendiri

Bagaimana cara mengubah PDF menjadi HTML?

  1. Unggah PDF. Halaman ini tanpa opsi konversi.
  2. Klik proses, unduh `{name}ToHtml.zip`.
  3. Ekstrak dan buka HTML di browser.
  4. Periksa gambar dan teks. Pindaian tidak menjadi teks HTML sungguhan.

Batasan dan kasus khusus

  • Keluaran ZIP, bukan satu HTML
  • Bukan cetak Chromium dan bukan ekspor HTML tagged-PDF
  • Keluaran pdftohtml kosong adalah error, bukan 204
  • Batas unggah di situs ini: 500 MB per berkas, dikirim bertahap (per potongan) di atas sekitar 95 MB. Satu permintaan API langsung dibatasi 100 MB.

Contoh

  • Memo teks sederhana sering mengekstrak satu HTML plus beberapa gambar
  • PDF pindaian murni menghasilkan HTML yang sebagian besar membungkus gambar halaman

Privasi alat ini

File diunggah lewat HTTPS, diproses di memori atau direktori sementara singkat di server kami, lalu dihapus saat hasil siap. Kami tidak menyimpan salinan untuk ditelusuri nanti, pelatihan, atau profil iklan. Lihat Kebijakan Privasi untuk retensi dan pengungkapan cookie AdSense.

Pertanyaan umum

Mengapa hasilnya ZIP?
pdftohtml menulis HTML plus gambar yang diekstrak ke sebuah folder. Server mengemas folder itu.
Apakah HTML cocok dengan tata letak PDF?
Hanya sejauh mode Poppler -c. Majalah banyak kolom dan banyak vektor sering tidak sejajar.
Bisakah mengubah pindaian menjadi teks HTML?
Tidak. Jalur ini tanpa OCR. Butuh teks → OCR ke Markdown.
Apakah dikonversi di browser?
Tidak. Server memanggil pdftohtml.

Terakhir diperbarui:

Panggil dari kode

Setiap alat di situs ini adalah antarmuka REST biasa. Pemakaian anonim tidak butuh akun atau kunci API. Bisa dipakai dari browser, oleh pengembang, maupun agen AI.

curl -X POST "https://pdf123.xyz/api/v1/convert/pdf/html" \
  -F "[email protected]" \
  -o output.pdf

Juga tersedia sebagai alat MCP untuk klien agen yang memakai Model Context Protocol (JSON-RPC 2.0 lewat POST /mcp). Referensi API lengkap

Gunakan dari agen AI

Skill

Dengan skill ini, Claude Code, Codex, Cursor, dan agen AI lainnya bisa menjalankan "PDF ke HTML" untuk Anda: /skills/pdf123-pdf-to-html.md

Semua skill agen

File hanya dipakai untuk pemrosesan ini, lalu dihapus otomatis.