Ubah PDF Menjadi HTML
PDF ke HTML mengonversi PDF dengan pdftohtml milik Poppler dan mengirim ZIP berisi halaman HTML beserta gambarnya. Hasilnya dump tata letak, bukan markup web yang bersih, dan tidak ada OCR.
Seret file ke sini, atau klik untuk memilih
Menerima PDF · maksimal 500.0 MB per file · hingga 20 file sekaligus
Anda juga dapat menempelkan file dengan Ctrl/Cmd+V atau dari menu papan klip.
PDF ke HTML menjalankan Poppler `pdftohtml -c` dan mengemas isi yang ditulis alat itu ke direktori keluaran menjadi ZIP. Nama unduhan `{base}ToHtml.zip`, bukan satu `.html`. Targetnya bukan CSS kelas browser, melainkan ekspor HTML dan gambar Poppler.
Halaman ini tanpa bidang formulir. Setiap halaman dikonversi. Jika `pdftohtml` tidak menulis apa pun, API mengembalikan error internal, bukan ZIP kosong.
Ini bukan OCR. Pindaian hanya-gambar menjadi gambar di dalam paket HTML, bukan teks yang bisa dipilih. Berkas yang dilindungi kata sandi dibuka untuk Anda di halaman ini setelah Anda memasukkan kata sandinya; pengguna API harus menjalankan Hapus kata sandi lebih dulu.
Jika hanya butuh teks, pakai PDF ke RTF (teks). Jika butuh artikel cocok CMS, pakai PDF ke Markdown.
Unggahan bersifat sementara. Kami tidak menyimpan pustaka HTML Anda.
Fitur
- Poppler `pdftohtml -c`, ZIP HTML plus aset
- Tanpa rentang halaman atau opsi tema
- Bukan OCR; pindaian tetap gambar di paket
- API anonim: /api/v1/convert/pdf/html
Kapan memakai alat ini
- Mendapatkan HTML kasar dari PDF berlapisan teks
- Mengambil gambar halaman yang diekstrak pdftohtml
- Melihat bagaimana Poppler memahami berkas sebelum pipeline sendiri
Bagaimana cara mengubah PDF menjadi HTML?
- Unggah PDF. Halaman ini tanpa opsi konversi.
- Klik proses, unduh `{name}ToHtml.zip`.
- Ekstrak dan buka HTML di browser.
- Periksa gambar dan teks. Pindaian tidak menjadi teks HTML sungguhan.
Batasan dan kasus khusus
- Keluaran ZIP, bukan satu HTML
- Bukan cetak Chromium dan bukan ekspor HTML tagged-PDF
- Keluaran pdftohtml kosong adalah error, bukan 204
- Batas unggah di situs ini: 500 MB per berkas, dikirim bertahap (per potongan) di atas sekitar 95 MB. Satu permintaan API langsung dibatasi 100 MB.
Contoh
- Memo teks sederhana sering mengekstrak satu HTML plus beberapa gambar
- PDF pindaian murni menghasilkan HTML yang sebagian besar membungkus gambar halaman
Privasi alat ini
File diunggah lewat HTTPS, diproses di memori atau direktori sementara singkat di server kami, lalu dihapus saat hasil siap. Kami tidak menyimpan salinan untuk ditelusuri nanti, pelatihan, atau profil iklan. Lihat Kebijakan Privasi untuk retensi dan pengungkapan cookie AdSense.
Pertanyaan umum
- Mengapa hasilnya ZIP?
- pdftohtml menulis HTML plus gambar yang diekstrak ke sebuah folder. Server mengemas folder itu.
- Apakah HTML cocok dengan tata letak PDF?
- Hanya sejauh mode Poppler -c. Majalah banyak kolom dan banyak vektor sering tidak sejajar.
- Bisakah mengubah pindaian menjadi teks HTML?
- Tidak. Jalur ini tanpa OCR. Butuh teks → OCR ke Markdown.
- Apakah dikonversi di browser?
- Tidak. Server memanggil pdftohtml.
Terakhir diperbarui:
Panggil dari kode
Setiap alat di situs ini adalah antarmuka REST biasa. Pemakaian anonim tidak butuh akun atau kunci API. Bisa dipakai dari browser, oleh pengembang, maupun agen AI.
curl -X POST "https://pdf123.xyz/api/v1/convert/pdf/html" \
-F "[email protected]" \
-o output.pdfJuga tersedia sebagai alat MCP untuk klien agen yang memakai Model Context Protocol (JSON-RPC 2.0 lewat POST /mcp). Referensi API lengkap
Gunakan dari agen AI
SkillDengan skill ini, Claude Code, Codex, Cursor, dan agen AI lainnya bisa menjalankan "PDF ke HTML" untuk Anda: /skills/pdf123-pdf-to-html.md
File hanya dipakai untuk pemrosesan ini, lalu dihapus otomatis.