मुख्य सामग्री पर जाएँ
PPDF123

PDF को HTML में बदलें

PDF से HTML टूल Poppler के pdftohtml से PDF बदलकर HTML पृष्ठों और उनकी छवियों वाली ZIP देता है। यह लेआउट डंप है, साफ़ वेब मार्कअप नहीं, और यह OCR नहीं करता।

फ़ाइलें यहाँ खींचकर छोड़ें, या क्लिक कर चुनें

PDF स्वीकार्य · हर फ़ाइल अधिकतम 500.0 MB · एक बार में अधिकतम 20 फ़ाइलें

आप Ctrl/Cmd+V से या क्लिपबोर्ड मेन्यू से फ़ाइल चिपका भी सकते हैं।

PDF से HTML Poppler `pdftohtml -c` चलाता है, और उस उपकरण द्वारा आउटपुट निर्देशिका में लिखी सामग्री को ZIP में बाँधता है। डाउनलोड नाम `{base}ToHtml.zip` है, अकेला `.html` नहीं। लक्ष्य ब्राउज़र-स्तरीय CSS नहीं, Poppler का HTML और छवि निर्यात है।

इस पृष्ठ पर फ़ॉर्म फ़ील्ड नहीं। हर पृष्ठ बदलता है। यदि `pdftohtml` कुछ न लिखे, तो उत्तर आंतरिक त्रुटि है, खाली ZIP नहीं।

यह OCR नहीं है। शुद्ध छवि स्कैन HTML पैक में छवियाँ बनते हैं, चयनयोग्य पाठ नहीं। पासवर्ड-सुरक्षित फ़ाइलें इस पृष्ठ पर पासवर्ड डालते ही आपके लिए खोल दी जाती हैं; API उपयोगकर्ता पहले पासवर्ड हटाएँ चलाएँ।

केवल पाठ चाहिए तो PDF से RTF (पाठ)। CMS-योग्य लेख चाहिए तो PDF से Markdown।

अपलोड अस्थायी हैं। हम आपकी HTML लाइब्रेरी नहीं रखते।

सुविधाएँ

  • Poppler `pdftohtml -c`, HTML और संसाधनों का ZIP
  • पृष्ठ-सीमा या थीम विकल्प नहीं
  • OCR नहीं; स्कैन पैक में छवि ही रहते हैं
  • अनाम API: /api/v1/convert/pdf/html

यह उपकरण कब इस्तेमाल करें

  • पाठ परत वाली PDF से मोटा HTML
  • pdftohtml द्वारा निकाली पृष्ठ छवियाँ लेना
  • अपनी पाइपलाइन से पहले देखना कि Poppler फ़ाइल कैसे समझता है

PDF को HTML में कैसे बदलें?

  1. PDF अपलोड करें। इस पृष्ठ पर रूपांतरण विकल्प नहीं।
  2. प्रसंस्करण शुरू करें, `{name}ToHtml.zip` डाउनलोड करें।
  3. अनज़िप कर ब्राउज़र में HTML खोलें।
  4. छवियाँ और पाठ जाँचें। स्कैन असली HTML पाठ नहीं बनते।

सीमाएँ और अपवाद

  • आउटपुट ZIP है, अकेला HTML नहीं
  • Chromium प्रिंट नहीं, tagged-PDF HTML निर्यात भी नहीं
  • pdftohtml खाली आउटपुट त्रुटि है, 204 नहीं
  • इस वेबसाइट पर अपलोड सीमा: प्रति फ़ाइल 500 MB, लगभग 95 MB से ऊपर की फ़ाइलें टुकड़ों में भेजी जाती हैं। सीधे एक API अनुरोध का बॉडी अधिकतम 100 MB का हो सकता है।

उदाहरण

  • सादा पाठ मेमो अक्सर एक HTML और कुछ छवियाँ अनज़िप करता है
  • शुद्ध स्कैन PDF का HTML प्रायः उन पृष्ठ छवियों को पैक करता है

इस उपकरण की गोपनीयता

फ़ाइलें HTTPS पर अपलोड होती हैं, सर्वर की मेमोरी या अल्पकालिक अस्थायी निर्देशिका में संसाधित होती हैं, और परिणाम तैयार होते ही हटा दी जाती हैं। हम बाद में देखने, मॉडल प्रशिक्षण या विज्ञापन प्रोफ़ाइल के लिए प्रतियाँ नहीं रखते। प्रतिधारण अवधि और AdSense कुकी विवरण गोपनीयता नीति में हैं।

अक्सर पूछे सवाल

परिणाम ZIP क्यों है?
pdftohtml HTML और निकाली छवियाँ एक फ़ोल्डर में लिखता है। सर्वर उस फ़ोल्डर को पैक करता है।
HTML PDF लेआउट से मेल खाएगा?
केवल Poppler `-c` मोड जितना। बहु-स्तंभ पत्रिकाएँ और बहुत वेक्टर अक्सर मेल नहीं खाते।
स्कैन को HTML पाठ बना सकते हैं?
नहीं। इस पथ पर OCR नहीं। पाठ चाहिए तो OCR से Markdown।
क्या ब्राउज़र में रूपांतरण होता है?
नहीं। सर्वर pdftohtml बुलाता है।

आख़िरी अपडेट:

कोड से कॉल करें

यहाँ हर उपकरण एक सादा REST एंडपॉइंट है। गुमनाम इस्तेमाल के लिए खाता या API कुंजी नहीं चाहिए। ब्राउज़र, डेवलपर और AI एजेंट, तीनों के लिए।

curl -X POST "https://pdf123.xyz/api/v1/convert/pdf/html" \
  -F "[email protected]" \
  -o output.pdf

Model Context Protocol बोलने वाले एजेंट क्लाइंट के लिए MCP उपकरण भी है (JSON-RPC 2.0, POST /mcp)। पूरा API संदर्भ

AI एजेंट से इस्तेमाल करें

स्किल

इस स्किल से Claude Code, Codex, Cursor और दूसरे AI एजेंट आपके लिए “PDF से HTML” चला सकते हैं: /skills/pdf123-pdf-to-html.md

सभी एजेंट स्किल

फ़ाइलें केवल इस काम के लिए इस्तेमाल होती हैं, फिर अपने आप मिट जाती हैं।