PDF को HTML में बदलें
PDF से HTML टूल Poppler के pdftohtml से PDF बदलकर HTML पृष्ठों और उनकी छवियों वाली ZIP देता है। यह लेआउट डंप है, साफ़ वेब मार्कअप नहीं, और यह OCR नहीं करता।
फ़ाइलें यहाँ खींचकर छोड़ें, या क्लिक कर चुनें
PDF स्वीकार्य · हर फ़ाइल अधिकतम 500.0 MB · एक बार में अधिकतम 20 फ़ाइलें
आप Ctrl/Cmd+V से या क्लिपबोर्ड मेन्यू से फ़ाइल चिपका भी सकते हैं।
PDF से HTML Poppler `pdftohtml -c` चलाता है, और उस उपकरण द्वारा आउटपुट निर्देशिका में लिखी सामग्री को ZIP में बाँधता है। डाउनलोड नाम `{base}ToHtml.zip` है, अकेला `.html` नहीं। लक्ष्य ब्राउज़र-स्तरीय CSS नहीं, Poppler का HTML और छवि निर्यात है।
इस पृष्ठ पर फ़ॉर्म फ़ील्ड नहीं। हर पृष्ठ बदलता है। यदि `pdftohtml` कुछ न लिखे, तो उत्तर आंतरिक त्रुटि है, खाली ZIP नहीं।
यह OCR नहीं है। शुद्ध छवि स्कैन HTML पैक में छवियाँ बनते हैं, चयनयोग्य पाठ नहीं। पासवर्ड-सुरक्षित फ़ाइलें इस पृष्ठ पर पासवर्ड डालते ही आपके लिए खोल दी जाती हैं; API उपयोगकर्ता पहले पासवर्ड हटाएँ चलाएँ।
केवल पाठ चाहिए तो PDF से RTF (पाठ)। CMS-योग्य लेख चाहिए तो PDF से Markdown।
अपलोड अस्थायी हैं। हम आपकी HTML लाइब्रेरी नहीं रखते।
सुविधाएँ
- Poppler `pdftohtml -c`, HTML और संसाधनों का ZIP
- पृष्ठ-सीमा या थीम विकल्प नहीं
- OCR नहीं; स्कैन पैक में छवि ही रहते हैं
- अनाम API: /api/v1/convert/pdf/html
यह उपकरण कब इस्तेमाल करें
- पाठ परत वाली PDF से मोटा HTML
- pdftohtml द्वारा निकाली पृष्ठ छवियाँ लेना
- अपनी पाइपलाइन से पहले देखना कि Poppler फ़ाइल कैसे समझता है
PDF को HTML में कैसे बदलें?
- PDF अपलोड करें। इस पृष्ठ पर रूपांतरण विकल्प नहीं।
- प्रसंस्करण शुरू करें, `{name}ToHtml.zip` डाउनलोड करें।
- अनज़िप कर ब्राउज़र में HTML खोलें।
- छवियाँ और पाठ जाँचें। स्कैन असली HTML पाठ नहीं बनते।
सीमाएँ और अपवाद
- आउटपुट ZIP है, अकेला HTML नहीं
- Chromium प्रिंट नहीं, tagged-PDF HTML निर्यात भी नहीं
- pdftohtml खाली आउटपुट त्रुटि है, 204 नहीं
- इस वेबसाइट पर अपलोड सीमा: प्रति फ़ाइल 500 MB, लगभग 95 MB से ऊपर की फ़ाइलें टुकड़ों में भेजी जाती हैं। सीधे एक API अनुरोध का बॉडी अधिकतम 100 MB का हो सकता है।
उदाहरण
- सादा पाठ मेमो अक्सर एक HTML और कुछ छवियाँ अनज़िप करता है
- शुद्ध स्कैन PDF का HTML प्रायः उन पृष्ठ छवियों को पैक करता है
इस उपकरण की गोपनीयता
फ़ाइलें HTTPS पर अपलोड होती हैं, सर्वर की मेमोरी या अल्पकालिक अस्थायी निर्देशिका में संसाधित होती हैं, और परिणाम तैयार होते ही हटा दी जाती हैं। हम बाद में देखने, मॉडल प्रशिक्षण या विज्ञापन प्रोफ़ाइल के लिए प्रतियाँ नहीं रखते। प्रतिधारण अवधि और AdSense कुकी विवरण गोपनीयता नीति में हैं।
अक्सर पूछे सवाल
- परिणाम ZIP क्यों है?
- pdftohtml HTML और निकाली छवियाँ एक फ़ोल्डर में लिखता है। सर्वर उस फ़ोल्डर को पैक करता है।
- HTML PDF लेआउट से मेल खाएगा?
- केवल Poppler `-c` मोड जितना। बहु-स्तंभ पत्रिकाएँ और बहुत वेक्टर अक्सर मेल नहीं खाते।
- स्कैन को HTML पाठ बना सकते हैं?
- नहीं। इस पथ पर OCR नहीं। पाठ चाहिए तो OCR से Markdown।
- क्या ब्राउज़र में रूपांतरण होता है?
- नहीं। सर्वर pdftohtml बुलाता है।
आख़िरी अपडेट:
कोड से कॉल करें
यहाँ हर उपकरण एक सादा REST एंडपॉइंट है। गुमनाम इस्तेमाल के लिए खाता या API कुंजी नहीं चाहिए। ब्राउज़र, डेवलपर और AI एजेंट, तीनों के लिए।
curl -X POST "https://pdf123.xyz/api/v1/convert/pdf/html" \
-F "[email protected]" \
-o output.pdfModel Context Protocol बोलने वाले एजेंट क्लाइंट के लिए MCP उपकरण भी है (JSON-RPC 2.0, POST /mcp)। पूरा API संदर्भ
AI एजेंट से इस्तेमाल करें
स्किलइस स्किल से Claude Code, Codex, Cursor और दूसरे AI एजेंट आपके लिए “PDF से HTML” चला सकते हैं: /skills/pdf123-pdf-to-html.md
फ़ाइलें केवल इस काम के लिए इस्तेमाल होती हैं, फिर अपने आप मिट जाती हैं।