PDF को XML फ़ाइल बनाएँ
PDF से XML टूल PDF को LibreOffice से आयात करके Office-शैली की XML फ़ाइल लौटाता है। यह पाठ और लेआउट का अनुमानित निर्यात है, PDF की संरचना या टैग की प्रति नहीं।
फ़ाइलें यहाँ खींचकर छोड़ें, या क्लिक कर चुनें
PDF स्वीकार्य · हर फ़ाइल अधिकतम 500.0 MB · एक बार में अधिकतम 20 फ़ाइलें
आप Ctrl/Cmd+V से या क्लिपबोर्ड मेन्यू से फ़ाइल चिपका भी सकते हैं।
PDF से XML फ़ाइल को LibreOffice `writer_pdf_import` में भेजता है, `outputFormat=xml`। डाउनलोड Office-शैली XML (`octet-stream`) है, न कि PDF सामग्री धारा या tagged-PDF संरचना का पुनर्निर्माण।
यह PDF से Word वाली उसी LibreOffice आयात परिवार का है, केवल लक्ष्य XML है। लेआउट, तालिकाएँ और फ़ॉन्ट सीमित पुनर्निर्माण हैं। बिना पाठ परत के स्कैन छवि या खाली पैराग्राफ़ बनते हैं।
इस पृष्ठ पर विकल्प नहीं। पासवर्ड-सुरक्षित फ़ाइलें इस पृष्ठ पर पासवर्ड डालते ही आपके लिए खोल दी जाती हैं; API उपयोगकर्ता पहले पासवर्ड हटाएँ चलाएँ। OCR का Markdown यहाँ नहीं भेजा जा सकता।
तालिकाओं से पंक्तियाँ चाहिए तो PDF से CSV। केवल शब्द चाहिए तो PDF से RTF (पाठ)।
अपलोड अस्थायी हैं। हम आपकी XML लाइब्रेरी नहीं रखते।
सुविधाएँ
- LibreOffice `writer_pdf_import` से XML
- PDF संरचना निर्यात नहीं, OCR भी नहीं
- पृष्ठ-सीमा या schema विकल्प नहीं
- अनाम API: /api/v1/convert/pdf/xml
यह उपकरण कब इस्तेमाल करें
- इलेक्ट्रॉनिक PDF को Office XML लेने वाली पाइपलाइन में देना
- देखना कि LibreOffice दस्तावेज़ कैसे काटता है
- अगला कदम DOCX न हो तो XML मसौदा
PDF को XML में कैसे बदलें?
- पाठ वाली PDF अपलोड करें।
- प्रसंस्करण शुरू करें। इस पृष्ठ पर प्रारूप विकल्प नहीं।
- `.xml` डाउनलोड करें।
- LibreOffice या संपादक में खोलें; इसे मसौदा मानें।
सीमाएँ और अपवाद
- tagged-PDF नहीं, XFDF/XFA निष्कर्षण भी नहीं
- OCR नहीं
- तालिकाएँ और पृष्ठ विभाजन PDF से मेल नहीं खाते
- इस वेबसाइट पर अपलोड सीमा: प्रति फ़ाइल 500 MB, लगभग 95 MB से ऊपर की फ़ाइलें टुकड़ों में भेजी जाती हैं। सीधे एक API अनुरोध का बॉडी अधिकतम 100 MB का हो सकता है।
उदाहरण
- पाठ मेमो अक्सर पैराग्राफ़ runs वाला बड़ा Office XML बनता है
- शुद्ध स्कैन PDF अक्सर मुख्यतः छवियों वाला XML बनता है
इस उपकरण की गोपनीयता
फ़ाइलें HTTPS पर अपलोड होती हैं, सर्वर की मेमोरी या अल्पकालिक अस्थायी निर्देशिका में संसाधित होती हैं, और परिणाम तैयार होते ही हटा दी जाती हैं। हम बाद में देखने, मॉडल प्रशिक्षण या विज्ञापन प्रोफ़ाइल के लिए प्रतियाँ नहीं रखते। प्रतिधारण अवधि और AdSense कुकी विवरण गोपनीयता नीति में हैं।
अक्सर पूछे सवाल
- क्या यह PDF का आंतरिक XML है?
- नहीं। यह LibreOffice आयातित दस्तावेज़ को XML में निर्यात करता है, PDF ऑब्जेक्ट वृक्ष नहीं।
- स्कैन लगभग खाली क्यों?
- LibreOffice के पास आयात करने को पाठ नहीं। पिक्सेल में शब्द हों तो OCR से Markdown।
- दूसरी XML बोली चुन सकते हैं?
- नहीं। यह पथ outputFormat को xml पर स्थिर रखता है; केवल यही मान अनुमत है।
- PDF से Word से क्या अंतर?
- आयातक एक जैसा, आउटपुट अलग। PDF से Word docx, doc या odt देता है। यह पथ xml देता है।
आख़िरी अपडेट:
कोड से कॉल करें
यहाँ हर उपकरण एक सादा REST एंडपॉइंट है। गुमनाम इस्तेमाल के लिए खाता या API कुंजी नहीं चाहिए। ब्राउज़र, डेवलपर और AI एजेंट, तीनों के लिए।
curl -X POST "https://pdf123.xyz/api/v1/convert/pdf/xml" \
-F "[email protected]" \
-o output.pdfModel Context Protocol बोलने वाले एजेंट क्लाइंट के लिए MCP उपकरण भी है (JSON-RPC 2.0, POST /mcp)। पूरा API संदर्भ
AI एजेंट से इस्तेमाल करें
स्किलइस स्किल से Claude Code, Codex, Cursor और दूसरे AI एजेंट आपके लिए “PDF से XML” चला सकते हैं: /skills/pdf123-pdf-to-xml.md
फ़ाइलें केवल इस काम के लिए इस्तेमाल होती हैं, फिर अपने आप मिट जाती हैं।