मुख्य सामग्री पर जाएँ
PPDF123

PDF की सारणियाँ Excel में बदलें

PDF से Excel टूल PDF के पाठ में संरेखित सारणी पंक्तियाँ खोजकर हर सारणी को .xlsx वर्कबुक की अलग शीट में लिखता है। इसे पाठ परत चाहिए, और गद्य या स्कैन किए पृष्ठों पर कुछ नहीं लौटता।

फ़ाइलें यहाँ खींचकर छोड़ें, या क्लिक कर चुनें

PDF स्वीकार्य · हर फ़ाइल अधिकतम 500.0 MB · एक बार में अधिकतम 20 फ़ाइलें

आप Ctrl/Cmd+V से या क्लिपबोर्ड मेन्यू से फ़ाइल चिपका भी सकते हैं।

PDF से Excel `pdftotext -layout` चलाता है, लगातार दो या अधिक स्पेस वाली पंक्तियाँ ढूँढता है, और उन्हें `.xlsx` वर्कबुक में लिखता है। हर मिली तालिका `Page N` या `Page N Table M` नाम की शीट बनती है। उन इलेक्ट्रॉनिक PDF के लिए ठीक है जहाँ स्तंभ निकाले पाठ में पहले से संरेखित हों।

एक तालिका के लिए कम से कम लगातार दो पंक्तियाँ तालिका जैसी चाहिए। गद्य, अकेली हेडर पंक्ति, या बिना पाठ परत के स्कैन `no_content` देते हैं: कोई वर्कबुक नहीं। खाली परिणाम जानबूझकर है, चुप विफलता नहीं।

यह उपकरण अनुरोध पैरामीटर नज़रअंदाज़ करता है। इस पृष्ठ पर पृष्ठ-सीमा फ़ील्ड नहीं। स्तंभ लगातार दो या अधिक स्पेस से काटे जाते हैं; सेल के अंदर एक स्पेस सेल में रहता है।

यह OCR नहीं है। शुद्ध छवि स्कैन में `pdftotext` के लिए कुछ नहीं। इस साइट का OCR Markdown लौटाता है; उसे PDF से Excel में नहीं भेज सकते। शब्द केवल पिक्सेल में हों तो यहाँ स्प्रेडशीट नहीं मिलती।

PDF से CSV वही लेआउट अनुमान इस्तेमाल करता है। एक तालिका एक CSV; कई तालिकाएँ CSV का ZIP। Excel उन तालिकाओं को एक ही वर्कबुक की अलग शीटों में रखता है। दोनों PDF से मर्ज सेल, रंगीन हेडर या छिपी शीट नहीं लौटाते।

डाउनलोड Excel या LibreOffice Calc में खोलें, कुछ पंक्तियों पर स्तंभ कटाव जाँचें। बिना दोहरे-स्पेस अंतराल की सघन तालिकाएँ अक्सर एक स्तंभ में गिरती हैं। पासवर्ड-सुरक्षित फ़ाइलें इस पृष्ठ पर पासवर्ड डालते ही आपके लिए खोल दी जाती हैं; API उपयोगकर्ता पहले पासवर्ड हटाएँ चलाएँ।

दो-स्पेस का नियम ही पूरी पहचान प्रक्रिया है, इसलिए वर्कबुक की गुणवत्ता पूरी तरह इस पर निर्भर है कि PDF कैसे टाइपसेट हुई थी। रिपोर्ट जनरेटर से बनी वे तालिकाएँ जो हर सेल को तय चौड़ाई तक भरते हैं, साफ़ निकलती हैं। जिन तालिकाओं में स्तंभों के बीच सिर्फ़ एक स्पेस हो, या जो आनुपातिक फ़ॉन्ट से स्तंभों को लगभग सटा दें, वे तालिका ही नहीं मानी जातीं और शायद कोई वर्कबुक न दें। उपकरण को दोष देने से पहले, PDF में कोई पंक्ति चुनकर जाँचें कि पाठ चुनने योग्य तो है ही।

शीट के नाम स्थिति पर चलते हैं, सामग्री पर नहीं। हर पहचाना गया ब्लॉक पृष्ठों के स्कैन क्रम में `Page N` या `Page N Table M` बनता है। हर पृष्ठ पर एक तालिका वाली रिपोर्ट से प्रति पृष्ठ एक शीट बनती है; तीन तालिकाएँ रखे पृष्ठ से तीन क्रमांकित शीट। हेडर सेल के नाम पर शीट रखने का विकल्प नहीं है, और न ही एक ही शीट में सब जोड़ने वाला आउटपुट।

सभी मान पाठ के रूप में लिखे जाते हैं, ठीक वैसे ही जैसे लेआउट सुरक्षित निष्कर्षण में दिखे। संख्याएँ संख्यात्मक सेल में नहीं बदलीं, इसलिए अग्रणी शून्य बचे रहते हैं और मुद्रा चिह्न व हज़ार विभाजक स्ट्रिंग में ही रहते हैं। खाता संख्याओं और पिन कोड के लिए यही चाहिए होता है, और जोड़ने वाले राशि-स्तंभ के लिए थोड़ा झंझट। या तो स्प्रेडशीट में प्रकार बदलें, या स्तंभ कॉपी करके लक्ष्य सॉफ़्टवेयर की टेक्स्ट-टू-कॉलम या मान रूपांतरण सुविधा इस्तेमाल करें।

पंक्तियों को डुप्लिकेट-मुक्त नहीं किया जाता और दोहराए हेडर नहीं हटाए जाते। तालिका जब पृष्ठ सीमा पर टूटती है, हेडर पंक्ति अक्सर अगले पृष्ठ पर दोहराती है और शेष भाग अपनी अलग शीट बन जाता है। मर्ज किए सेल नहीं बनाए जाते; PDF में दो स्तंभों तक फैला सेल अपना पाठ सिर्फ़ सबसे बाएँ स्तंभ में रखता है और दायाँ स्तंभ खाली रहता है। बहु-पंक्ति सेल एक लिपटे मान के बजाय अलग पंक्तियाँ बनते हैं।

अपलोड अस्थायी हैं। हम आपकी वर्कबुक लाइब्रेरी नहीं रखते।

सुविधाएँ

  • `pdftotext -layout` और दोहरे-स्पेस स्तंभ अनुमान
  • हर मिली तालिका एक शीट; खाली पता लगे तो कोई फ़ाइल नहीं
  • OCR नहीं; OCR का Markdown यहाँ नहीं भेजा जा सकता
  • पाठ-प्रकार के सेल; कोई प्रकार अनुमान या मर्ज सेल पुनर्निर्माण नहीं
  • अनाम API: /api/v1/convert/pdf/xlsx

यह उपकरण कब इस्तेमाल करें

  • निकाली तालिकाएँ सीधे Excel या LibreOffice Calc में खोलना
  • इलेक्ट्रॉनिक इनवॉइस तालिका वर्कबुक में खींचना
  • कई पृष्ठों की तालिकाएँ अलग शीट, एक CSV नहीं
  • आगे विश्लेषण के लिए फ़िक्स्ड-विड्थ वित्तीय विवरण निकालना

PDF की सारणी Excel में कैसे बदलें?

  1. चयनयोग्य पाठ और तालिका-जैसी स्तंभ वाली PDF अपलोड करें।
  2. प्रसंस्करण शुरू करें। इस उपकरण में पृष्ठ-सीमा या OCR विकल्प नहीं।
  3. तालिका मिले तो `.xlsx` डाउनलोड करें। न मिले तो खाली सफलता मिलती है; पाठ परत वाला स्रोत आज़माएँ।
  4. वर्कबुक खोलकर कटाव जाँचें। शुद्ध गद्य PDF शीट नहीं बनाती।

सीमाएँ और अपवाद

  • चयनयोग्य पाठ और दोहरे-स्पेस स्तंभ अंतराल चाहिए
  • OCR नहीं, पृष्ठ-सीमा नियंत्रण भी नहीं
  • मर्ज सेल और स्टाइल नहीं बनाए जाते
  • सभी मान पाठ हैं; कोई संख्या या दिनांक प्रकार नहीं
  • पृष्ठों तक फैली तालिकाएँ अलग शीट बनती हैं
  • इस वेबसाइट पर अपलोड सीमा: प्रति फ़ाइल 500 MB, लगभग 95 MB से ऊपर की फ़ाइलें टुकड़ों में भेजी जाती हैं। सीधे एक API अनुरोध का बॉडी अधिकतम 100 MB का हो सकता है।

उदाहरण

  • तीन-स्तंभ मूल्य सूची वाली पाठ PDF अक्सर उन स्तंभों की एक शीट बनती है
  • बिना पाठ परत के स्कैन बैंक स्टेटमेंट वर्कबुक नहीं लौटाता
  • हर पृष्ठ पर एक तालिका वाली दस-पृष्ठीय रिपोर्ट Page 1 से Page 10 तक दस शीट देती है

इस उपकरण की गोपनीयता

फ़ाइलें HTTPS पर अपलोड होती हैं, सर्वर की मेमोरी या अल्पकालिक अस्थायी निर्देशिका में संसाधित होती हैं, और परिणाम तैयार होते ही हटा दी जाती हैं। हम बाद में देखने, मॉडल प्रशिक्षण या विज्ञापन प्रोफ़ाइल के लिए प्रतियाँ नहीं रखते। प्रतिधारण अवधि और AdSense कुकी विवरण गोपनीयता नीति में हैं।

अक्सर पूछे सवाल

स्प्रेडशीट क्यों नहीं मिली?
लगातार दो या अधिक तालिका पंक्तियों का कोई ब्लॉक नहीं मिला। स्कैन, गद्य, और बिना दोहरे-स्पेस अंतराल की तालिकाएँ इस अनुमान को विफल करती हैं।
पहले OCR करके फिर Excel में बदल सकते हैं?
नहीं। OCR Markdown लौटाता है। यह उपकरण केवल pdftotext से PDF पढ़ता है।
PDF से CSV से क्या अंतर?
पहचान एक जैसी। Excel हर तालिका को एक ही वर्कबुक की अलग शीट में लिखता है। CSV प्रति तालिका एक फ़ाइल (एक तो एक CSV, कई तो ZIP)।
हर पृष्ठ पढ़ता है?
हाँ। pdftotext फ़ॉर्म फ़ीड से पृष्ठ बाँटता है। हर पृष्ठ पर तालिका ब्लॉक स्कैन होते हैं। पृष्ठ-सीमा पैरामीटर नहीं।
मेरे अंक पाठ में क्यों सहेजे जाते हैं?
मान ठीक वैसे लिखे जाते हैं जैसे निकाले गए, इसलिए अग्रणी शून्य और फ़ॉर्मैटिंग बचे रहते हैं। गणना करनी हो तो स्प्रेडशीट में स्तंभ को संख्यात्मक में बदलें।
मर्ज किए सेल फिर से बनते हैं?
नहीं। मर्ज सेल का पाठ सबसे बाएँ स्तंभ में जाता है और बाकी स्तंभ खाली रहते हैं। बहु-पंक्ति सेल एक लिपटे मान के बजाय अलग पंक्तियाँ बनते हैं।
एक तालिका के लिए कई शीट क्यों मिलीं?
नए पृष्ठ पर जारी रहने वाली तालिका वहाँ फिर पहचानी जाती है और एक और शीट बन जाती है। हेडर पंक्तियाँ अक्सर दोहराती हैं; उपकरण टुकड़ों को जोड़ता नहीं।

आख़िरी अपडेट:

कोड से कॉल करें

यहाँ हर उपकरण एक सादा REST एंडपॉइंट है। गुमनाम इस्तेमाल के लिए खाता या API कुंजी नहीं चाहिए। ब्राउज़र, डेवलपर और AI एजेंट, तीनों के लिए।

curl -X POST "https://pdf123.xyz/api/v1/convert/pdf/xlsx" \
  -F "[email protected]" \
  -o output.pdf

Model Context Protocol बोलने वाले एजेंट क्लाइंट के लिए MCP उपकरण भी है (JSON-RPC 2.0, POST /mcp)। पूरा API संदर्भ

AI एजेंट से इस्तेमाल करें

स्किल

इस स्किल से Claude Code, Codex, Cursor और दूसरे AI एजेंट आपके लिए “PDF से Excel” चला सकते हैं: /skills/pdf123-pdf-to-xlsx.md

सभी एजेंट स्किल

फ़ाइलें केवल इस काम के लिए इस्तेमाल होती हैं, फिर अपने आप मिट जाती हैं।