मुख्य सामग्री पर जाएँ
PPDF123

PDF की सारणी CSV फ़ाइल में निकालें

PDF से CSV टूल PDF के पाठ में संरेखित सारणी पंक्तियाँ खोजकर हर पहचानी सारणी को CSV फ़ाइल में लिखता है; कई सारणियाँ ZIP में आती हैं। इसे पाठ परत चाहिए और सादे गद्य या स्कैन पर कुछ नहीं लौटता।

फ़ाइलें यहाँ खींचकर छोड़ें, या क्लिक कर चुनें

PDF स्वीकार्य · हर फ़ाइल अधिकतम 500.0 MB · एक बार में अधिकतम 20 फ़ाइलें

आप Ctrl/Cmd+V से या क्लिपबोर्ड मेन्यू से फ़ाइल चिपका भी सकते हैं।

PDF से CSV `pdftotext -layout` चलाता है, लगातार दो या अधिक स्पेस वाली पंक्तियाँ ढूँढता है, और उन्हें CSV में लिखता है। हर मिली तालिका `{base}_pN_tM.csv` नाम की फ़ाइल बनती है। उन इलेक्ट्रॉनिक PDF के लिए ठीक है जहाँ स्तंभ निकाले पाठ में पहले से संरेखित हों।

एक तालिका के लिए कम से कम लगातार दो पंक्तियाँ तालिका जैसी चाहिए। गद्य, अकेली हेडर पंक्ति, या बिना पाठ परत के स्कैन `no_content` देते हैं: HTTP 204, कोई फ़ाइल नहीं। खाली परिणाम जानबूझकर है, चुप विफलता नहीं।

यह उपकरण अनुरोध पैरामीटर नज़रअंदाज़ करता है। इस पृष्ठ की पृष्ठ-सीमा फ़ील्ड नहीं पढ़ी जाती; हर पृष्ठ स्कैन होता है। एक तालिका एक `text/csv`; कई तालिकाएँ `{base}_extracted.zip` नाम के ZIP में। स्तंभ लगातार दो या अधिक स्पेस से काटे जाते हैं; सेल के अंदर एक स्पेस सेल में रहता है। फ़ील्ड RFC 4180 के अनुसार उद्धृत होते हैं।

यह OCR नहीं है। शुद्ध छवि स्कैन में `pdftotext` के लिए कुछ नहीं। इस साइट का OCR Markdown लौटाता है; उसे PDF से CSV में नहीं भेज सकते। शब्द केवल पिक्सेल में हों तो यहाँ तालिका फ़ाइल नहीं मिलती।

PDF से Excel वही लेआउट अनुमान इस्तेमाल करता है। Excel उन तालिकाओं को एक ही वर्कबुक की अलग शीटों में रखता है। CSV प्रति तालिका एक फ़ाइल। दोनों PDF से मर्ज किए सेल, रंगीन हेडर या छिपी शीट नहीं लौटाते।

डाउनलोड Excel या LibreOffice Calc में खोलें, कुछ पंक्तियों पर स्तंभ कटाव जाँचें। बिना दोहरे-स्पेस अंतराल की सघन तालिकाएँ अक्सर एक स्तंभ में गिरती हैं। पासवर्ड-सुरक्षित फ़ाइलें इस पृष्ठ पर पासवर्ड डालते ही आपके लिए खोल दी जाती हैं; API उपयोगकर्ता पहले पासवर्ड हटाएँ चलाएँ।

अपलोड अस्थायी हैं। हम आपकी CSV लाइब्रेरी नहीं रखते।

सुविधाएँ

  • `pdftotext -layout` और दोहरे-स्पेस स्तंभ अनुमान
  • प्रति तालिका एक CSV; कई हों तो ZIP; खाली पता लगे तो HTTP 204
  • OCR नहीं; OCR का Markdown यहाँ नहीं भेजा जा सकता
  • अनाम API: /api/v1/convert/pdf/csv

यह उपकरण कब इस्तेमाल करें

  • इलेक्ट्रॉनिक इनवॉइस तालिका Excel या LibreOffice Calc में खींचना
  • कई पृष्ठों की तालिकाएँ अलग CSV, एक शीट नहीं
  • केवल CSV लेने वाली स्क्रिप्ट का इनपुट

PDF की सारणी CSV में कैसे निकालें?

  1. चयनयोग्य पाठ और तालिका-जैसी स्तंभ वाली PDF अपलोड करें।
  2. प्रसंस्करण शुरू करें। पृष्ठ-सीमा फ़ील्ड है, पर कनवर्टर नहीं पढ़ता। OCR विकल्प नहीं।
  3. एक तालिका मिले तो `.csv` डाउनलोड। कई हों तो ZIP। कुछ न मिले तो खाली सफलता; पाठ परत वाला स्रोत लाएँ।
  4. Excel या LibreOffice Calc में खोलकर कटाव जाँचें। शुद्ध गद्य PDF फ़ाइल नहीं बनाती।

सीमाएँ और अपवाद

  • चयनयोग्य पाठ और दोहरे-स्पेस स्तंभ अंतराल चाहिए
  • OCR नहीं; पृष्ठ-सीमा नियंत्रण भी लागू नहीं
  • मर्ज सेल और स्टाइल नहीं लौटाता
  • इस वेबसाइट पर अपलोड सीमा: प्रति फ़ाइल 500 MB, लगभग 95 MB से ऊपर की फ़ाइलें टुकड़ों में भेजी जाती हैं। सीधे एक API अनुरोध का बॉडी अधिकतम 100 MB का हो सकता है।

उदाहरण

  • तीन-स्तंभ मूल्य सूची वाली पाठ PDF अक्सर उन स्तंभों की एक CSV बनती है
  • बिना पाठ परत के स्कैन बैंक स्टेटमेंट HTTP 204 देता है

इस उपकरण की गोपनीयता

फ़ाइलें HTTPS पर अपलोड होती हैं, सर्वर की मेमोरी या अल्पकालिक अस्थायी निर्देशिका में संसाधित होती हैं, और परिणाम तैयार होते ही हटा दी जाती हैं। हम बाद में देखने, मॉडल प्रशिक्षण या विज्ञापन प्रोफ़ाइल के लिए प्रतियाँ नहीं रखते। प्रतिधारण अवधि और AdSense कुकी विवरण गोपनीयता नीति में हैं।

अक्सर पूछे सवाल

CSV क्यों नहीं मिला?
लगातार दो या अधिक तालिका पंक्तियाँ नहीं मिलीं। स्कैन, गद्य, और बिना दोहरे-स्पेस अंतराल की तालिकाएँ इस अनुमान को विफल करती हैं। उत्तर 204 `no_content`।
पहले OCR फिर CSV?
नहीं। OCR Markdown लौटाता है। यह उपकरण केवल pdftotext से PDF पढ़ता है।
PDF से Excel से क्या अंतर?
पहचान एक जैसी। CSV प्रति तालिका एक फ़ाइल (एक तो एक CSV, कई तो ZIP)। Excel हर तालिका को एक ही वर्कबुक की अलग शीट में लिखता है।
हर पृष्ठ पढ़ता है?
हाँ। pdftotext फ़ॉर्म फ़ीड से पृष्ठ बाँटता है; हर पृष्ठ पर तालिका ब्लॉक स्कैन होते हैं। इस पृष्ठ की पृष्ठ-सीमा फ़ील्ड नहीं पढ़ी जाती।

आख़िरी अपडेट:

कोड से कॉल करें

यहाँ हर उपकरण एक सादा REST एंडपॉइंट है। गुमनाम इस्तेमाल के लिए खाता या API कुंजी नहीं चाहिए। ब्राउज़र, डेवलपर और AI एजेंट, तीनों के लिए।

curl -X POST "https://pdf123.xyz/api/v1/convert/pdf/csv" \
  -F "[email protected]" \
  -F "pageNumbers=all" \
  -o output.pdf

Model Context Protocol बोलने वाले एजेंट क्लाइंट के लिए MCP उपकरण भी है (JSON-RPC 2.0, POST /mcp)। पूरा API संदर्भ

AI एजेंट से इस्तेमाल करें

स्किल

इस स्किल से Claude Code, Codex, Cursor और दूसरे AI एजेंट आपके लिए “PDF से CSV” चला सकते हैं: /skills/pdf123-pdf-to-csv.md

सभी एजेंट स्किल

फ़ाइलें केवल इस काम के लिए इस्तेमाल होती हैं, फिर अपने आप मिट जाती हैं।