मुख्य सामग्री पर जाएँ
PPDF123

स्कैन PDF का OCR करके Markdown पाएँ

OCR से Markdown टूल स्कैन या चित्र-आधारित PDF को पढ़कर उसका पाठ Markdown फ़ाइल में लौटाता है। यह PDF में पाठ परत नहीं जोड़ता, और मूल फ़ाइल नहीं बदलती।

फ़ाइलें यहाँ खींचकर छोड़ें, या क्लिक कर चुनें

PDF स्वीकार्य · हर फ़ाइल अधिकतम 500.0 MB · एक बार में अधिकतम 20 फ़ाइलें

आप Ctrl/Cmd+V से या क्लिपबोर्ड मेन्यू से फ़ाइल चिपका भी सकते हैं।

OCR स्कैन या केवल-चित्र PDF पढ़कर Markdown लौटाता है (`text/markdown`, फ़ाइल नाम `.md`)। यह छिपी पाठ परत PDF में वापस नहीं लिखता, और स्कैन साफ़, सीधा या फिर से नहीं बनाता।

सर्वर PDF में पहले से मौजूद मूल पाठ को चित्र-पृष्ठों की ऑप्टिकल पहचान से जोड़ता है। Force OCR (`ocrType=force-ocr`, वेबसाइट डिफ़ॉल्ट) प्रत्येक पृष्ठ फिर से पहचानता है। Normal (`force-ocr` न हो) मूल पाठ होने पर वही प्रयोग करता है और केवल चित्र-पृष्ठों पर OCR चलाता है। साफ़ इलेक्ट्रॉनिक PDF पर Auto OCR रनटाइम नहीं लोड करता।

सटीकता स्कैन गुणवत्ता, कंट्रास्ट और झुकाव पर निर्भर करती है। वर्तमान इंजन में भाषा पैरामीटर नहीं है। क्लाइंट पुराने Java OCRmyPDF फ़ील्ड (`languages`, `deskew`, `clean`, `sidecar`) भेजें तो अनदेखा होते हैं।

यह Word रूपांतरण या PDF से पाठ का पूर्वश्रम नहीं है। वे उपकरण अभी भी PDF के अंदर मौजूद पाठ चाहते हैं। यहाँ OCR समानांतर निष्कर्षण है: आपको Markdown मिलता है, मूल PDF नहीं बदलती।

जिन फ़ाइलों को डिजिटाइज़ या पुनर्वितरित करने का अधिकार नहीं, उन पर OCR न चलाएँ। निकाला पाठ भी कॉपीराइट और कार्यस्थल नियमों के अधीन है।

खोजने योग्य PDF यहाँ नहीं मिलती। खोजने योग्य उत्पाद Markdown फ़ाइल है। संपादक में खोलकर वे नाम और संख्याएँ जाँचें जो सटीक होनी चाहिए।

फ़ोन फ़ोटो पहले काटें और सीधी करें फिर अपलोड करें। ट्रैपेज़ॉइड पृष्ठ पहचान पृष्ठभूमि पर बर्बाद करते हैं। OCR अनुवाद नहीं है: यह वर्ण पहचानता है, दस्तावेज़ दूसरी भाषा में नहीं लिखता।

कार्य सर्वर पर चलता है। समय पर डाउनलोड करें। हम आपकी फ़ाइलों का OCR संग्रह नहीं बनाते। पासवर्ड-सुरक्षित फ़ाइलें इस पृष्ठ पर पासवर्ड डालते ही आपके लिए खोल दी जाती हैं; API उपयोगकर्ता पहले पासवर्ड हटाएँ चलाएँ।

सुविधाएँ

  • Markdown लौटाता है, OCR परत वाली PDF नहीं
  • Force OCR प्रत्येक पृष्ठ फिर पढ़ता है; Normal/Auto मूल पाठ होने पर वही प्रयोग करते हैं
  • मूल PDF अपरिवर्तित
  • अनाम API: /api/v1/misc/ocr-pdf

यह उपकरण कब इस्तेमाल करें

  • अभिलेख स्कैन से खंड पाठ निकालना
  • स्कैन को Markdown चाहने वाले एजेंट या पाइपलाइन को देना
  • पाठ परत रहित केवल-चित्र PDF से शब्द वापस लाना

स्कैन किए PDF का OCR कैसे करें?

  1. स्कैन या फ़ोन से ली गई PDF अपलोड करें।
  2. Force OCR (डिफ़ॉल्ट) या Normal/Auto चुनें।
  3. प्रसंस्करण शुरू करें, `.md` फ़ाइल डाउनलोड करें।
  4. Markdown में नाम और संख्याएँ जाँचने के बाद ही प्रयोग करें।

सीमाएँ और अपवाद

  • सटीकता छवि गुणवत्ता के साथ बदलती है
  • बहुत अधिक पृष्ठों पर अधिक समय लगता है
  • वर्तमान इंजन में भाषा पैरामीटर नहीं
  • स्थानीय OCR लाइब्रेरी या ऑफ़लाइन SDK नहीं
  • इस वेबसाइट पर अपलोड सीमा: प्रति फ़ाइल 500 MB, लगभग 95 MB से ऊपर की फ़ाइलें टुकड़ों में भेजी जाती हैं। सीधे एक API अनुरोध का बॉडी अधिकतम 100 MB का हो सकता है।

उदाहरण

  • 20-पृष्ठ ग्रेस्केल अनुबंध स्कैन खंड पाठ वाली Markdown फ़ाइल बनता है
  • तिरछी फ़ोन फ़ोटो पहले फिर से खींचनी पड़ सकती है तभी OCR उपयोगी हो

इस उपकरण की गोपनीयता

फ़ाइलें HTTPS पर अपलोड होती हैं, सर्वर की मेमोरी या अल्पकालिक अस्थायी निर्देशिका में संसाधित होती हैं, और परिणाम तैयार होते ही हटा दी जाती हैं। हम बाद में देखने, मॉडल प्रशिक्षण या विज्ञापन प्रोफ़ाइल के लिए प्रतियाँ नहीं रखते। प्रतिधारण अवधि और AdSense कुकी विवरण गोपनीयता नीति में हैं।

अक्सर पूछे सवाल

क्या OCR पृष्ठ का रूप बदलता है?
यह PDF नहीं लौटाता। मूल फ़ाइल नहीं बदलती; आपको अलग Markdown डाउनलोड मिलता है।
क्या यह एम्बेड करने योग्य OCR लाइब्रेरी है?
नहीं। यह /api/v1/misc/ocr-pdf पर होस्टेड HTTP कार्य है। /developers देखें। लिंक करने योग्य SDK नहीं है।
OCR के बाद Word में बदला जा सकता है?
PDF पाइपलाइन की तरह नहीं जोड़ा जा सकता। OCR आउटपुट Markdown है। Word रूपांतरण अभी भी पाठ परत वाली PDF चाहता है।
इलेक्ट्रॉनिक PDF पर Force OCR चाहिए?
आमतौर पर नहीं। Normal/Auto मौजूद पाठ प्रयोग करके OCR रनटाइम छोड़ देते हैं। पाठ परत क्षतिग्रस्त या अविश्वसनीय हो तो Force चुनें।

आख़िरी अपडेट:

कोड से कॉल करें

यहाँ हर उपकरण एक सादा REST एंडपॉइंट है। गुमनाम इस्तेमाल के लिए खाता या API कुंजी नहीं चाहिए। ब्राउज़र, डेवलपर और AI एजेंट, तीनों के लिए।

curl -X POST "https://pdf123.xyz/api/v1/misc/ocr-pdf" \
  -F "[email protected]" \
  -F "ocrType=force-ocr" \
  -o output.pdf

Model Context Protocol बोलने वाले एजेंट क्लाइंट के लिए MCP उपकरण भी है (JSON-RPC 2.0, POST /mcp)। पूरा API संदर्भ

AI एजेंट से इस्तेमाल करें

स्किल

इस स्किल से Claude Code, Codex, Cursor और दूसरे AI एजेंट आपके लिए “OCR से Markdown” चला सकते हैं: /skills/pdf123-ocr.md

सभी एजेंट स्किल

फ़ाइलें केवल इस काम के लिए इस्तेमाल होती हैं, फिर अपने आप मिट जाती हैं।