Product2026-09-283 मिनट पढ़ें

स्कैन पैक से टेक्स्ट: पहले OCR, फिर जो PDF रखेंगे उसे Compress करें

स्कैन पैक में दो चरण हैं: PDF123 पर OCR Markdown टेक्स्ट लौटाता है, जबकि Compress मूल PDF को स्ट्रीम पुनःसंपीड़न से छोटा करता है। क्रम और नतीजे अलग हैं।

PDF123 · Updated 2026-09-28

“स्कैन पैक” आम तौर पर एक PDF में सिली पेज-इमेजों का ढेर है: डिस्क पर भारी, खोज और कॉपी के लिए खाली। जिन दो टूल को लोग जोड़कर चलाते हैं, वे यहाँ एक जादुई खोजने-योग्य PDF नहीं बनाते। OCR Markdown लौटाता है। Compress उस PDF को दोबारा लिखता है जिसे आप फिर भी रखते हैं।

यही बँटवारा पूरा कार्यप्रवाह है।

यहाँ OCR असल में क्या देता है

POST /api/v1/misc/ocr-pdf पहचान चलाता है और .md फ़ाइल (text/markdown) डाउनलोड करता है: मूल PDF टेक्स्ट और इमेज पेजों के OCR का मेल। यह PDF में छिपी टेक्स्ट परत वापस नहीं लिखता। अगर आपने उसी फ़ाइल में चुनने-और-खोजने की उम्मीद की थी, तो वह अलग उत्पाद-रूप है (क्लासिक OCRmyPDF शैली)। यह एंडपॉइंट उस टेक्स्ट के लिए है जिसे एजेंट या पाइपलाइन पढ़ सके।

Auto बनाम Force OCR:

  • ocrType=force-ocr के अलावा बाक़ी सब (पोर्टल का “Normal” लेबल सहित) Auto पर जाता है: जहाँ टेक्स्ट मौजूद है वहाँ मौजूदा टेक्स्ट इस्तेमाल करें; सिर्फ़-इमेज पेजों का OCR करें।
  • force-ocr हर पेज दोबारा पढ़ता है, उन पेजों सहित जिनमें टेक्स्ट परत पहले से है।

पोर्टल फ़ॉर्म पर कोई भाषा-चयनकर्ता नहीं है। पुराने रास्तों से बचे टेस्डेटा-शैली फ़ील्ड (languages, deskew, clean फ़्लैग वग़ैरह) Rust का ocr_pdf रास्ता अनदेखा कर देता है। Auto बनाम Force, और खराब स्कैन पर पहचान क्यों फेल होती है, यह OCR स्कैन की गई PDF को कैसे पढ़ता है में पढ़ें।

OCR PDF को छोटा नहीं करता। Markdown डाउनलोड मूल स्कैन पैक के बग़ल में दूसरा नतीजा है।

Compress कहाँ फ़िट होता है

Compress (POST /api/v1/misc/compress-pdf) qpdf स्ट्रीम संपीड़न चलाता है: --compress-streams=y, flate पुनःसंपीड़न और बनाई गई ऑब्जेक्ट स्ट्रीम। यह टेक्स्ट परत नहीं गढ़ता, फ़ॉन्ट सबसेट नहीं करता, और फ़ोटो-डाउनसैंपलिंग का वादा नहीं करता। स्कैन-भारी फ़ाइल पर यह स्ट्रीम ज़्यादा कसकर पैक करके भंडार घटा भी सकता है; पहले से कसी फ़ाइल पर लाभ छोटा हो सकता है। स्ट्रीम बनाम इमेज के लीवर की पृष्ठभूमि: PDF संपीड़ित करने पर असल में क्या होता है।

Compress उस PDF पर चलाएँ जिसे संग्रहित या ईमेल करेंगे। Markdown OCR निर्गम तब इस्तेमाल करें जब शब्द चाहिए। पहले संपीड़न करने से OCR ज़्यादा सटीक नहीं होता; पहले OCR करने से PDF छोटा नहीं होता।

व्यावहारिक क्रम

  1. अगर व्यूअर पैक नहीं खोलता, तो पहले Repair या Get Info।
  2. स्कैन पैक का OCR करके Markdown बनाएँ और कुछ पेजों का टेक्स्ट जाँचें।
  3. आकार ही बची समस्या हो तो अलग से PDF की प्रति Compress करें।
  4. जब नीति कहे तब बिना छुआ मूल रखें।

किसी भी चरण से पहले एन्क्रिप्ट की गई फ़ाइल को अधिकृत Unlock चाहिए। रहस्यों के लिए Sanitize / Auto Redact चाहिए, OCR नहीं। स्कैन के बाद 204 लौटाने वाले तालिका-निर्यात का अर्थ है कि कोई टेक्स्ट स्तंभ नहीं मिला—पहले OCR Markdown करें, फिर तय करें कि स्प्रेडशीट टूल लागू होता भी है या नहीं (खाली तालिका निर्यात (204))।

किन नतीजों का हिसाब रखें

आम रन के बाद आपके पास तीन नतीजे हो सकते हैं: मूल स्कैन पैक, .md OCR डाउनलोड, और (वैकल्पिक रूप से) संपीड़ित PDF प्रति। इन्हें लेबल करें। सिर्फ़ Markdown ईमेल करने से पेज-इमेज चली जाती हैं; सिर्फ़ संपीड़ित PDF ईमेल करने पर भी इस OCR रास्ते से चुनने-और-खोजने वाली परत नहीं आती। जिन पाइपलाइनों को शब्द और छोटी PDF दोनों चाहिए, उन्हें दोनों निर्गम संग्रहित करने होंगे या बाद में एक तरफ़ दोबारा चलाना होगा।

टूटी टेक्स्ट परत वाले बॉर्न-डिजिटल पैक पर Force OCR उपयोगी हो सकता है; साफ़ बॉर्न-डिजिटल पैक पर Auto OCR रनटाइम पूरी तरह छोड़ भी सकता है। कोई भी मोड PDF में टेक्स्ट वापस नहीं लिखता।

यह कार्यप्रवाह क्या नहीं है

स्कैन पैक तब फेल होते हैं जब टीमें मान लेती हैं कि एक बटन टेक्स्ट भी निकाल देगा और पिक्सेल भी छोटे कर देगा, जैसे कोई डेस्कटॉप OCRmyPDF पाइपलाइन करती हो। यहाँ टेक्स्ट Markdown के रूप में बाहर जाता है; PDF PDF ही रहता है जब तक आप जानबूझकर Compress न करें। यहाँ ऐसा कोई चरण नहीं जो एक ही कॉल से “वही PDF, अब खोजने-योग्य और छोटी” लौटाए।

वही प्रचालन HTTP से स्वचालित करने के लिए Developers देखें।

Open tool
Process in the browser — no watermark, files removed after the job.
Open tool