حزمة المسح إلى نص: شغّل OCR ثم اضغط ملف PDF الذي ما زلت تحتفظ به
حزمة المسح تحتاج خطوتين: OCR في PDF123 يعيد نص Markdown، والضغط يصغّر ملف PDF الأصلي بإعادة ضغط التدفقات. الترتيب والمخرجات مختلفان.

«حزمة المسح» عادةً كومة صور صفحات مدبّسة في ملف PDF واحد: ثقيلة على القرص، خالية من نص للبحث والنسخ. والأداتان اللتان يجمعها الناس معاً لا تنتجان ملف PDF سحرياً قابلاً للبحث في هذا الموقع: OCR يعيد Markdown، والضغط يعيد كتابة ملف PDF الذي ما زلت تحتفظ به.
وهذا الانقسام هو سير العمل كله.
ما يمنحك OCR فعلاً هنا
يشغّل POST /api/v1/misc/ocr-pdf التعرّف وينزّل ملف .md بصيغة text/markdown: نصاً أصلياً من ملف PDF مدمجاً مع OCR من الصفحات المصوّرة. وهو لا يكتب طبقة نصية مخفية داخل ملف PDF. فإن كنت تتوقع تحديداً وبحثاً داخل الملف نفسه، فتلك بنية منتج مختلفة، أي مخرجات بنمط OCRmyPDF الكلاسيكي. أما نقطة النهاية هذه فلنص يستطيع وكيل أو خط معالجة قراءته.
ووضعا Auto وForce:
- كل قيمة غير
ocrType=force-ocrبما فيها تسمية «Normal» في البوابة تُقابل Auto: استخدم النص الموجود حيث وُجد، وشغّل OCR على الصفحات المصوّرة وحدها. force-ocrيعيد قراءة كل صفحة، بما فيها صفحات تملك طبقة نصية أصلاً.
ولا يوجد منتقي لغة في نموذج البوابة. ولا يقرأ مسار ocr_pdf المكتوب بـ Rust تلك الحقول المتبقية بنمط tessdata من مسارات أقدم، مثل languages وإزالة الميل وأعلام التنظيف وما شابهها. وأوضاع Auto وForce، وأسباب فشل التعرّف في المسحات السيئة، مشروحة في كيف يقرأ OCR ملف PDF ممسوحاً.
وOCR لا يصغّر ملف PDF. فتنزيل Markdown أثر ثانٍ بجوار حزمة المسح الأصلية.
أين يقع الضغط
يشغّل Compress (POST /api/v1/misc/compress-pdf) ضغط تدفقات qpdf: --compress-streams=y وإعادة ضغط flate وتوليد تدفقات كائنات. وهو لا يخترع طبقة نصية، ولا يجزّئ الخطوط، ولا يوعد بتقليل دقة الصور. وقد يصغّر التخزين في ملف مثقل بالمسح عبر رصف التدفقات بإحكام أكبر، أما في ملف محكم أصلاً فقد تكون الفائدة صغيرة. وللخلفية عن روافع التدفقات في مقابل الصور: ما يحدث فعلاً عند ضغط ملف PDF.
استخدم الضغط على ملف PDF الذي ستؤرشفه أو ترسله بالبريد. واستخدم ناتج OCR بصيغة Markdown حين تحتاج الكلمات. فالضغط أولاً لا يجعل OCR أدق، وOCR أولاً لا يصغّر ملف PDF.
ترتيب عملي
- إن رفض العارض فتح الحزمة، فابدأ بـ الإصلاح أو Get Info.
- شغّل OCR على حزمة المسح إلى Markdown وافحص بضع صفحات من النص.
- على انفصال، اضغط نسخة من ملف PDF إن كان الحجم هو المشكلة الباقية.
- احفظ الأصل غير الممسوس حين تقتضي السياسة ذلك.
ويحتاج تشفير ملف فكّ قفل مصرّحاً به قبل أي من الخطوتين. وتحتاج الأسرار التنقية أو التحجيب التلقائي، لا OCR. أما تصدير الجدول الذي يعيد 204 بعد مسح ضوئي فيعني عدم العثور على أعمدة نصية؛ شغّل OCR إلى Markdown أولاً، ثم قرّر إن كانت أداة جداول تنطبق أصلاً (تصدير جدول فارغ (204)).
مخرجات ينبغي أن تتابعها
بعد تشغيل نمطي قد تحمل ثلاثة آثار: حزمة المسح الأصلية، وتنزيل OCR بصيغة .md ونسخة PDF مضغوطة اختيارياً. سمِّها بوضوح. فإرسال Markdown وحده بالبريد يفقد صور الصفحات، وإرسال ملف PDF المضغوط وحده يبقى بلا طبقة تحديد وبحث من مسار OCR هذا. وخطوط المعالجة التي تحتاج الكلمات وملفاً أصغر معاً يجب أن تخزّن المخرجين أو تعيد تشغيل أحدهما لاحقاً.
وقد يبقى Force OCR مفيداً على حزمة رقمية أصلية بطبقة نصية معطوبة، بينما قد يتخطّى Auto وقت تشغيل OCR كلياً على حزمة رقمية أصلية نظيفة. ولا يكتب أي من الوضعين نصاً داخل ملف PDF.
ما ليس عليه سير العمل هذا
تفشل حزم المسح حين تفترض الفرق أن زراً واحداً يستخرج النص ويصغّر البكسلات كما قد تفعل خطوط OCRmyPDF المكتبية. هنا يخرج النص Markdown، ويبقى الملف ملف PDF حتى تضغطه عن قصد. ولا توجد خطوة في هذا الموقع تعيد الملف نفسه قابلاً للبحث وأصغر من استدعاء واحد.
ولأتمتة العمليات نفسها عبر HTTP، راجع المطوّرين.