تخطَّ إلى المحتوى الرئيسي
PPDF123

تعرّف على نص PDF ممسوح ضوئيًا إلى Markdown

OCR إلى Markdown يقرأ ملف PDF ممسوحًا ضوئيًا أو مبنيًا على صور ويعيد نصه في ملف Markdown. لا يضيف طبقة نص إلى PDF، ويبقى الملف الأصلي دون تغيير.

اسحب الملفات وأفلتها هنا، أو انقر للاختيار

يقبل PDF · حتى 500.0 MB لكل ملف · حتى 20 ملفات في المرة الواحدة

يمكنك أيضًا لصق ملف باستخدام Ctrl/Cmd+V أو من قائمة الحافظة.

OCR إلى Markdown يقرأ مسوحات أو ملفات PDF صورية فقط ويعيد Markdown (`text/markdown`، اسم الملف `.md`). لا يكتب طبقة نص مخفية داخل PDF، ولا ينظّف المسح ولا يعدّله ولا يصحّح ميله.

يجمع الخادم النص الأصلي الموجود أصلًا في PDF مع نتائج التعرف البصري على صفحات الصور. Force OCR (`ocrType=force-ocr`، افتراضي الموقع) يعيد التعرف على كل صفحة. Normal (أي قيمة غير `force-ocr`) يستخدم النص الأصلي إن وُجد ويطبّق OCR على صفحات الصور فقط. على PDF إلكتروني نظيف لا يحمّل Auto وقت تشغيل OCR.

الدقة تعتمد على جودة المسح والتباين والميل. المحرك الحالي بلا معامل لغة. إن أرسل العميل حقول Java OCRmyPDF القديمة (`languages`، `deskew`، `clean`، `sidecar`) تُتجاهل.

هذه ليست خطوة تمهيدية لـ PDF إلى Word أو PDF إلى نص. تلك الأدوات ما زالت تحتاج نصًا داخل PDF. OCR هنا استخراج موازٍ: تحصل على Markdown ويبقى PDF الأصلي دون تغيير.

لا تطبّق OCR على ملفات لا يحق لك رقمنتها أو إعادة توزيعها. النص المستخرج يخضع أيضًا لحقوق النشر وقواعد مكان العمل.

من يريد PDF قابلًا للبحث لن يجده هنا. الناتج القابل للبحث هو ملف Markdown. افتحه في محرر وراجع الأسماء والأرقام التي يجب أن تكون دقيقة.

صور الهاتف يُفضَّل قصّها وتسويتها قبل الرفع. الصفحات المائلة تُهدر التعرف على الخلفية. OCR ليس ترجمة: يتعرف على الحروف ولا يعيد كتابة المستند بلغة أخرى.

المهمة تعمل على الخادم. نزّل في الوقت المناسب. لا نجعل ملفاتك مكتبة OCR. الملفات المحمية بكلمة مرور تُفتح لك في هذه الصفحة بمجرد إدخال كلمة المرور؛ ومستخدمو API يجرون «إزالة كلمة المرور» أولًا.

الميزات

  • يعيد Markdown لا PDF بطبقة OCR
  • Force OCR يعيد قراءة كل صفحة؛ Normal/Auto يستخدمان النص الأصلي إن وُجد
  • PDF الأصلي دون تغيير
  • نقطة API مجهولة: /api/v1/misc/ocr-pdf

حالات الاستخدام

  • استخراج نص البنود من مسوحات أرشيفية
  • تسليم المسح إلى وكيل أو خط أنابيب يتوقع Markdown
  • رقمنة صفحات صور دون كتابة طبقة داخل PDF

كيف أنفّذ OCR على PDF ممسوح ضوئيًا؟

  1. ارفع مسحًا أو PDF ملتقطًا بالهاتف.
  2. اختر Force OCR (الافتراضي) أو Normal/Auto.
  3. انقر معالجة ونزّل ملف `.md`.
  4. راجع الأسماء والأرقام في Markdown قبل الاستخدام.

الحدود والحالات الحدّية

  • تتغيّر الدقة مع جودة الصورة
  • عدد الصفحات الكبير يزيد الزمن
  • المحرك الحالي بلا معامل لغة
  • ليست مكتبة OCR محلية ولا SDK دون اتصال
  • حد الرفع في هذا الموقع: 500 ميغابايت لكل ملف، ويُرسل على أجزاء عندما يتجاوز نحو 95 ميغابايت. أما جسم طلب API المباشر الواحد فحده الأقصى 100 ميغابايت.

أمثلة

  • مسح فاتورة نظيف غالبًا يعطي Markdown مقروءًا للبنود والمبالغ
  • على PDF إلكتروني نصي يتخطى Auto محرك OCR ويعيد النص الموجود

خصوصية هذه الأداة

تُرفع الملفات عبر HTTPS، وتُعالَج في الذاكرة أو في مجلد مؤقت قصير العمر على خوادمنا، ثم تُحذف عندما يصبح الناتج جاهزًا. لا نحتفظ بنسخ للتصفح لاحقًا أو لتدريب النماذج أو لملفات الإعلانات. راجع سياسة الخصوصية لمدد الاحتفاظ وإفصاحات ملفات تعريف الارتباط الخاصة بـ AdSense.

أسئلة شائعة

هل يغيّر OCR مظهر الصفحة؟
لا يعيد PDF. يبقى الأصل كما هو؛ تحصل على تنزيل Markdown منفصل.
هل هذه مكتبة OCR قابلة للتضمين؟
لا. مهمة HTTP مستضافة على /api/v1/misc/ocr-pdf. انظر /developers. ليست SDK قابلة للربط.
هل أستطيع التحويل إلى Word بعد OCR؟
لا كخط أنابيب PDF. خرج OCR هو Markdown. PDF إلى Word ما زال يحتاج PDF بطبقة نص.
هل يحتاج PDF الإلكتروني Force OCR؟
عادة لا. Normal/Auto يستخدمان النص الموجود ويتخطيان وقت تشغيل OCR. استخدم Force عندما تكون طبقة النص تالفة أو غير موثوقة.

آخر تحديث:

الاستدعاء من الشيفرة

كل أداة هنا نقطة نهاية REST عادية. الاستخدام المجهول بلا حساب ولا مفتاح API. للمتصفح والمطوّرين والوكلاء على حد سواء.

curl -X POST "https://pdf123.xyz/api/v1/misc/ocr-pdf" \
  -F "[email protected]" \
  -F "ocrType=force-ocr" \
  -o output.pdf

متاحة أيضًا كأداة MCP لأي عميل وكيل يدعم Model Context Protocol (JSON-RPC 2.0 عبر POST /mcp). مرجع API الكامل

استخدمها من وكيل ذكاء اصطناعي

مهارة

بهذه المهارة يستطيع Claude Code وCodex وCursor وغيرها من وكلاء الذكاء الاصطناعي تشغيل «OCR إلى Markdown» نيابةً عنك: /skills/pdf123-ocr.md

كل مهارات الوكلاء

الملفات لهذه المعالجة فقط، وتُحذف تلقائيًا بعدها.