أفضل نماذج التعرف الضوئي على النصوص العربية في 2026: نتائج معيار Misraj-DocOCR
مقارنة خمسة عشر نظامًا ونموذجًا لقراءة المستندات على معيار Misraj-DocOCR المفتوح المكوّن من 400 صفحة عربية: معدل أخطاء الكلمات والحروف، ودقة بنية الجداول، وكيف تختار النموذج المناسب.
الإجابة المختصرة: على معيار Misraj-DocOCR، وهو معيار مفتوح يضم 400 صفحة من المستندات العربية راجعها خبراء، سجّل نموذج بصير أقل معدل أخطاء في الكلمات (0.25)، يليه Gemini 2.5 Pro بمعدل (0.37) ثم Azure AI Document Intelligence بمعدل (0.44). كما يتصدر بصير في الحفاظ على بنية الجداول (TEDS بقيمة 66 مقابل 52 لـGemini)، لكنه لا يتصدر كل المقاييس، إذ يسجّل Azure وGemini أخطاء أقل على مستوى الحروف، ويتفوق Gemini عليه بفارق بسيط في BLEU وChrF.
كل الأرقام في هذا المقال مأخوذة من صفحة معيار Misraj-DocOCR ومن ورقة بصير البحثية (arXiv:2509.18174، المنشورة في 17 سبتمبر 2025)، والجدول نفسه منشور في بطاقة المعيار على Hugging Face. وهي أحدث النتائج المنشورة على هذا المعيار، ولم نُضف أي نتيجة لنموذج غير موجود فيها.
لماذا تحتاج العربية إلى معيار خاص بها؟
أغلب أنظمة التعرف الضوئي على النصوص صُممت أساسًا للحروف اللاتينية. أما العربية فحروفها متصلة يتغير شكلها بحسب موقعها في الكلمة، والتشكيل فوق السطر وتحته، والكتابة من اليمين إلى اليسار، والمستندات الفعلية تجمع خطوطًا وأعمدة وجداول وحواشي مختلفة. وقد يقرأ النموذج كل الكلمات بشكل صحيح ثم يُخرج صفحة لا يمكن الاستفادة منها، لأن الجدول تحوّل إلى أرقام متناثرة.
قبل Misraj-DocOCR كان المرجع المعتاد هو الجزء الخاص بتحويل PDF إلى Markdown من KITAB-Bench. وعندما راجعه فريق مسراج وجد إجابات مرجعية تحتوي نصوصًا غير موجودة في الصفحة، وأرقام صفحات مفقودة، ونصوصًا صغيرة لم تُنقل. فنشر الفريق نسخة مصححة منه، ثم بنى معيارًا أكبر يقيس البنية إلى جانب دقة الحروف.
ونقولها بوضوح: مسراج هي من بنت المعيار ونموذج بصير معًا، وهذا سبب منطقي للتعامل مع النتائج بحذر. وهو أيضًا السبب في أن المعيار مفتوح بالكامل؛ فالصفحات الأربعمئة ونصوصها المرجعية منشورة على Hugging Face برخصة Apache-2.0، ويستطيع أي فريق إعادة المقارنة بنفسه بدل الاكتفاء بكلامنا.
منهجية التقييم
- البيانات: 400 صورة صفحة تجمع بين صفحات حقيقية وأخرى مولّدة، تشمل كتبًا وتقارير ونماذج وصفحات علمية وتخطيطات معقدة. راجع خبراء كل صفحة من حيث النص والبنية، والمخرج المرجعي بصيغة Markdown مع كتابة الجداول بصيغة HTML.
- طريقة التشغيل: استُخدمت أنظمة قراءة المستندات بتعليماتها الأصلية، بينما أُعطيت النماذج متعددة الوسائط العامة تعليمات اختبرها الفريق مسبقًا.
- توحيد المخرجات: قبل الحساب مرّت كل المخرجات بالمعالجة نفسها: تحويل جداول Markdown إلى HTML، وحذف وسوم HTML خارج الجداول، وتوحيد العناوين والخطوط الفاصلة، وإزالة الوسوم الخاصة ببعض النماذج مثل أرقام الصفحات والعلامات المائية، حتى لا يُحاسَب نموذج على اختيار تنسيقي يحمل المعنى نفسه.
- التاريخ: نُشرت النتائج في 17 سبتمبر 2025، وتعكس إصدارات النماذج المتاحة في ذلك الوقت.
يُقاس الأداء بستة مقاييس. اثنان منها يحسبان الأخطاء، فالأقل أفضل:
- WER (معدل أخطاء الكلمات): نسبة الكلمات المستبدلة أو المحذوفة أو المضافة، وقد يتجاوز 1.0 إذا أضاف النموذج نصًا كثيرًا غير موجود في الصفحة.
- CER (معدل أخطاء الحروف): الفكرة نفسها لكن على مستوى الحروف.
وأربعة تقيس التشابه، فالأعلى أفضل:
- BLEU: مدى تطابق تسلسلات الكلمات مع النص المرجعي.
- ChrF: مقياس على مستوى الحروف يناسب لغة غنية الصرف مثل العربية.
- TEDS: يقيس هل رجعت الجداول والبنية المتداخلة سليمة.
- MARS: مقياس يجمع النص والبنية مع مراعاة تخطيط الصفحة.
النتائج: نماذج قراءة المستندات العربية على Misraj-DocOCR
| النموذج | WER ↓ | CER ↓ | BLEU ↑ | ChrF ↑ | TEDS ↑ | MARS ↑ |
|---|---|---|---|---|---|---|
| بصير (مسراج) | 0.25 | 0.53 | 76.18 | 87.77 | 66 | 76.885 |
| Gemini 2.5 Pro | 0.37 | 0.31 | 77.92 | 89.55 | 52 | 70.775 |
| Azure AI Document Intelligence | 0.44 | 0.27 | 62.04 | 82.49 | 42 | 62.245 |
| Dots.ocr | 0.50 | 0.40 | 58.16 | 78.41 | 40 | 59.205 |
| Nanonets | 0.71 | 0.55 | 42.22 | 67.89 | 37 | 52.445 |
| Qari | 0.76 | 0.64 | 38.59 | 64.50 | 21 | 42.750 |
| Qwen2.5-VL-32B | 0.76 | 0.59 | 37.62 | 62.64 | 41 | 51.820 |
| GPT-5 | 0.86 | 0.62 | 40.67 | 61.6 | 48 | 54.8 |
| Qwen2.5-VL-3B-Instruct | 0.87 | 0.71 | 25.39 | 53.42 | 27 | 40.210 |
| Qwen2.5-VL-7B | 0.92 | 0.77 | 31.57 | 54.70 | 27 | 40.850 |
| Gemma3-12B | 0.96 | 0.80 | 19.75 | 44.53 | 33 | 38.765 |
| Gemma3-4B | 1.01 | 0.85 | 9.57 | 31.39 | 28 | 29.695 |
| GPT-4o-mini | 1.36 | 1.1 | 22.63 | 47.04 | 26 | 36.52 |
| AIN | 1.23 | 1.11 | 1.25 | 2.24 | 21 | 11.620 |
| Aya-vision | 1.41 | 1.07 | 2.91 | 9.81 | 26 | 17.905 |
أين يتفوق بصير؟
دقة الكلمات: معدل أخطاء الكلمات لدى بصير (0.25) هو الأقل في الجدول، ويليه Gemini 2.5 Pro بمعدل 0.37، أي أن أخطاء بصير في الكلمات أقل بنحو الثلث من أقرب منافس.
الجداول وتخطيط الصفحة: سجّل بصير 66 في TEDS، وهي الأعلى بفارق واضح، مقابل 52 لـGemini و48 لـGPT-5 و42 لـAzure، كما يتصدر في MARS بقيمة 76.885. وإذا كانت مستنداتك قوائم مالية أو نماذج حكومية أو تقارير مليئة بالجداول، فهذان المقياسان أهم لك من أي مقياس نصي.
الحجم: بصير نموذج بثلاثة مليارات معامل، أصغر من الأنظمة التي قورن بها. وهو مبني على Qwen2.5-VL-3B-Instruct بعد ضبطه على 500 ألف زوج من الصور والنصوص العربية: 300 ألف صفحة مولّدة من نصوص Markdown بخطوط وتخطيطات متنوعة مع محاكاة لعيوب المسح الضوئي، و200 ألف صفحة حقيقية من كتب ومجلات ومواد تعليمية وأبحاث. بقي جزء الرؤية مجمّدًا ودُرّب جزء اللغة فقط. والضبط هو ما صنع الفرق، فالنموذج الأساسي يسجّل على المعيار نفسه 0.87 في WER و27 في TEDS.
أين لا يتصدر بصير؟
معدل أخطاء الحروف: أقل معدل سجّله Azure AI Document Intelligence (0.27)، ثم Gemini 2.5 Pro (0.31)، ثم Dots.ocr (0.40)، بينما سجّل بصير 0.53. فإذا كان معيار القبول لديك هو الدقة على مستوى الحروف، فهذه الأنظمة تتقدم على هذا المعيار.
BLEU وChrF: يتصدر Gemini 2.5 Pro في المقياسين (77.92 و89.55)، ويأتي بصير ثانيًا بفارق بسيط (76.18 و87.77).
النسخة المصححة من KITAB-Bench: اختبرت الورقة أيضًا النماذج مفتوحة المصدر على هذه النسخة، وفيها حقق Dots.ocr أفضل النتائج النصية، وسجّل Nanonets كذلك معدل أخطاء كلمات أقل من بصير، بينما بقي بصير الأول في TEDS وMARS.
| النموذج | WER ↓ | CER ↓ | TEDS ↑ | MARS ↑ |
|---|---|---|---|---|
| Dots.ocr | 0.39 | 0.28 | 43 | 63.08 |
| Nanonets | 0.51 | 0.40 | 33 | 55.225 |
| بصير (مسراج) | 0.61 | 0.40 | 56 | 68.13 |
| Qwen2.5-VL-3B | 0.70 | 0.57 | 31 | 48.89 |
| Qwen2.5-VL-7B | 0.76 | 0.63 | 24 | 43.225 |
وتوضح الورقة أن هذه المجموعة صغيرة (تصف العينة المقيّمة بأنها 30 صفحة)، فكل خطأ يؤثر كثيرًا في النتيجة، أما على صفحات Misraj-DocOCR الأربعمئة فينقلب الترتيب. النتيجتان مهمتان، ونفضّل أن نعرض عليك النتيجة التي لا يتصدر فيها بصير بدل أن نخفيها.
بقية النماذج في النتائج
- GPT-5: معدل أخطاء كلمات 0.86، لكنه سجّل 48 في TEDS، وهي ثالث أفضل نتيجة في الجداول. أما GPT-4o-mini فسجّل 1.36.
- Dots.ocr (0.50) وNanonets (0.71) نظامان متخصصان في قراءة المستندات، جاءا في منتصف الجدول هنا وأداؤهما أفضل على مجموعة KITAB-Bench الأصغر.
- Qari، وهو نموذج متخصص في النصوص العربية، سجّل 0.76 في WER، وأدنى نتيجة في TEDS (21) بالتساوي مع AIN.
- Gemma3-12B (0.96) وGemma3-4B (1.01) وAIN (1.23) وAya-vision (1.41) في ذيل القائمة، وتشير الورقة إلى فجوة كبيرة بين الأنظمة المتقدمة والنماذج الأصغر أو الأقل تخصصًا على هذا المعيار.
وإذا لم تجد نموذجًا تفكر فيه، فذلك لأنه لا توجد له نتيجة منشورة على Misraj-DocOCR، ولم نقدّر له نتيجة من عندنا.
كيف تختار نموذج قراءة المستندات العربية المناسب؟
- ابدأ من مستنداتك: اختر من 50 إلى 100 صفحة تشبه عملك الفعلي، وقيّم كل نموذج بالمقاييس نفسها. ويمكن تحميل المعيار ببضعة أسطر عبر مكتبة datasets من Hugging Face واستخدامه قالبًا لمجموعة الاختبار الخاصة بك.
- حدد المقياس الذي يناسب المهمة: في التقارير والقوائم المالية والنماذج التي يجب أن تبقى جداولها سليمة، أعطِ الوزن الأكبر لـTEDS وMARS. وفي النصوص المتصلة العادية، يخبرك WER وCER بالصورة الأدق.
- تأكد أين تذهب بياناتك: Gemini وGPT-5 وAzure خدمات سحابية، أما بصير فيمكن تشغيله على خوادمك، وهذا مهم في الجهات الحكومية والبنوك والقطاع الصحي في المملكة، حيث لا يُسمح غالبًا بخروج المستندات من الجهة.
- انظر إلى صيغة المخرجات: يُخرج بصير نص Markdown مع الجداول بصيغة HTML، فيدخل مباشرة في محركات البحث وأنظمة الاسترجاع ومجموعات التدريب دون خطوة إضافية لمعالجة التخطيط.
يمكنك تجربة بصير على صفحاتك عبر الخدمة السحابية في baseerocr.com. وللتشغيل داخل مقرك أو في بيئة سيادية، اطّلع على بصير OCR أو تواصل مع فريقنا.
الأسئلة الشائعة
ما أفضل نموذج ذكاء اصطناعي لقراءة النصوص العربية في 2026؟
بحسب النتائج المنشورة على Misraj-DocOCR، يسجّل بصير أقل معدل أخطاء في الكلمات (0.25) وأعلى نتيجة في بنية الجداول (TEDS بقيمة 66). ويُعد Gemini 2.5 Pro أقوى نموذج عام في المقارنة ويتصدر في BLEU وChrF، بينما يسجّل Azure AI Document Intelligence أقل معدل أخطاء في الحروف.
ما مدى دقة Qwen2.5-VL في قراءة النصوص العربية؟
على Misraj-DocOCR سجّل Qwen2.5-VL معدل أخطاء كلمات 0.87 (3B) و0.92 (7B) و0.76 (32B). أما بصير، وهو Qwen2.5-VL-3B بعد ضبطه على المستندات العربية، فسجّل 0.25.
هل معيار Misraj-DocOCR متاح للعموم؟
نعم. الصفحات الأربعمئة ونصوصها المرجعية التي راجعها خبراء منشورة على Hugging Face برخصة Apache-2.0، والمنهجية موضحة في الورقة المنشورة على arXiv.
لماذا يتجاوز معدل أخطاء الكلمات 1 لدى بعض النماذج؟
لأن WER يحسب الكلمات المضافة أخطاءً. فالنموذج الذي يكرر نفسه أو يكتب نصًا غير موجود في الصفحة قد يرتكب أخطاء تفوق عدد كلمات النص المرجعي، فيتجاوز المعدل 1.0.
هل يمكن تشغيل بصير داخل مقر الجهة؟
نعم. تنشر مسراج بصير على السحابة أو داخل مقر الجهة أو في بيئة سيادية داخل المملكة. تحدث معنا عن احتياجك.