بصير
ذكاء المستندات العربية: من المسح الضوئي إلى Markdown منظّم
عن بصير
بصير نموذج الرؤية واللغة من مسراج للمستندات العربية. يقرأ الصفحة الممسوحة ضوئيًا أو الصورة أو ملف PDF ويحوّلها إلى Markdown منظَّم يحافظ على العناوين وترتيب القراءة والجداول، وقد سجّل معدل خطأ في الكلمات قدره 0.25 على معيار Misraj-DocOCR، وهي أفضل نتيجة بين الأنظمة المفتوحة المصدر والتجارية التي تقارنها ورقته البحثية.
والعربية صعبة على أنظمة التعرف الضوئي. فالخط متصل، وتتغير أشكال الحروف بحسب موضعها، وتقع علامات التشكيل فوق السطر وتحته، وتتنوع الخطوط كثيرًا، وتُقرأ الصفحة من اليمين إلى اليسار. والنماذج متعددة الوسائط العامة تتعامل جيدًا مع اللغات الغنية بالموارد لكن دقتها تتراجع في العربية، بينما تُخرج أدوات التعرف الضوئي التقليدية نصًا مسطّحًا يضيع معه التنسيق. وقد بُني بصير لسد الفجوتين معًا.
كيف يعمل
بصير نموذج بحجم 3 مليارات معامل، مضبوط انطلاقًا من Qwen2.5-VL-3B-Instruct.
- ضبط المُفكِّك وحده. يُجمَّد مُرمِّز الرؤية ويُدرَّب مُفكِّك اللغة فقط. وفي مقارنة الورقة نفسها تفوّق هذا الأسلوب على الضبط الكامل، وهو يحافظ على السمات البصرية العامة للنموذج الأساسي.
- بيانات التدريب. 500 ألف زوج من الصفحات والنصوص. منها 300 ألف صفحة اصطناعية بخطوط وتنسيقات متنوعة، مرّ 150 ألفًا منها بتحويل واحد إلى ثلاثة تحويلات من أصل 29 تحويلًا للصور، مثل ضبابية الحركة والطيّ والاصفرار والإضاءة الخافتة. أما الـ200 ألف الباقية فصفحات حقيقية من كتب ومجلات ومواد تعليمية وأوراق بحثية.
- مخرجات منظَّمة. تعود الجداول بصيغة HTML داخل Markdown، وتُوسَم أرقام الصفحات والعلامات المائية والصور حتى لا تختلط بالنص.
القدرات
نتائج المعايير
قيس الأداء على Misraj-DocOCR، وهو معيار متاح للعموم يضم 400 صفحة عربية تحقّق منها خبراء، مأخوذة من كتب وتقارير ونماذج وصفحات علمية وتنسيقات معقدة. والأرقام من ورقة بصير البحثية (arXiv:2509.18174) ولوحة ترتيب المعيار.
- معدل الخطأ في الكلمات: 0.25، مقابل 0.37 لـ Gemini 2.5 Pro، و0.44 لـ Azure AI Document Intelligence، و0.50 لـ Dots.ocr، و0.86 لـ GPT-5. ويسجّل النموذج الأساسي Qwen2.5-VL-3B-Instruct قيمة 0.87.
- بنية الجداول (TEDS): 66، مقابل 52 لـ Gemini 2.5 Pro و42 لـ Azure.
- مطابقة التنسيق (MARS): 76.9، وهي الأعلى في لوحة الترتيب.
- حيث يتقدم غيره: يسجّل Azure أقل معدل خطأ في الحروف، 0.27 مقابل 0.53 لبصير، ويسجّل Gemini 2.5 Pro أعلى درجات BLEU وchrF.
خيارات النشر
يعمل بصير عبر واجهة مسراج البرمجية السحابية أو داخل المنشأة. وهو المحرك الذي يشغّل بصير OCR (جرّبه على baseerocr.com) وبصير الاستخراج، وهو عقدة جاهزة في سيمليس للمطورين. ويمكن للمطورين استدعاؤه عبر كون كونسول، أو مكتبة kawn.ai للغة Python، أو BaseerReader ضمن تكامل LlamaIndex.
لمن هذا النموذج
- الأرشيفات والمكتبات ودور النشر التي ترقمن الكتب والسجلات والدوريات العربية.
- الفرق التي تُدخل ملفات PDF العربية في أنظمة البحث أو RAG أو التدريب، وتحتاج إلى البنية لا إلى النص وحده.
- الجهات الملزمة بإبقاء مستنداتها داخل بيئتها الخاصة.
الأسئلة الشائعة
هل بصير هو نفسه بصير OCR؟ بصير هو النموذج، أما بصير OCR فهو المنتج المبني عليه لتحويل المستندات إلى Markdown.
هل يقرأ الخط اليدوي؟ بُني بصير للمستندات المطبوعة. أما النسخة المكيَّفة للمخطوطات التاريخية المكتوبة بخط اليد، بصير Nakba، فقد حصلت على المركز الأول في مهمة التعرف على الخط اليدوي ضمن NAKBA-NLP 2026 بمعدل خطأ في الكلمات قدره 0.2440.
هل يمكنني التحقق من المعيار بنفسي؟ نعم. معيار Misraj-DocOCR متاح للعموم على Hugging Face على الرابط huggingface.co/datasets/Misraj/Misraj-DocOCR بترخيص Apache 2.0.
في لمحة
- النوع
- رؤية ولغة
- المعاملات
- 3B
- الترخيص
- تجاري
- النشر
- واجهة سحابيةداخل المنشأة
- المسار البحثي
- النماذج العربية الأساسية والذكاء المفتوح
- الروابط
- جرّبهاقرأ الورقة البحثية
المعايير
| مجموعة البيانات | المقياس | النتيجة |
|---|---|---|
Misraj-DocOCRلم يكن للتعرّف الضوئي على المستندات العربية معيار تحقّق منه خبراء يقيس البنية لا الحروف وحدها. وMisraj-DocOCR هو التقييم الذي قيس عليه بصير، وهو متاح للعموم، فبإمكان أي شخص إعادة إنتاج المقارنة بدل الأخذ بالرقم على سبيل الثقة. | Word Error Rate | 0.25الأفضل عالميًا |
الأوراق البحثية
arXiv (2025), LaTell 2026
بصير: نموذج رؤية ولغة للتعرّف الضوئي على المستندات العربية وتحويلها إلى Markdown
النسخ
بصير نكبة
تعرّف على النص العربي المكتوب بخط اليد في المخطوطات التاريخية
بصير نكبة نموذج رؤية ولغة مفتوح المصدر للتعرف على النصوص العربية المكتوبة بخط اليد، محسّن للمخطوطات التاريخية. ينسخ بدقة الخط العربي شديد الاتصال من المستندات الأرشيفية المتدهورة. حصل على المركز الأول في المهمة المشتركة لفهم المخطوطات العربية ضمن AR-MS NAKBA-NLP 2026، وأرسى مستوى جديدًا هو الأفضل على معيار Nakba OCR. أوزانه المفتوحة منشورة على Hugging Face.
لنتحدث عمّا تحاول بناءه.
كل حل جيد يبدأ بسؤال واضح. اسألنا، وفريقنا معك من السؤال إلى الحل.
