تخطَّ إلى المحتوى
مسراجأذكى
إيماننا

نفهم بعمق. نبني من الأصل. ونشغّل بثقة.

الأوراق البحثية

Baseer: A Vision-Language Model for Arabic Document-to-Markdown OCR

يقدّم نموذج رؤية ولغة عربيًا للتعرّف الضوئي على المستندات، إلى جانب Misraj-DocOCR.

arXiv (2025), LaTell 2026النماذج العربية الأساسية والذكاء المفتوح

عن هذه الورقة

لا يزال التعرّف الضوئي على المستندات العربية مهمة صعبة بسبب الخط المتصل وتنوّع الخطوط والتشكيل واتجاه الكتابة من اليمين إلى اليسار. ومع أن النماذج اللغوية الكبيرة متعددة الوسائط الحديثة طوّرت فهم المستندات في اللغات وفيرة الموارد، يبقى أداؤها في العربية محدودًا. نقدّم في هذا العمل بصير، وهو نموذج رؤية ولغة مُهيَّأ خصيصًا للتعرّف الضوئي على المستندات العربية. ويُدرَّب بصير، اعتمادًا على مجموعة بيانات واسعة تجمع بين مستندات اصطناعية وواقعية، باستخدام استراتيجية ضبط من نوع فك الترميز فقط، تُكيّف نموذجًا متعدد الوسائط مُدرَّبًا مسبقًا مع الحفاظ على سماته البصرية العامة. كما نقدّم Misraj-DocOCR، وهو معيار عالي الجودة تحقّق منه خبراء، صُمِّم لتقييم أنظمة التعرّف الضوئي العربية تقييمًا دقيقًا. وتُظهر تجاربنا أن بصير يتفوّق بفارق كبير على الحلول مفتوحة المصدر والتجارية القائمة، محققًا معدل خطأ في الكلمات قدره 0.25 ومرسّخًا مستوى جديدًا هو الأفضل في مجال التعرّف الضوئي على المستندات العربية. وتُبرز نتائجنا فائدة تكييف النماذج متعددة الوسائط العامة على مجال محدد، وترسي أساسًا متينًا للتعرّف الضوئي عالي الدقة في لغات غنية صرفيًا كالعربية.

النماذج في هذه الورقة

استشهد بهذه الورقة

@misc{hennara2025baseer,
  title         = {Baseer: A Vision-Language Model for Arabic Document-to-Markdown OCR},
  author        = {Khalil Hennara and Muhammad Hreden and Mohamed Motasim Hamed and Ahmad Bastati and Zeina Aldallal and Sara Chrouf and Safwan AlModhayan},
  year          = {2025},
  eprint        = {2509.18174},
  archivePrefix = {arXiv},
  primaryClass  = {cs.CV},
  url           = {https://arxiv.org/abs/2509.18174}
}
ابدأ معنا

لنتحدث عمّا تحاول بناءه.

أخبرنا بالمشكلة، وسنخبرك بصراحة إن كان الذكاء الاصطناعي هو الحل الصحيح.