تخطَّ إلى المحتوى
مسراجأذكى
إيماننا

نفهم بعمق. نبني من الأصل. ونشغّل بثقة.

الأوراق البحثية

Linguistic Specialization of Arabic in Text Embedding Models via Multi-Teacher Knowledge Distillation

يقترح إطارًا لتقطير المعرفة متعدد المعلّمين لنماذج التضمين العربية، ويقدّم Kawn-Embed-Light الأفضل أداءً دون مليار معامل.

LaTell 2026النماذج العربية الأساسية والذكاء المفتوح

عن هذه الورقة

تُدرج نماذج التضمين متعددة اللغات العربيةَ ضمن بيانات تدريبها، لكنها تعاملها لغةً بين لغات كثيرة. فخصوصيات العربية، من صرفها وتنوع طرق كتابتها والمسافة بين فصحاها وعاميتها، تذوب في فضاء تشكّل في معظمه من لغات أخرى.

تقدّم هذه الورقة إطارًا لتقطير المعرفة متعدد المعلّمين لتخصيص نموذج تضمين نصوص في العربية. فبدل التقطير من معلّم واحد، يتعلم النموذج الطالب من عدة نماذج معلّمة في آن واحد، ويُدرَّب على نصوص عربية، فيتشكّل الفضاء المتجهي الناتج من العربية لا مُكيَّفًا عليها.

والنتيجة Kawn-Embed-Light، نموذج تضمين عربي بحجم 300 مليون معامل مبني للبحث الدلالي والاسترجاع والتجميع وأنظمة RAG. وبين نماذج التضمين العربية التي تقل عن مليار معامل يبلغ أفضل أداء، مع بقائه صغيرًا بما يكفي للعمل بسرعة بيئات الإنتاج.

النماذج في هذه الورقة

ابدأ معنا

لنتحدث عمّا تحاول بناءه.

أخبرنا بالمشكلة، وسنخبرك بصراحة إن كان الذكاء الاصطناعي هو الحل الصحيح.