تخطَّ إلى المحتوى
مسراجأذكى
إيماننا

نفهم بعمق. نبني من الأصل. ونشغّل بثقة.

لغوي

كوين

نموذج لغة عربي صغير بحجم 1.5B مبني بمنهجية حقن اللغة، ويشكّل الطبقة الأساسية لنماذجنا اللاحقة.

عن كوين

كوين نموذج لغوي صغير للعربية والإنجليزية بحجم 1.5 مليار معامل، بنته مسراج بحقن اللغة العربية في TinyLlama، وهو نموذج صغير دُرّب أساسًا على الإنجليزية. رفعت هذه الطريقة أداء العربية بمعدل 8% عبر المعايير، وحافظت على قدرة النموذج الأصلية في الإنجليزية، وخفّضت كلفة التدريب بنسبة 70%.

كوين هو الطبقة الأساسية لعدد من نماذج مختبر كون اللاحقة، ومنها مترجم للترجمة بين العربية والإنجليزية وسديد للتشكيل. ولهجاوي، نموذج الترجمة بين اللهجات، نسخة مضبوطة من كوين أيضًا.

المشكلة التي يحلّها

معظم النماذج اللغوية المفتوحة مبنية للإنجليزية. فالمُرمِّزات في نماذج مثل Llama 2 وMistral لا تحمل إلا 28 رمزًا عربيًا، رمزًا لكل حرف، مما يجعل معالجة العربية بطيئة ومكلفة. وللحلول المعتادة ثمنها: فتدريب نموذج ثنائي اللغة من الصفر يتطلب بيانات وحوسبة هائلة، ومواصلة تدريب نموذج إنجليزي على العربية تميل إلى تآكل ما كان يعرفه. بُني كوين ليضيف العربية دون أيٍّ من هاتين الكلفتين.

القدرات

كيف يعمل حقن اللغة

  • الإبقاء على النموذج الأصلي. تبقى معاملات TinyLlama الحالية، وعددها 1.1 مليار، مجمّدة، فلا تُمحى معرفته بالإنجليزية.
  • إضافة طبقات جديدة. تُوزَّع ثماني طبقات جديدة على امتداد النموذج بدل تكديسها معًا، فيكبر بنحو 30%. ولا تُدرَّب إلا الطبقات الجديدة والطبقة الأخيرة، إذ وجدت الورقة أن تكديس الطبقات الجديدة أو تجميد الطبقة الأخيرة يجعل التدريب غير مستقر.
  • توسيع المفردات. يُدمج مُرمِّز عربي من 26 ألف رمز في المُرمِّز الأصلي، ليصل المجموع إلى 54 ألف رمز.
  • التدريب على مزيج مقتصد. 110 مليارات رمز من مصادر مفتوحة: 90 مليارًا بالعربية تشمل بيانات من اللهجات، و20 مليارًا بالإنجليزية. وكانت نسبة 20% تقريبًا من الإنجليزية كافية للحفاظ على أدائها، مقابل 50% في الأعمال المماثلة. وجرى التدريب على 8 وحدات A100 لثلاث دورات.

ونُشر نص تنظيف البيانات العربية المستخدم في إعداد البيانات على GitHub باسم misraj-ai/Kuwain-Arabic-cleaner.

نتائج المعايير

جميع الأرقام من ورقة كوين البحثية (arXiv:2504.15120).

  • الحفاظ على الإنجليزية: متوسط 53.28 عبر سبعة معايير إنجليزية، مقابل 52.99 لنموذج TinyLlama الأصلي. ومع أقل من 20% من البيانات الإنجليزية هبط المتوسط إلى 49.56.
  • مقارنة بالتدريب التقليدي: البيانات نفسها دون الطبقات الجديدة (Kuwain-Naive) بلغت درجات عربية مماثلة، 42.17 مقابل 42.27 لكوين، لكن متوسطها في الإنجليزية هبط إلى 46.85.
  • مكاسب العربية: تحسّن بمعدل 8% عبر المعايير العربية مقارنة بالنموذج الأساسي.
  • كفاءة المُرمِّز: نسبة تمدد 2.30 بستة وعشرين ألف رمز عربي، مقابل 2.51 لـ AraBERT بأربعة وخمسين ألفًا و2.19 لـ Jais بأربعة وأربعين ألفًا.

خيارات النشر

يتوفر كوين عبر واجهة برمجية سحابية أو داخل المنشأة. وبحجم 1.5 مليار معامل يناسب البيئات محدودة الحوسبة.

لمن هذا النموذج

  • الفرق التي تحتاج نموذجًا صغيرًا واحدًا يتعامل مع العربية والإنجليزية معًا.
  • المطورون الذين يبنون نماذج عربية لمهام محددة على أساس صغير، كما بُني مترجم وسديد ولهجاوي.
  • الباحثون الذين يوسّعون نموذجًا متمركزًا حول الإنجليزية إلى لغة جديدة دون إعادة تدريبه من الصفر.

أسئلة شائعة

هل تضر إضافة العربية بإنجليزية كوين؟ لا. متوسطه في الإنجليزية 53.28، مقابل 52.99 للنموذج الذي انطلق منه.

لماذا لا يُدرَّب نموذج عربي من الصفر؟ لأن ذلك يتطلب بيانات وحوسبة أكبر بكثير. وقد خفّضت طريقة كوين كلفة التدريب بنسبة 70%.

ما نماذج مسراج المبنية على كوين؟ مترجم للترجمة، وسديد للتشكيل، ولهجاوي للترجمة بين اللهجات.

أين الورقة البحثية؟ «Kuwain 1.5B: An Arabic SLM via Language Injection»، برقم arXiv:2504.15120، وعُرضت أيضًا في LaTell 2026.

في لمحة

النوع
لغوي
المعاملات
1.5B
الترخيص
أوزان مفتوحة
النشر
واجهة سحابيةداخل المنشأة
المسار البحثي
النماذج العربية الأساسية والذكاء المفتوح

الأوراق البحثية

ابدأ معنا

لنتحدث عمّا تحاول بناءه.

كل حل جيد يبدأ بسؤال واضح. اسألنا، وفريقنا معك من السؤال إلى الحل.