سديد
نموذج تشكيل عربي مبني على كوين، يعيد التشكيل الكامل للعربية الفصحى والتراثية.
عن سديد
سديد نموذج بحجم 1.5 مليار معامل يعيد التشكيل إلى النص العربي. وهو مضبوط انطلاقًا من كوين 1.5B، نموذج مسراج اللغوي الصغير للعربية، وتذكر ورقته البحثية أنه حقق أفضل معدل خطأ في الكلمات على معيار Fadel للعربية الكلاسيكية.
تُكتب معظم العربية الحديثة دون تشكيل، فتتطابق حروف كلمات مختلفة: قَلْب وقَلَبَ وقُلَّب تبدو واحدة على الصفحة. ويعتمد على حسم هذا اللبس كلٌّ من تحويل النص إلى كلام والترجمة الآلية والتحليل الصرفي وتعيين أقسام الكلام، وكثيرًا ما تتوقف الحركة الصحيحة على بقية الجملة، بل على علامات ترقيمها. والبيانات المشكولة شحيحة ومعظمها كلاسيكي، وبعض مجموعات الاختبار الشائعة يتداخل مع مجموعات تدريب معروفة، فتتضخم النتائج المعلنة.
كيف يعمل
- بيانات تدريب نظيفة. بُنيت من مدوّنة Tashkeela ومن Arabic Treebank (ATB-3)، ونُظّفت بمسار التنظيف الخاص بكوين نفسه، ووُحّد فيها أسلوب التشكيل، وقُسّمت إلى مقاطع من 50 إلى 60 كلمة تحافظ على سياق الجملة، ثم رُشّحت ليبقى النص المشكول كاملًا. والحصيلة 1,042,698 مثالًا، نحو 53 مليون كلمة، مع خفض التداخل مع مجموعة اختبار Fadel إلى 0.4% من الأمثلة.
- التشكيل بوصفه سؤالًا وجوابًا. يوضع كل مثال في قالب ثابت، ويولّد النموذج النسخة المشكولة من النص المُدخل.
- معالجة الهلوسة. يُطابَق الناتج مع المُدخل بخوارزمية Needleman-Wunsch، فتُحذف الكلمات المضافة، وتُستعاد الكلمات الناقصة، وتُعاد الكلمات المحرَّفة دون تشكيل.
- موارد حوسبة متواضعة. ثلاث دورات تدريبية على 8 وحدات A100.
القدرات
نتائج المعايير
جميع الأرقام من ورقة سديد البحثية (arXiv:2504.21635)، والأقل أفضل.
- مجموعة اختبار Fadel (العربية الكلاسيكية): معدل خطأ في الكلمات قدره 1.83 دون أواخر الكلمات، مقابل 1.96 لـ SUKOUN، أقوى نظام سابق في المقارنة. ومع أواخر الكلمات يسجّل سديد 4.49، خلف SUKOUN بقيمة 3.34، ويسجّل 2.94 على نسخة Fadel المصحّحة صوتيًا التي نشرها الفريق.
- WikiNews (العربية الفصحى المعاصرة): نتيجة منافسة لا متصدرة. يبلغ معدل خطأ سديد في الكلمات دون أواخرها 8.44، مقابل 2.9 لنموذج BiLSTM الغني بالسمات لدرويش وزملائه، المدرَّب على بيانات من التوزيع نفسه.
- SadeedDiac-25: الأفضل بين النماذج المفتوحة المختبَرة، بمعدل خطأ في الكلمات قدره 9.92 دون أواخرها مقابل 40.25 لـ Aya-23-8B، النموذج المفتوح التالي. ويتصدر Claude 3.7 Sonnet في كل المقاييس (2.31). ومع أواخر الكلمات يتقدم أيضًا GPT-4 وGemini Flash 2.0 بقيمتي 5.27 و7.99 مقابل 13.74 لسديد، أما دونها فيتفوق سديد بقيمة 9.92 على GPT-4 بقيمة 10.93. ونحو 7.19 نقطة من قيمة سديد 9.92 سببها كلمات مهلوَسة.
ومعيار SadeedDiac-25 معيار نشرته مسراج للعموم يضم 1,200 فقرة. نصفها بالعربية الفصحى المعاصرة (454 فقرة منتقاة من مقالات على الويب و146 من WikiNews، طول كل منها بين 40 و50 كلمة)، ونصفها بالعربية الكلاسيكية (600 فقرة من مجموعة اختبار Fadel). وراجع النص خبيران، ثم دقّق كل منهما تصحيحات الآخر.
خيارات النشر
يتوفر سديد عبر واجهة مسراج البرمجية السحابية، ومنها كون كونسول، أو داخل المنشأة. وشيفرة التقييم منشورة على GitHub على الرابط github.com/misraj-ai/Sadeed، ومدوّنة التدريب المنقّحة Sadeed Tashkeela مدرجة على Hugging Face ويُتاح الوصول إليها بطلب.
لمن هذا النموذج
- الفرق التي تبني أنظمة تحويل النص العربي إلى كلام، حيث تلتبس قراءة الكلمة غير المشكولة.
- مسارات الترجمة الآلية والبحث التي تحتاج إلى التمييز بين كلمات متطابقة الرسم.
- دور النشر وأدوات تعليم اللغة التي تعرض نصًا مشكولًا كاملًا، ولا سيما العربية الكلاسيكية.
الأسئلة الشائعة
هل سديد أقوى في العربية الكلاسيكية أم الفصحى المعاصرة؟ في الكلاسيكية. فمعظم بيانات تدريبه كلاسيكية، وتذكر الورقة نتائج أضعف على النصوص التي يغلب عليها الأسلوب المعاصر، وتقول إن الفريق يوسّع بياناته من الفصحى المعاصرة.
لماذا يترك كلمة دون تشكيل أحيانًا؟ حين يغيّر النموذج كلمة، تعيد خطوة المطابقة الكلمة الأصلية دون تشكيل بدل الإبقاء على تشكيل خاطئ.
ما حدوده المعروفة؟ الهلوسة، ولا سيما في الكلمات غير العربية، وقلة البيانات المشكولة المتاحة للعموم من الفصحى المعاصرة.
في لمحة
- النوع
- معالجة لغة متخصصة
- المعاملات
- 1.5B
- الترخيص
- أوزان مفتوحة
- النشر
- واجهة سحابيةداخل المنشأة
- المسار البحثي
- النماذج العربية الأساسية والذكاء المفتوح
- الروابط
- الشيفرةاقرأ الورقة البحثية
المعايير
| مجموعة البيانات | المقياس | النتيجة |
|---|---|---|
SadeedDiac-25كانت نتائج التشكيل تُعلَن على مجموعات اختبار ضيّقة وغير متسقة، ما جعل مقارنة النماذج بنزاهة أمرًا صعبًا. ووجود معيار واحد يغطي المستويين وعدة أنواع نصية هو ما يتيح قراءة نتيجة تشكيل مقابل أخرى. | Coverage | MSA + Classical Arabic |
الأوراق البحثية
لنتحدث عمّا تحاول بناءه.
كل حل جيد يبدأ بسؤال واضح. اسألنا، وفريقنا معك من السؤال إلى الحل.
