تخطَّ إلى المحتوى
مسراجأذكى
إيماننا

نفهم بعمق. نبني من الأصل. ونشغّل بثقة.

لغوي

لهجاوي

عائلة من نماذج ترجمة اللهجات العربية تغطي الترجمة من لهجة إلى لهجة ومن اللهجة إلى الفصحى.

أوزان مفتوحة

عن لهجاوي

لهجاوي عائلة من نماذج ترجمة اللهجات العربية من مسراج. يترجم Lahjawi-D2D مباشرة بين 15 لهجة عربية، وهو أول نموذج بُني لهذه المهمة بحسب ورقته البحثية، ويحوّل Lahjawi-D2MSA أيًّا من هذه اللهجات إلى العربية الفصحى.

يتحدث العرب بلهجاتهم في حياتهم اليومية، وتختلف اللهجات في المفردات وبنية الجملة وتصريف الأفعال وصيغ الجمع والتعابير مثل الأمثال الشعبية. ومعظم أبحاث ترجمة اللهجات تحوّل لهجة واحدة، أو عدة لهجات، إلى الفصحى. أما الترجمة المباشرة من لهجة إلى لهجة فلم يسبقها إلا عمل تأسيسي واحد، مدوّنة PADIC، ولم يكن لها نموذج مخصص.

كيف يعمل

كلا النموذجين مضبوط انطلاقًا من كوين 1.5B، نموذج مسراج اللغوي الصغير للعربية.

  • بيانات التدريب. سبع مجموعات بيانات مفتوحة (MADAR وPADIC وNADI 2023 وDial2MSA وArabic STS ومدوّنة UFAL للهجة الشامية الشمالية وMDPCA)، وُحّدت فيها الحروف والأرقام وعلامات الترقيم والمسافات.
  • مجموعتان مبنيتان منها. مجموعة من اللهجة إلى الفصحى تضم 197,042 عينة، ومجموعة من لهجة إلى لهجة تضم 266,871 عينة بُنيت من كل تركيبات أزواج اللهجات، وعددها 210 أزواج.
  • الترجمة بوصفها سؤالًا وجوابًا. توضع كل عينة في قالب: قالب لأي لهجة إلى الفصحى، وقالب يسمّي لهجة المصدر ولهجة الهدف. ويجري التدريب بالتنبؤ بالرمز التالي مع حجب موجّه النظام.

وقد حسمت نتيجة واحدة هذا التصميم: أداء أربعة نماذج منفصلة، لكل لهجة نموذج، جاء في مجمله أضعف من نموذج واحد دُرّب على اللهجات الأربع معًا، إذ سجّل 13.55 على مقياس BLEU مقابل 12.13 على مجموعة اختبار NADI 2024.

القدرات

نتائج المعايير

الأرقام من ورقة لهجاوي البحثية المنشورة في أعمال ورشة WACL-4 ضمن COLING 2025.

  • من اللهجة إلى الفصحى، مجموعة اختبار MADAR: درجة BLEU إجمالية قدرها 9.62 عبر 15 لهجة، من 11.52 للهجة الأردنية و10.81 للهجة السعودية إلى 6.47 للهجة التونسية.
  • من لهجة إلى لهجة، مجموعة اختبار MADAR: درجة BLEU إجمالية قدرها 9.88.
  • التقييم البشري: دقة 58% وطلاقة 78%، بتقييم بشري على 50 جملة للهجات الأوسع انتشارًا، ومنها السورية والأردنية والفلسطينية والتونسية والمصرية والسعودية والمغربية.
  • مهمة NADI 2024 من اللهجة إلى الفصحى: 13.30 على مقياس BLEU لنموذج Lahjawi-D2MSA. وسجّلت فرق استخدمت نماذج أكبر بكثير، مثل Jais-13B وLlama 3 8B، أو مجموعات بيانات معزَّزة أكبر، نتائج أعلى، وبلغ أفضل نظام 20.44. ونذكر هذه النتيجة كما هي.

وتتبع الجودة بيانات التدريب. فاللهجات الشامية، وهي الغالبة فيها، تُترجم على أفضل وجه، واللهجات المغاربية، والتونسية قبل غيرها، هي الأصعب. والترجمة ليست متماثلة دائمًا: من القطرية إلى العراقية 17.21 على مقياس BLEU، ومن العراقية إلى القطرية 6.02.

خيارات النشر

يتوفر لهجاوي عبر واجهة مسراج البرمجية السحابية أو داخل المنشأة.

لمن هذا النموذج

  • الخدمات التي تحتاج إلى مخاطبة الناس في أنحاء العالم العربي بلهجاتهم.
  • الفرق التي تحتاج إلى تحويل نصوص اللهجات إلى الفصحى قبل البحث أو التحليل أو الترجمة اللاحقة.
  • الباحثون في اللهجات العربية والترجمة بينها.

الأسئلة الشائعة

ما اللهجات التي يغطيها؟ خمس عشرة لهجة: السعودية، والعُمانية، والقطرية، والعراقية، والأردنية، واللبنانية، والفلسطينية، والسورية، والمصرية، والسودانية، واليمنية، والجزائرية، والليبية، والمغربية، والتونسية.

هل يتعامل مع اللهجات السعودية والخليجية؟ نعم. السعودية والقطرية والعُمانية ضمن اللهجات الخمس عشرة، وسجّلت السعودية 10.81 على مقياس BLEU في الترجمة إلى الفصحى، فوق المتوسط العام.

ما حدوده؟ بيانات اللهجات قليلة وغير متوازنة، وكثير من الترجمات المرجعية إعادة صياغة لا ترجمة حرفية، وقد يُخرج النموذج الصغير نتائج غير دقيقة. والورقة تذكر هذه الحدود الثلاثة كلها.

في لمحة

النوع
لغوي
الترخيص
أوزان مفتوحة
النشر
واجهة سحابيةداخل المنشأة
المسار البحثي
النماذج العربية الأساسية والذكاء المفتوح

الأوراق البحثية

ابدأ معنا

لنتحدث عمّا تحاول بناءه.

كل حل جيد يبدأ بسؤال واضح. اسألنا، وفريقنا معك من السؤال إلى الحل.