وصف الصور بالعربية (100M)
مجموعة بيانات عربية تضم 100 مليون وصف صورة، أُنتجت بنموذج الترجمة «مترجم».
ماذا تضمّ
93,613,962 صفًّا في شريحة التدريب المنشورة، بحجم 73.7 غيغابايت موزّعة على 148 شريحة Parquet. ويحمل كل صف ثلاثة أشياء: رابط الصورة، والوصف الأصلي كما كُتب، وترجمته العربية. وإبقاء الوصف المصدر إلى جانب العربية مقصود، فهو يجعل كل صف قابلًا للمراجعة، ويتيح استعمال المجموعة مدوّنةَ أوصاف متوازية لا عربية فحسب. والصور غير معاد نشرها؛ تحمل الصفوف روابطها.
كيف بُنيت
أُنتج الجانب العربي بنموذج «مترجم»، نموذج مسراج للترجمة بين العربية والإنجليزية بحجم 1.5 مليار معامل. واختير «مترجم» لهذا العمل لأن بيانات ضبطه رجّحت العيّنات عربية الأصل على الإنجليزية الأصل بنسبة اثنين إلى واحد، وهو الاتجاه الذي يهمّ هنا: المهمة كلها توليد عربية، وهو الاتجاه الأصعب، وعلى معيار Tarjama-25 يتصدّر «مترجم» في هذا الاتجاه تحديدًا بدرجة COMET قدرها 83.41 مقابل 83.36 لـGPT-4o mini، وchrF++ قدرها 68.67 مقابل 66.36، وBLEU قدرها 43.71 مقابل 38.52.
الاستعمالات المقصودة
التدريب المسبق والضبط الدقيق لنماذج الرؤية واللغة العربية: وصف الصور، واسترجاع الصور بالنص، والمحاذاة متعددة الوسائط، بحجم لم يتوفّر للعربية من قبل. ولأن الأوصاف مترجَمة آليًا، فالمجموعة مادة تدريب لا معيار تقييم: ينبغي أن تُعلن درجة نموذج الوصف على مجموعة عربية مكتوبة بشريًا، وأن تُوسم هذه المدوّنة بأنها مترجَمة في أي بيان بيانات.
الترخيص والوصول
مدرَجة علنًا على Hugging Face ويُمنح الوصول عند الطلب. ولا تعلن البطاقة رخصة SPDX خاصة بها، فتحكم الاستعمالَ شروطُ مصادر الصور والأوصاف الأساسية وشروطُ طلب الوصول، ولذلك تُرك حقل الترخيص هنا فارغًا عمدًا. ولأن المحمول روابط الصور وحدها، فمن يتدرّب عليها يجلب الصور بنفسه وفق شروط المواقع الأصلية.
أعمال ذات صلة
توثّق ورقة «مترجم» نموذجَ الترجمة الذي أنتج الجانب العربي، ومنهجَ تدريبه من مرحلتين، وTarjama-25، المعيار المنشور معه والمكوّن من خمسة آلاف زوج راجعها خبراء. وKuwain 1.5B هو النموذج الأساس الذي بُني عليه «مترجم».
كيف تُستشهد بها
@misc{hennara2025mutarjim,
title = {Mutarjim: Advancing Bidirectional Arabic-English Translation with a Small Language Model},
author = {Khalil Hennara and Muhammad Hreden and Mohamed Motaism Hamed and Zeina Aldallal and Sara Chrouf and Safwan AlModhayan},
year = {2025},
eprint = {2505.17894},
archivePrefix = {arXiv},
primaryClass = {cs.CL},
url = {https://arxiv.org/abs/2505.17894}
}بيانات المجموعة
- الحجم
- 100M captions
- عدد السجلات
- 93,613,962
- الصيغة
- Parquet
- الوصول
- إدراج عام والوصول عند الطلب
- تاريخ النشر
- المسار البحثي
- النماذج العربية الأساسية والذكاء المفتوح
لنتحدث عمّا تحاول بناءه.
كل حل جيد يبدأ بسؤال واضح. اسألنا، وفريقنا معك من السؤال إلى الحل.
