KITAB PDF-to-Markdown (نسخة مراجَعة)
نسخة مراجَعة ومصحَّحة من مجموعة KITAB-Bench الفرعية لتحويل PDF إلى Markdown لتقييم التعرّف الضوئي.
ماذا تضمّ
اثنتان وستون عيّنة على مستوى الصفحة، بحجم 68.6 ميغابايت بصيغة Parquet، وبحقلين في كل صف: صورة الصفحة، ونصّ Markdown مُتحقَّق منه بشريًا يحفظ بنيتها. وصغر حجمها مقصود. فهذه مجموعة تقييم لا بيانات تدريب، وكل صفحة من الاثنتين والستين قرأها إنسان في مقابل صورتها.
كيف بُنيت
هي نسخة مصحَّحة من مجموعة KITAB-Bench الفرعية لتحويل PDF إلى Markdown. وقد أظهر تقييم تلك المجموعة ثلاثة أنواع من الخلل تجعل المقارنة العادلة متعذّرة: مرجعيةٌ مهلوسة، إذ تضمّن نصّ Markdown المرجعي عباراتٍ غائبة عن الصفحة المصدر. حمل أحد المدخلات جملة إنجليزية تبدأ بـ«You're right - let me write it exactly as it appears in the image»؛ وأرقامُ صفحات ناقصة في المراجع؛ ونصٌّ بخط صغير محذوف مع وضوحه في الصورة. وعولج كلٌّ منها يدويًا: حُذفت العبارات المهلوسة، واستُعيد المحتوى المحذوف، وأُضيفت علامات الصفحات وتُحقِّق منها، ووُحِّدت فروق التنسيق الصغيرة كي تبقى المهمة متّسقة عبر العيّنات. أما المهمة الأصلية ومخطط البيانات فلم يتغيّرا، فالمجموعة بديل مباشر عن المجموعة التي تصحّحها.
الاستعمالات المقصودة
تقييم نماذج التعرّف الضوئي على المستندات العربية وفهمها في تحويل الصفحة إلى Markdown. وقيمتها أن المرجعية صارت موثوقة: لم يعد النموذج يُعاقَب على عجزه عن إنتاج نصّ لم يكن على الصفحة أصلًا، ولا يُكافَأ على إسقاط نصّ أسقطته المرجعية كذلك. وباثنتين وستين صفحة هي فحص صحة لا لوحة صدارة. وللقياس الأوسع للتعرّف الضوئي العربي يغطي معيار Misraj-DocOCR أربعمئة صفحة راجعها خبراء عبر تخطيطات متنوعة.
الترخيص والوصول
برخصة Apache 2.0 وقابلة للتنزيل علنًا من Hugging Face دون طلب وصول. وهي مبنية على KITAB-Bench، وتسري شروطه على المادة الأساسية.
أعمال ذات صلة
تقدّم ورقة «بصير» نموذجَ مسراج للرؤية واللغة في التعرّف الضوئي على المستندات العربية، ومعيارَ Misraj-DocOCR الذي تحقّق منه خبراء والمنشور معه، ويبلغ عليه «بصير» معدل خطأ في الكلمات قدره 0.25 مقابل 0.37 لـGemini 2.5 Pro و0.44 لـAzure AI Document Intelligence. وKITAB-Bench الأصلي هو المعيار الذي تصحّحه هذه المجموعة الفرعية.
كيف تُستشهد بها
@misc{hennara2025baseer,
title = {Baseer: A Vision-Language Model for Arabic Document-to-Markdown OCR},
author = {Khalil Hennara and Muhammad Hreden and Mohamed Motasim Hamed and Ahmad Bastati and Zeina Aldallal and Sara Chrouf and Safwan AlModhayan},
year = {2025},
eprint = {2509.18174},
archivePrefix = {arXiv},
primaryClass = {cs.CV},
url = {https://arxiv.org/abs/2509.18174}
}بيانات المجموعة
- عدد السجلات
- 62
- الصيغة
- Parquet
- الترخيص
- apache-2.0
- الوصول
- تنزيل مفتوح
- تاريخ النشر
- مبنيّة على
- KITAB-Bench
- المسار البحثي
- النماذج العربية الأساسية والذكاء المفتوح
لنتحدث عمّا تحاول بناءه.
كل حل جيد يبدأ بسؤال واضح. اسألنا، وفريقنا معك من السؤال إلى الحل.
