Jais 2: A Family of Arabic-Centric Open Large Language Models
جايس 2 هي عائلة من النماذج اللغوية الكبيرة المفتوحة والمسموحة تجارياً والمركزة على اللغة العربية، وتتضمن نسخة بـ 70 مليار معلمة، طورتها جامعة محمد بن زايد للذكاء الاصطناعي وسيريبراس وإنسبشن لتقديم أداء رائد في الاختبارات المعيارية العربية والمتجذرة ثقافياً مع سرعة استدلال عالية على أجهزة سيريبراس.
المؤلفون الأصليون:Mohamed Anwar, Abed Alhakim Freihat, George Ibrahim, Mostafa Awad, Abdelrahman Sadallah, Gurpreet Gosal, Gokulakrishnan Ramakrishnan, Sarath Chandran, Biswajit Mishra, Rituraj Joshi, Ahmed Frikha, EtiMohamed Anwar, Abed Alhakim Freihat, George Ibrahim, Mostafa Awad, Abdelrahman Sadallah, Gurpreet Gosal, Gokulakrishnan Ramakrishnan, Sarath Chandran, Biswajit Mishra, Rituraj Joshi, Ahmed Frikha, Etienne Goffinet, Abhishek Maiti, Ali El Filali, Sarah AlBarri, Samujjwal Ghosh, Rahul Pal, Parvez Mullah, Awantika Shukla, Sajid siddiki, Samta Kamboj, Onkar Pandit, Sunil Kumar Sahu, AbdelRahman Elbadawy, Amr Mohamed, Ahmad Chamma, Evan Dufraisse, Abdelaziz Bounhar, Dani Bouch, Hadi Abdine, Guokan Shang, Fajri Koto, Yuxia Wang, Zhuohan Xie, Ali Mekky, Rania Elbadry, Sarfraz Ahmad, Momina Ahsan, Omar El Herraoui, Daniil Orel, Hasan Iqbal, Kareem Elzeky, Mervat Abassy, Kareem Elozeiri, Saadeldine Eletter, Farah Atif, Nurdaulet Mukhituly, Haonan Li, Xudong Han, Aaryamonvikram Singh, Zainul Abedien Ahmed Quraishi, Neha Sengupta, Larry Murray, Avraham Sheinin, Joel Hestness, Natalia Vassilieva, Hector Xuguang Ren, Zhengzhong Liu, Michalis Vazirgiannis, Preslav Nakov
تخيل أنك تحاول تعليم روبوت كيف يتحدث. لفترة طويلة، كان أفضل المعلمين هم المتحدثون باللغة الإنجليزية في الغالب، لذا تعلم الروبوت التحدث بالإنجليزية ببراعة ولكنه تعثر في اللغات الأخرى، وخاصة تلك الغنية والمعقدة مثل العربية. العربية تشبه محيطاً شاسعاً به نسخة "مياه عميقة" رسمية تُستخدم في الأخبار والكتب، وعشرات اللهجات التي تشبه "المياه الضحلة" المستخدمة في الحياة اليومية، بالإضافة إلى طريقة كتابة فريدة تمزج بين الحروف والأرقام. حتى الآن، كانت معظم الروبوتات تعرف فقط المياه العميقة أو تمتلك حصيلة لغوية محدودة للغاية. تقدم هذه الورقة البحثية "جيس 2" (Jais 2)، وهي عائلة جديدة من نماذج الذكاء الاصطناًعي بُنيت خصيصاً للغوص عميقاً في المحيط العربي. فكر في هذه النماذج كطلاب أذكياء جداً لم يكتفوا بحفظ قاموس فحسب؛ بل نشأوا وهم يستمعون إلى الشعراء، والطهاة، وعلماء الدين، والجدات وهنّ يروين قصص الأحلام، بينما يتعلمون التحدث باللغة العربية الفصحى ولهجاتها المحلية المتعددة بطلاقة. كان الهدف هو إنشاء ذكاء اصطناعي لا يترجم الكلمات فحسب، بل يفهم حقاً الثقافة والتاريخ وروح العالم العربي.
قام الباحثون وراء "جيس 2"، وهم فريق من الإمارات العربية المتحدة، وشركة "إنسبشن" (Inception)، و"سيريبراس" (Cerebras)، ببناء نسختين رئيسيتين من هذا الذكاء الاصطناعي: نموذج أصغر وأكثر رشاقة بـ 8 مليارات معلمة (parameter)، وعملاق ضخم بـ 70 مليار معلمة. لم يقوموا بمجرد تعديل روبوت موجود بالفعل؛ بل دربوا هذه النماذج من الصفر باستخدام مكتبة هائلة تضم أكثر من 600 مليار "توكن" (token) عربي (وحدات نصية) و1.6 تريليون توكن من الإنجليزية والبرمجة. ولجعل العملية فعالة، أنشأوا "مفردات" مخصصة مكونة من 150,000 كلمة، مثل قاموس متخصص مصمم خصيصاً للعربية، مما يساعد الذكاء الاصطناعي على القراءة والكتابة بشكل أسرع بكثير. كما استخدموا وصفة تدريب خاصة تضمنت تغذية الذكاء الاصطناعي ليس فقط بالحقائق، بل بمهام ثقافية محددة: تعلم تفسير الأحلام، وإلقاء الشعر، والتعرف على الأطباق الإقليمية، والإجابة على أسئلة حول الشريعة الإسلامية.
تظهر النتائج أن "جيس 2" قوة ضاربة بالنسبة للغة العربية. فعند اختباره على لوحة صدارة النماذج العربية مفتوحة المصدر، احتلت نسخة الـ 70 مليار المركز الأول، متفوقة على نماذج ضخمة أخرى مثل "لاما 3" (Llama 3) و"كيوين 2.5" (Qwen 2.5) في فهم الثقافة العربية واللهجات والمعرفة العامة. حتى نسخة الـ 8 مليارات أصغر حجماً تفوقت على معظم النماذج الأخرى من نفس حجمها. لم يكتسب الذكاء الاصطناዊ جودة في الحقائق فحسب؛ بل تعلم التعامل مع فروق اللغة الدقيقة، مثل تحديد أي من اللهجات العربية السبعة عشر كتبت بها الجملة، وفهم الفرق بين تقرير إخباري رسمي ورسالة نصية عفوية. كما أظهر مهارات قوية في اللغة الإنجليزية، مما يثبت أن التركيز على العربية لم يجعله ينسى التحدث باللغة العالمية. لقد أطلق الفريق النماذج ليستخدمها الجميع، بل وبنوا تطبيق دردشة يعمل على أجهزة فائقة السرعة، قادر على توليد 2,000 كلمة في الثانية. وبينما يعد الذكاء الاصطناዊ جيداً جداً، يشير المؤلفون إلى أنه لا يزال لديه مساحة للنمو، لا سيما في الرياضيات المعقدة وبعض مهام القراءة بالإنجليزية، لكنه يمثل قفزة نوعية في جعل الذكاء الاصطناዊ متاحاً حقاً وواعياً ثقافياً للعالم الناطق بالعربية.
ملخص تقني: جيس 2 – عائلة من النماذج اللغوية الكبيرة مفتوحة المصدر المتمحورة حول اللغة العربية
بيان المشكلة
على الرغم من التقدم السريع في النماذج اللغوية الكبيرة متعددة اللغات، لا يزال المجال يعاني من انحياز شديد نحو اللغة الإنجليزية ومجموعة محدودة من اللغات ذات الموارد العالية. وتتميز اللغة العربية، بتركيبتها الصرفية المعقدة، والازدواجية اللغوية (التعايش بين اللغة العربية الفصحى الحديثة واللهجات الإقليمية المتنوعة)، والسياق الثقافي الغني، بكونها ممثلة تمثيلاً ناقصاً بشكل كبير في مجموعات البيانات التدريبية العالمية. وغالباً ما تظهر النماذج العامة الحالية (مثل Llama 3 وGemma وQwen) كفاءة جزئية في اللغة العربية، لكنها تعاني بشكل خاص مع التباينات اللهجوية، والاستدلال ذي السياق الثقافي الدقيق، والمجالات النوعية مثل الفقه الإسلامي، والشعر، والمطبخ الإقليمي. علاوة على ذلك، تعتمد العديد من المبادرات المتمحورة حول العربية حالياً على تطويع النماذج الأساسية متعددة اللغات أو تكون محدودة بنطاقات لغوية ضيقة، مما يفتقر إلى النطاق والترسيخ الثقافي اللازمين للنشر القوي في العالم الحقيقي عبر الوطن العربي.
المنهجية
بنية النموذج وبنية التدريب التحتية
"جيس 2" هو عائلة من نماذج "Transformer" من نوع "decoder-only"، صدرت في نسختين: 8B و 70B من المعلمات. تم تدريب كلا النموذجين من الصفر.
البنية: تستخدم النماذج نسبة مرشح تغذية أمامية موسعة (8 أضعاف الحجم الخفي)، وتنشيطات ReLU2 لتحفيز التناثر (sparsity)، وتضمينات الموضع الدوارة (RoPE) لتوسيع السياق بشكل فائق. وعلى عكس إصدارات "جيس" السابقة التي استخدمت ALiBi، يعتمد "جيس 2" على RoPE. وتستخدم البنية معلمة التحديث القصوى (µP) لتمكين النقل الصفري (zero-shot transfer) للمعلمات الفائقة المثلى من النماذج الوسيطة الصغيرة إلى النسخ واسعة النط scale.
الترميز (Tokenization): تم تطوير مُرمز ترميز بايت الزوج (BPE) مخصص بحجم مفردات يبلغ 150,272، وهو مُحسّن خصيصاً للغة العربية والإنجليزية والبرمجة، مع الحفاظ على الرموز المسبوقة بمسافات الضرورية للتنسيق والدلالات.
البنية التحتية: أُجري التدريب على Condor Galaxy 1 و 2، وهي مجموعات "Cerebras Wafer-Scale" التي تضم ما يصل إلى 64 نظاماً من نوع CS-2. مكنت هذه البنية من تحقيق توسع خطي شبه مثالي، مما سمح بتدريب نموذج 70B بميزانية توكنات أقل بكثير من النماذج المماثلة.
استراتيجية البيانات والتدريب المسبق
يعتمد "جيس 2" على منهج تدريبي ذي مرحلتين:
المرحلة الأولى (التدريب المسبق): يتم تدريب النموذج على مزيج من أكثر من 600 مليار توكن عربي و1.6 تريليون توكن إجمالي. يتضمن مزيج البيانات ما يلي:
البيانات العربية: تم تجميعها من مصادر متنوعة تشمل بيانات الويب، النصوص الدينية، الشعر، الأدب، والمحتوى العلمي. ويشمل ذلك بشكل حاسم 17 نوعاً من اللهجات (مثل الدارجة المغربية، المصرية، الخليجية، الشامية) والعربيزي (العربية المكتوبة بالأحرف اللاتينية).
البيانات الإنجليزية/الويب: تم اختيارها من دراسة مقارنة لثلاث مجموعات بيانات ويب رئيسية، حيث تم اختيار المجموعة الثالثة (Corpus 3) لقدرتها الفائقة على النقل عبر اللغات إلى العربية.
الرياضيات والبرمجة: دُمجت لضمان قدرات الاستدلال والبرمجة.
نسبة المزيج: يتكون المزيج النهائي للتدريب المسبق من 28% عربية، 40% ويب، 20% رياضيات، 10% برمجة، و2% بيانات اصطناعية.
المرحلة الثانية (التلدين - Annealing): مرحلة زيادة عينات النطاق (10% من إجمالي العمليات الحسابية FLOPs) لزيادة نسبة البيانات عالية الجودة في العربية والرياضيات والويب لمعالجة نقاط الضعف المحددة بعد التدريب الأولي.
ما بعد التدريب
تتكون عملية ما بعد التدريب من ثلاث مراحل متميزة:
التدريب المسبق المستمر (CPT): مرحلتان من التدريب على بيانات عربية منسقة جديدة مع إعادة تشغيل البيانات الأصلية لصقل الخبرة في المجالات النوعية.
الضبط الدقيق للتعليمات (IFT): ثلاث مراحل باستخدام أكثر من 20 مليون زوج من (التعليمات-الإكمال). تتضمن مجموعة البيانات:
الضبط الدقيق العام (General IFT): تعليمات باللغة العربية القياسية والإنجليزية، بما في ذلك البيانات الاصطناعية للحوار متعدد الأدوار والسلامة.
الضبط الدقيق للهجات (Dialectal IFT): مجموعات بيانات محددة لـ الدارجة المغربية والعامية المصرية، تغطي الترجمة، ونقل الحروف (transliteration)، والتلخيص.
المهام الثقافية: مجموعات بيانات متخصصة لـ الشعر العربي (التوليد والتحليل)، الأسئلة والأجوبة الإسلامية (مع تنبيهات أخلاقية)، تفسير الأحلام، المطبخ العربي، والتلخيص.
محاذاة التفضيلات (Preference Alignment): يتم محاذاة النماذج باستخدام تحسين التفضيل المباشر (DPO) على أكثر من 200 ألف زوج من التفضيلات (استجابات مختارة مقابل مرفوضة) لضمان السلامة، والمساعدة، والالتزام بالقيم الإنسانية.
آليات السلامة
تتم عملية السلامة من خلال:
إعداد البيانات: تم بناء تصنيف موحد للغة المسيئة (عامة، بذيئة، خطاب كراهية) من 30 مجموعة بيانات، نتج عنها 205 ألف عينة. تم إثراء هذه العينات ببيانات IFT تفسيرية لتعليم النموذج لماذا يعتبر المحتوى مسيئاً.
سلامة الضبط الدقيق (SFT Safety): تم إنشاء مجموعة بيانات اصطناعية تضم 116 ألف زوج من الأسئلة والأجوبة تغطي 30 نوعاً من المخاطر (5 عامة، 25 إقليمية) لتوجيه النموذج في التعامل مع المواضيع السياسية والدينية والاجتماعية الحساسة الخاصة بالعالم العربي.
المساهمات الرئيسية
نماذج مفتوحة الأوزان متمحورة حول العربية: إطلاق Jais 2-8B و Jais 2-70B، واللذين تم تدريبهما من الصفر. تعد نسخة 70B من أكبر النماذج المتمحورة حول العربية والتي تم تدريبها بالكامل من الصفر.
الترسيخ الثقافي واللهجوي: على عكس النماذج السابقة التي ركزت بشكل أساسي على العربية الفصحى الحديثة، تم تدريب "جيس 2" صراحةً على 17 لهجة ومجالات ثقافية محددة (الشعر، المطبخ، تفسير الأحلام، الأسئلة والأجوبة الإسلامية)، مما يتيح محاذاة ثقافية عميقة.
تدريب فعال: يسمح استخدام مفردات مخصصة للعربية، وتقنية µP، وأجهزة Cerebras، للنماذج بتحقيق أداء قوي بميزانية توكنات أقل بكثير مقارنة بالنماذج المماثلة.
اختبارات شاملة: تقديم وتقييم نماذج على اختبارات مرتكزة ثقافياً بما في ذلك OALL2 (لوحة المتصدرين العربية المفتوحة 2)، وAraGen، واختبارات مخصصة للمطبخ والشعر وتفسير الأحلام.
النشر: إطلاق النماذج على HuggingFace بترخيص يسمح بالاستخدام التجاري، جنباً إلى جنب مع تطبيق دردشة عالي الإنتاجية (يصل إلى 2,000 توكن في الثانية) يعمل على أجهزة Cerebras.
نتائج التقييم
يظهر "جيس 2" أداءً رائداً بين النماذج المفتوحة التي تم تقييمها عبر أبعاد متعددة:
الاختيار من متعدد (OALL2): يحقق Jais 2-70B متوسطاً كلياً قدره 79.36%، متفوقاً على Llama-3.3-70B (74.23%) وQwen2.5-72B (71.20%). ويتصدر Jais 2-8B فئة ≤13B بنسبة 72.40%.
المهام التوليدية (AraGen): تحقق نماذج جيس 2 أعلى درجات 3C3H (الصحة، الاكتمال، الإيجاز، المساعدة، الأمانة، عدم الضرر) في فئاتها الحجمية، حيث سجل Jais 2-70B نسبة 70.71%.
الترجمة: يضع J-2-70B معايير جديدة (SOTA) للنماذج المفتوحة في الترجمة بين العربية الفصحى والإنجليزية ومختلف اللهجات (المصرية، التونسية، الشامية، الخليجية، إلخ)، متفوقاً على Llama-3.3-70B وQwen2.5-72B في الاتجاهين.
تحديد اللهجات: يحقق Jais 2-70B أعلى دقة في اختبارات MADAR وQADI، متفوقاً بشكل كبير على النماذج الأخرى بمقياس 70B.
الاختبارات الثقافية:
المطبخ: يحقق Jais 2-70B دقة بنسبة 79.02% في اختبار مكون من 1,597 سؤالاً، متصدراً في تحليل المكونات، والتنفيذ الإجرائي، والمنشأ الجغرافي.
الشعر: يتصدر Jais 2-70B في مهام توليد وتحليل الشعر.
القدرات الإنجليزية: رغم تركيزه العربي، يظل Jais 2-70B منافساً في الاختبارات الإنجليزية (مثل 86.09% في IFEval، و85.97% في GSM8K)، مما يثبت أن التخصص القوي في العربية لا يأتي على حساب الأداء في الإنجليزية.
الأهمية
تضع الورقة البحثية "جيس 2" كخطوة تأسيسية نحو دمقرطة الوصول إلى الذكاء الاصطناعي المتقدم للعالم الناطق بالعربية. ومن خلال توحيد النطاق، والتنوع اللغوي (الفصحى و17 لهجة)، والأمانة الثقافية، والانفتاح، يوفر "جيس 2" خطاً أساسياً شفافاً وقابلاً للتكرار للأبحاث المستقبلية. ويؤكد المؤلفون أن النموذج لم يُصمم فقط لسد الفجوة اللغوية في الذكاء الاصط العالمي، بل لدعم الجيل القادم من التطبيقات والأبحاث والابتكارات المخصصة للعربية، مما يضمن بناء تطوير الذكاء الاصطناعي الإقليمي على أسس شاملة ومرتكزة ثقافياً. إن إطلاق النماذج والبنية التحتية عالية الأداء للدردشة يهدف إلى تعزيز البحث المجتمعي والنشر العملي عبر الوطن العربي.