ModernBERT-TR: A Modern Encoder Foundation Model for Turkish
تقدم الورقة البحثية ModernBERT-TR، وهو مشفر لغة تركي بـ 150 مليون معلمة تم تدريبه مسبقاً من الصفر على 144.4 مليار رمز باستخدام بنية ModernBERT ومحلل رموز مخصص، والذي يتفوق بشكل كبير على النماذج المرجعية التركية الحالية ويضاهي النماذج الأكبر المتزامنة معه رغم تدريبه باستخدام موارد أقل بكثير.
المؤلفون الأصليون:Besher Alkurdi, Himmet Toprak Kesgin, Muzaffer Kaan Yuce, Mehmet Fatih Amasyali
تخيل الإنترنت كمكتبة ضخمة وفوضوية، حيث كُتب كل كتاب فيها بلغة مختلفة. لفترة طويلة، قام أمناء المكتبات (علماء الحاسوب) ببناء موسوعة واحدة ضخمة وشديدة الكثافة لمساعدة الحواسيب على فهم جميع اللغات في آن واحد. ولكن عندما تحاول العثور على حقيقة محددة حول لغة صغيرة ومتخصصة داخل ذلك الكتاب الضخم، تصبح المعلومات ضبابية بعض الشيء. الأمر يشبه محاولة سماع همس في ملعب مزدحم؛ حيث تضيع الإشارة وسط الضجيج.
ولإصلاح ذلك، بدأ الباحثون في بناء قواميس أصغر ومتخصصة لكل لغة على حدة. كان أشهر هذه القواميس للغة التركية قد بُني في عام 2020. لقد كانت بداية جيدة، لكنها بُنيت بأدوات قديمة، مثل دراجة هوائية بينما يقود الجميع سيارات رياضية. وفي هذه الأثناء، مضى بقية العالم نحو محركات "حديثة" يمكنها القراءة بشكل أسرع، وتذكر جملًا أطول، وفهم تعقيدات وتعرجات القواعد اللغوية بشكل أفضل بكثير. والسؤال الكبير كان: هل يمكننا بناء سيارة رياضية جديدة فائقة السرعة مخصصة للغة التركية، باستخدام هذه الأدوات الحديثة، دون الحاجة إلى ميزانية تقدر بمليار دولار أو مكتبة بحجم القمر؟
تقدم هذه الورقة البحثية ModernBERT-TR، وهو نموذج ذكاء اصطناعي جديد مصمم ليكون "العقل التركي" الأمثل للحواسيب. لقد أخذ الباحثون أحدث التصميمات المعمارية المتطورة (محرك "ModernBERT") ودربوه من الصفر باستخدام النصوص التركية فقط. لم يكتفوا بمجرد إلقاء كمية هائلة من البيانات عليه؛ بل قاموا بعناية بتنسيق مزيج متوازن من الكتابة التركية عالية الجودة واستخدموا قاموسًا مخصصًا (tokenizer) تم ضبطه خصيصًا للطريقة الفريدة التي تُبنى بها الكلمات التركية.
النتائج قوية بشكل مفاجئ. فعلى الرغم من أن هذا النموذج الجديد صغير نسبيًا — حيث يحتوي على حوالي 150 مليون "عصبون" (معلمة/parameter) — إلا أنه تفوق على نماذج أكبر بكثير، بما في ذلك بعض النماذج التي تمتلك قرابة أربعة أضعاف عدد الأعصاب. وعند اختباره على 11 مهمة تركية مختلفة، مثل رصد خطاب الكراهية أو فهم مراجعات الأفلام، سجل ModernBERT-TR متوسط 60.2%، متفوقًا على ثاني أفضل نموذج بفارق كبير. بل إنه طابق نموذجًا منافسًا تم تدريبه على ما يقرب من 7 أضعاف كمية البيانات (تريليون رمز مقابل 144.4 مليار رمز للنموذذج) في اختبار الضبط الدقيق الكامل، مما يثبت أن التدريب الذكي والبنية الأفضل يمكن أن يتفوقا على حجم البيانات الخام.
يشير المؤلفون إلى أن "الخلطة السرية" لم تكن مجرد حجم النموذج، بل جودة مزيج البيانات. فقد وجدوا أن تكرار مجموعة بيانات تركية محددة وعالية الجودة خمس مرات أثناء التدريب كان أكثر أهمية من تعديل إعدادات أخرى مثل حجم الدفعة (batch size). باختصار، لقد صنعوا آلة لغوية تركية رشيقة وفعالة تثبت أنك لست بحاجة لأن تكون الأكبر لتكون الأفضل؛ بل تحتاج فقط لأن تكون الأكثر حداثة والأكثر تركيزًا. وقد أتاحوا جميع أكوادهم والنموذج نفسه للجمهور، آملين في تقديم دفعة هائلة لأي شخص يحاول بناء تكنولوجيا تتحدث التركية.
ملخص تقني: ModernBERT-TR
بيان المشكلة
تعتمد معالجة اللغات الطبيعية (NLP) للغة التركية حاليًا على بنيات قديمة أو نماذج متعددة اللغات غير محسنة بشكل كافٍ. إن المشفر أحادي اللغة المهيمن، BERTurk (2020)، يستخدم بنية BERT التقليدية وقد تم تدريبه على مجموعة بيانات صغيرة نسبيًا (~4.5 مليار توكن). وبينما توفر النماذج متعددة اللغات (مثل mBERT وXLM-R) تغطية واسعة، إلا أنها تضعف القدرة عبر لغات عديدة، مما يحد من الأداء لكل لغة على حدة. علاوة على ذلك، فإن التطورات المعمارية الحديثة التي حسنت جودة المشفر للغة الإنجليزية بشكل كبير — مثل تضمينات الموضع الدوارة (RoPE)، ووحدات الخطية ذات البوابات (GLU)، والانتباه المحلي-العالمي المتناوب، والتدريب المعبأ بالتسلسلات — لم تُطبق بشكل منهجي على التدريب المسبق أحادي اللغة للتركية.
المنهجية
يقدم المؤلفون ModernBERT-TR، وهو نموذج مشفر بـ 150 مليون معلمة (parameter)، مبني على بنية ModernBERT ولكن تم تدريبه مسبقًا من الصفر خصيصًا للغة التركية.
البنية وتكوين التدريب
البنية: يتبع النموذج تكوين ModernBERT-base مع 22 طبقة ترانسفورمر، و768 بُعدًا خفيًا، و12 رأس انتباه. تشمل التحسينات المعمارية الرئيسية مقارنة بـ vanilla BERT ما يلي:
RoPE: تحل تضمينات الموضع الدوارة محل المواضع المطلقة المتعلمة لتحسين التعميم على أطوال التسلسل المتغيرة.
GLU: تُستخدم وحدات الخطية ذات البوابات (GLU) مع تنشيط GELU في الشبكات الأمامية (feed-forward networks).
التطبيع المسبق (Pre-normalization): يتم تطبيق تطبيع الطبقة قبل طبقات الانتباه والطبقات الأمامية لتحسين تدفق التدرج.
آلية الانتباه: يتم استخدام نافذة منزلقة مكونة من 128 توكن في معظم الطبقات، مع تطبيق انتباه عالمي كامل كل 3 طبقات للموازنة بين الكفاءة ونمذجة الاعتماد طويل المدى.
كفاءة التدريب: يستخدم النموذج Flash Attention والتدريب المعبأ بالتسلسلات (دمج المستندات ذات الأطوال المتغيرة في دفعات ثابتة الطول) للقضاء على هدر الحشو (padding).
المجزئ (Tokenizer): تم تدريب مجزئ WordPiece مخصص بحجم 50 ألف كلمة من الصفر على بيانات تركية. تم اختيار هذا الحجم للموازنة بين كفاءة الضغط وحجم جدول التضمين، محققًا كفاءة مفردات عالية مقارنة بالبدائل الأكبر (128 ألفًا).
بيانات التدريب: تتكون مجموعة البيانات من 144.4 مليار توكن (تم التدريب على مدار دورتين/epochs). البيانات عبارة عن خليط متوازن من:
FineWeb-2 Turkish: 41.2 مليار توكن (مستخرجة من الويب).
BertTurk Corpus: 6.2 مليار توكن، تم رفع عينات منها بمقدار 5 أضعاف (31.0 مليار توكن فعلي) لموازنة الخليط والاستفادة من النصوص عالية الجودة.
المعلمات الفائقة (Hyperparameters): استخدم التدريب مُحسن Decoupled StableAdamW مع معدل ذروة تعلم قدره 2×10−4، وحجم دفعة عالمي قدره 256 تسلسلاً (262 ألف توكن)، وجدول تعلم جيب التمام (cosine schedule) مع فترة إحماء قدرها 1 مليار توكن. تم تدريب النموذج على 4 وحدات معالجة رسومية من نوع NVIDIA H100 لمدة 623 ساعة من زمن المعالجة الرسومية.
دراسات الاستئصال (Ablation Studies)
أُجريت دراسات استئصال منهجية على معدل التعلم، وحجم الدفعة، والنسبة النهائية لجدول جيب التمام (αf)، وخليط البيانات. أشارت النتائج إلى أن تكوين البيانات (تحديدًا رفع عينات مجموعة BertTurk بمقدار 5 أضعاف) ومعدل التعلم كانا المحركين الأساسيين للأداء في المهام اللاحقة، بينما كان لحجم الدفعة وαf تأثير ضئيل ضمن النطاقات المختبرة.
المساهمات الرئيسية
نموذج ModernBERT-TR: أول مشفر تركي متاح للجمهور يستفيد من التطورات المعمارية لـ ModernBERT (RoP، GLU، الانتباه المتناوب، التدريب غير المعبأ بالحشو).
مجزئ مخصص: مجزئ WordPiece بحجم 50 ألفًا محسن لصرف اللغة التركية، أظهر كفاءة فائقة في المفردات.
مجموعة بيانات منسقة: مجموعة تدريب متوازنة تجمع بين FineWeb-2 وBertTurk Corpus، مع أدلة تجريبية تدعم رفع عينات البيانات عالية الجودة.
دراسات استئصال منهجية: تحديد خليط البيانات ومعدل التعلم كعوامل حاسمة لجودة التدريب المسبق أحادي اللغة للتركية.
نتائج رائدة (SOTA): تحقيق معايير جديدة في مهام معالجة اللغات الطبيعية التركية باستخدام نموذج أصغر بكثير من البدائل متعددة اللغات الرائدة.
إصدار مفتوح: إصدار عام لأوزان النموذج، والمجزئ، وكود التقييم، وتكوين التدريب.
النتائج
الاختبار الخطي للمشفر المجمد (Frozen-Encoder Linear Probing)
تم التقييم على 11 مهمة متنوعة لمعالجة اللغات الطبيعية التركية (تصنيف، انحدار، وتصنيف توكن) باستخدام بروتوكول المشفر المجمد:
الأداء العام: حقق ModernBERT-TR متوسط درجة 60.2%، متفوقًا على ثاني أفضل نموذج (Turkish-E5-large بـ 560 مليون معلمة) بنسبة 13.1% نسبية، وعلى نموذج BERTurk التقليدي بنسبة 70.3% نسبية.
الكفاءة: رغم امتلاكه حوالي 150 مليون معلمة فقط (حوالي 1/4 حجم متغيرات E5-large)، إلا أن ModernBERT-TR تفوق عليها في جميع فئات المهام.
تفاصيل المهام: تصدر النموذج في 5 من أصل 11 مهمة، بما في ذلك كشف اللغة المسيئة، وتصنيف خطاب الكراهية، والقبول اللغوي (TrCOLA)، والتعرف على الكيانات المسماة (WikiNER).
الضبط الدقيق الكامل (TabiBench)
تم التقييم على معيار TabiBench المكون من 28 مهمة باستخدام الضبط الدقيق الكامل:
سجل ModernBERT-TR درجة 77.28، مساويًا لنموذج TabiBERT (المدرب على ~1 تريليون توكن بلغات مختلطة) بفارق 0.30 نقطة فقط.
تصدر ModernBERT-TR في 5 من أصل 8 فئات مهام (تصنيف النصوص، التشابه النصي الدلالي، الاستدلال الطبيعي، الفهم الأكاديمي، واسترجاع المعلومات).
حافظ TabiBERT على تفوقه في استرجاع الأكواد البرمجية والإجابة على الأسئلة، وهو ما يُعزى إلى تضمين البيانات البرمجية والرياضية في تدريبه المسبق.
الأهمية
تثبت الورقة أن الابتكارات المعمارية الحديثة المقترنة بالتدريب المسبق أحادي اللغة المستهدف يمكن أن تنتج تمثيلات أكثر قابلية للفصل الخطي وأكثر فعالية من النماذج متعددة اللغات الأكبر، حتى عند التدريب على عدد أقل بكثير من التوكنات (144.4 مليار مقابل 1 تريليون).
يزعم المؤلفون أنه بالنسبة للتدريب المسبق أحادي اللغة محدود الموارد، فإن تنسيق وخلط البيانات بعناية (تحديدًا رفع عينات المجموعات عالية الجودة) يحقق فوائد أكبر من مجرد زيادة أحجام الدفعات أو ضبط معاملات الجداول الزمنية. ومن خلال إصدار ModernBERT-TR، يهدف المؤلفون إلى تسريع أبحاث معالجة اللغات الطبيعية للتركية، وتوفير نموذج أساسي يتفوق على المعايير الحالية بينما يتطلب 623 ساعة فقط من المعالجة الرسومية للتدريب.