← أحدث الأبحاث
💻 computer science

ModernBERT-TR: A Modern Encoder Foundation Model for Turkish

تقدم الورقة البحثية ModernBERT-TR، وهو مشفر لغة تركي بـ 150 مليون معلمة تم تدريبه مسبقاً من الصفر على 144.4 مليار رمز باستخدام بنية ModernBERT ومحلل رموز مخصص، والذي يتفوق بشكل كبير على النماذج المرجعية التركية الحالية ويضاهي النماذج الأكبر المتزامنة معه رغم تدريبه باستخدام موارد أقل بكثير.

المؤلفون الأصليون: Besher Alkurdi, Himmet Toprak Kesgin, Muzaffer Kaan Yuce, Mehmet Fatih Amasyali

نُشر 2026-07-29
📖 3 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Besher Alkurdi, Himmet Toprak Kesgin, Muzaffer Kaan Yuce, Mehmet Fatih Amasyali

البحث الأصلي مرخَّص بموجب CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل الإنترنت كمكتبة ضخمة وفوضوية، حيث كُتب كل كتاب فيها بلغة مختلفة. لفترة طويلة، قام أمناء المكتبات (علماء الحاسوب) ببناء موسوعة واحدة ضخمة وشديدة الكثافة لمساعدة الحواسيب على فهم جميع اللغات في آن واحد. ولكن عندما تحاول العثور على حقيقة محددة حول لغة صغيرة ومتخصصة داخل ذلك الكتاب الضخم، تصبح المعلومات ضبابية بعض الشيء. الأمر يشبه محاولة سماع همس في ملعب مزدحم؛ حيث تضيع الإشارة وسط الضجيج.

ولإصلاح ذلك، بدأ الباحثون في بناء قواميس أصغر ومتخصصة لكل لغة على حدة. كان أشهر هذه القواميس للغة التركية قد بُني في عام 2020. لقد كانت بداية جيدة، لكنها بُنيت بأدوات قديمة، مثل دراجة هوائية بينما يقود الجميع سيارات رياضية. وفي هذه الأثناء، مضى بقية العالم نحو محركات "حديثة" يمكنها القراءة بشكل أسرع، وتذكر جملًا أطول، وفهم تعقيدات وتعرجات القواعد اللغوية بشكل أفضل بكثير. والسؤال الكبير كان: هل يمكننا بناء سيارة رياضية جديدة فائقة السرعة مخصصة للغة التركية، باستخدام هذه الأدوات الحديثة، دون الحاجة إلى ميزانية تقدر بمليار دولار أو مكتبة بحجم القمر؟

تقدم هذه الورقة البحثية ModernBERT-TR، وهو نموذج ذكاء اصطناعي جديد مصمم ليكون "العقل التركي" الأمثل للحواسيب. لقد أخذ الباحثون أحدث التصميمات المعمارية المتطورة (محرك "ModernBERT") ودربوه من الصفر باستخدام النصوص التركية فقط. لم يكتفوا بمجرد إلقاء كمية هائلة من البيانات عليه؛ بل قاموا بعناية بتنسيق مزيج متوازن من الكتابة التركية عالية الجودة واستخدموا قاموسًا مخصصًا (tokenizer) تم ضبطه خصيصًا للطريقة الفريدة التي تُبنى بها الكلمات التركية.

النتائج قوية بشكل مفاجئ. فعلى الرغم من أن هذا النموذج الجديد صغير نسبيًا — حيث يحتوي على حوالي 150 مليون "عصبون" (معلمة/parameter) — إلا أنه تفوق على نماذج أكبر بكثير، بما في ذلك بعض النماذج التي تمتلك قرابة أربعة أضعاف عدد الأعصاب. وعند اختباره على 11 مهمة تركية مختلفة، مثل رصد خطاب الكراهية أو فهم مراجعات الأفلام، سجل ModernBERT-TR متوسط 60.2%، متفوقًا على ثاني أفضل نموذج بفارق كبير. بل إنه طابق نموذجًا منافسًا تم تدريبه على ما يقرب من 7 أضعاف كمية البيانات (تريليون رمز مقابل 144.4 مليار رمز للنموذذج) في اختبار الضبط الدقيق الكامل، مما يثبت أن التدريب الذكي والبنية الأفضل يمكن أن يتفوقا على حجم البيانات الخام.

يشير المؤلفون إلى أن "الخلطة السرية" لم تكن مجرد حجم النموذج، بل جودة مزيج البيانات. فقد وجدوا أن تكرار مجموعة بيانات تركية محددة وعالية الجودة خمس مرات أثناء التدريب كان أكثر أهمية من تعديل إعدادات أخرى مثل حجم الدفعة (batch size). باختصار، لقد صنعوا آلة لغوية تركية رشيقة وفعالة تثبت أنك لست بحاجة لأن تكون الأكبر لتكون الأفضل؛ بل تحتاج فقط لأن تكون الأكثر حداثة والأكثر تركيزًا. وقد أتاحوا جميع أكوادهم والنموذج نفسه للجمهور، آملين في تقديم دفعة هائلة لأي شخص يحاول بناء تكنولوجيا تتحدث التركية.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →