MONA: Muon Optimizer with Nesterov Acceleration for Scalable Language Model Training
تقدم الورقة البحثية MONA، وهو مُحسِّن مبتكر يدمج تسارع أسلوب نيستروف (Nesterov-style acceleration) في إطار عمل Muon للهروب من النهايات الصغرى المحلية الحادة وتحقيق أداء تقارب وأداء في المهام اللاحقة هو الأفضل حالياً عبر نماذج لغوية تتراوح أحجامها بين 1 مليار و68 مليار معلمة.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أنك تحاول تعليم روبوت عملاق وذكي للغاية لغة البشر. للقيام بذلك، عليك ضبط ملايين المقابض الصغيرة داخل دماغه. عملية العثور على الإعدادات المثالية لهذه المقابض تسمى "التدريب"، والأداة التي تستخدمها لتدوير تلك المقابض تسمى المُحسِّن (Optimizer).
لفترة طويلة، كانت الأداة القياسية لهذه المهمة تسمى AdamW. إنها موثوقة، مثل متنزّه حذر وثابت يخطو خطوات صغيرة ويتحقق من الخريطة باستمرار. مؤخرًا، وصلت أداة جديدة تسمى Muon. Muon تشبه متنزهاً ينظر إلى سلسلة الجبال بأكملها دفعة واحدة، حيث يعامل مجموعات المقابض كوحدة واحدة. هذا يجعل Muon أسرع وأكثر كفاءة، لكن لا تزال تعاني من عيب واحد: يمكن أن تعلق في "وادي حاد".
المشكلة: فخ الوادي الحاد
تخيل أن تضاريس عملية تعلم الروبوت هي أرض جبلية.
- الأودية المسطحة هي أماكن جيدة للاستقرار؛ فهي تعني أن الروبوت وجد حلاً مستقراً وعاماً يعمل بشكل جيد في مواقف عديدة.
- الأودية الحادة هي حفر ضيقة وعميقة. إذا سقط الروبوت فيها، فقد يبدو وكأنه وجد أدنى نقطة، لكنه في الواقع عالق في بقعة محددة للغاية وهشة. إذا تحرك قليلاً، فسوف يخرج من مكانه "المثالي" ويؤدي بشكل سيء.
يمكن لكل من AdamW وMuon أن يقعا بالخطأ في هذه الأودي الحادة ويعلقا هناك. فهما يفتقران إلى طريقة لـ "الشعور" بشكل الأرض مسبقاً لمعرفة ما إذا كانت البقعة حادة جداً.
الحل: MONA (Muon مع تسارع نيستروف)
ابتكر المؤلفون هذه الأداة الجديدة المسماة MONA. فكر في MONA كأنها Muon مزودة بـ نظارات سونار.
إليك كيف تعمل باستخدام تشبيه بسيط:
- الطريقة القديمة (Muon): تنظر Muon إلى المنحدر في المكان الذي تقف فيه تماماً وتتحرك للأسفل. هي رائعة في التحرك بكفاءة، لكنها لا تعرف ما إذا كان الطريق أمامها منحدرًا لطيفًا أم حافة منحدر خطير.
- الطريقة الجديدة (MONA): قبل أن تأخذ Muon خطوة، تنظر MONA إلى كيفية تغير المنحدر من الخطوة الأخيرة إلى الخطوة الحالية.
- إذا تغير المنحدر فجأة (مثل الاصطدام بمنحدر حاد)، تعرف MONA: "مهلاً، هذا وادي حاد! لنضغط بقوة أكبر للقفز خارج هذا المكان".
- إذا تغير المنحدر ببطء شديد (وادي مسطح ولطيف)، تقول MONA: "هذا يبدو آمنًا. لنستقر هنا".
تضيف MONA "حد تسارع" خاصاً إلى الرياضيات. فهي تحسب الفرق بين الاتجاه الحالي والاتجاه السابق. يعمل هذا الفرق كمستشعر يكتشف "حدة" التضاريس. إذا كانت التضاريس حادة، فإنها تدفع الروبوت خارج الحفرة. وإذا كانت مسطحة، فإنها تترك الروبوت يستريح.
ماذا وجدوا؟
اختبر الباحثون هذه الأداة الجديدة على ثلاثة أحجام مختلفة من النماذج اللغوية (صغيرة، متوسطة، وضخمة)، تتراوح من 1 مليار إلى 68 مليار معلمة (parameter). قاموا بتدريبها على كميات هائلة من النصوص (تصل إلى تريليون كلمة).
- تدريب أفضل: في كل اختبار، ساعدت MONA النماذج على التعلم بشكل أسرع والوصول إلى حالة نهائية أفضل من كل من المعيار القديم (AdamW) وMuon الأحدث.
- روبوتات أذكى: النماذج التي تم تدريبها باستخدام MONA كانت أفضل في المهام العامة، والمسائل الرياضية، وكتابة الأكواد البرمجية. على سبيل المثال، في نموذج بـ 68 مليار معلمة، حققت MONA أفضل النتائج في اختبارات الرياضيات والبرمجة.
- الضبط الدقيق (Fine-Tuning): حتى بعد التدريب الأولي، عندما أعطوا النماذج تدريباً إضافياً متخصصاً (مثل تعليمهم كتابة الكود برمجياً بشكل محدد)، كانت النماذج التي بدأت بـ MONA تؤدي بشكل أفضل من تلك التي بدأت بـ Muon.
جعل الأمر عملياً (MONA-Lite)
أدرك المؤلفون أيضاً أن إضافة نظام "السونار" هذا يستهلك قدراً أكبر من ذاكرة الكمبيوتر. ولحل هذه المشكلة، أنشأوا نسخة أخف وزناً تسمى MONA-Lite.
- استخدموا حيلة لضغط بيانات الذاكرة (مثل الانتقال من فيديو عالي الدقة إلى دقة قياسية) وطريقة لحساب تغيرات المنحدر أثناء التشغيل دون تخزين ملفات إضافية.
- أدى ذلك إلى تقليل الذاكرة الإضافية المطلوبة بنسبة 75% تقريباً، مما يجعل من السهل استخدامها حتى على أجهزة الكمبيوتر ذات الذاكرة المحدودة، دون فقدان الفوائد.
الملخص
باختصار، MONA هي ترقية للمُحسِّن Muon. فهي تحافظ على سرعة وكفاءة Muon ولكنها تضيف "مستشعر انحناء" يساعد الذكاء الاصطناعي على تجنب العلوق في النقاط السيئة والحادة أثناء التعلم. ينتج عن ذلك نماذج لغوية أذكى وأكثر قدرة، وهي أفضل في الرياضيات والبرمجة والاستنتاج العام، وكل ذلك مع كونها فعالة بما يكفي للعمل على الأجهزة القياسية.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.