Approximate Muon with low-rank adapters
تقدم هذه الورقة البحثية sMuon، وهي طريقة فعالة تقرب مُحسّن Muon لضبط المعلمات بكفاءة منخفضة الرتبة عبر خطية الهدف وحله عن طريق المربعات الصغرى، مما يتيح فوائد أداء Muon في إعدادات مثل الضبط الدقيق الموجه (SFT) والتدريب المسبق باستخدام ReLoRA حيث كان غير متوافق سابقاً مع LoRA.
البحث الأصلي مُهدى إلى الملك العام بموجب CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أنك تحاول تعليم روبوت عملاق فائق الذكاء مهارة جديدة، مثل كتابة الشعر أو حل المسائل الرياضية. أنت لا تريد إعادة تدريب عقل الروبوت بالكامل من الصفر لأن ذلك يستغرق وقتاً طويلاً ويكلف ثروة. بدلاً من ذلك، تريد إرفاق "وحدة تدريب" صغيرة وخفيفة الوزن بعقله الموجود بالفعل. يُسمى هذا الضبط الدقيق الفعال للمعلمات (PEFT). فكر في الأمر كأنك تضع سماعة رأس متخصصة على روبوت متعدد الأغراض؛ السماعة تعلمه الحيلة الجديدة دون تغيير الأجهزة الأساسية للروبوت.
إحدى الطرق الشائعة لبناء هذه السماعات هي LoRA (التكيف منخفض الرتبة). إنها تشبه بناء سماعة الرأس من ورقتين رقيقتين ومسطحتين، وعند وضعهما فوق بعضهما البعض، تشكلان شكل المهارة الجديدة. لتعليم الروبوت، نحتاج إلى مُحسِّن (optimizer) — وهو مدرب رياضي يخبر السماعة بكيفية تعديل شكلها لتصبح أفضل. المدرب الأكثر شيوعاً هو AdamW، ولكن هناك مدرب جديد وأكثر قوة يسمى Muon. يشتهر Muon بكونه فعالاً للغاية عند التدريب المسبق (تعليم الروبوت دروسه الأولى من الصفر). فهو يعمل من خلال التأكد من أن تحديثات عقل الروبوت تحدث بطريقة متوازنة تماماً و"متعامدة" (orthogonal)، مثل راقص يدور بشكل مثالي على قدم واحدة دون ترنح.
ومع ذلك، هناك مشكلة. عندما تحاول استخدام Muon لتدريب سماعة LoRA الصغيرة، تنهار الرياضيات. يريد Muon موازنة الطبقة بأكملها لعقل الروبوت، لكن سماعة LoRA ليست سوى شريحة صغيرة ومنخفضة الرتبة من تلك الطبقة. الأمر يشبه محاولة استخدام عصا قائد الأوركسترا لتوجيه عازف كمان واحد بطريقة منطقية للأوركسترا بأكملها؛ الهندسة ببساض لا تتناسب. الحل البديل القياسي كان تجاهل الأوركسترا وإخبار عازف الكمان فقط بأن يدور حول نفسه، لكن هذا يفقدنا سحر Muon. تسأل هذه الورقة البحثية: هل يمكننا إيجاد طريقة لجعل Muon يعمل مع هذه السماعات الصغيرة دون كسر الرياضيات أو إبطاء العملية؟
يقول المؤلفون، بن أنسون، كونور هوتون، وإدوارد ميلسوم، نعم. لقد قدموا طريقة جديدة تسمى sMuon (Muon الصغير). بدلاً من محاولة فرض المستحيل، استخدموا حيلة رياضية ذكية: لقد قاموا بـ "خطيّة" (linearize) المشكلة. تخيل أنك تحاول السير على حبل مشدود بينما تحمل مظلة ضخمة ومتمايلة. بدلاً من محاولة موازنة المظلة بأكملها في وقت واحد، تتظاهر بأن المظلة مجرد عصا مستقيمة للحظة وجيزة، تحسب الخطوة المثالية، ثم تعدل وضعيتك. من خلال القيام بذلك، وجدوا أفضل طريقة لتحديث سماعة LoRA التي تقرب (approximates) رقصة Muon المثالية.
وجدت الورقة أن طريقة sMuon الجديدة تعمل بشكل جيد بشكل مفاجئ. فعندما اختبروها على نماذج لغوية مختلفة، تفوق sMuon غالباً على مدرب AdamW القياسي ومحاولات Muon الأخرى. كان أداؤه مثيراً للإعجاب بشكل خاص عند استخدامه على روبوت تم تدريبه مسبقاً باستخدام Muon (يسمى Moonlight)، حيث حقق sMuon أعلى الدرجات في ست من أصل إحدى عشرة مهمة مختلفة. وفي تجربة تدريب مسبق، تساوى sMuon مع أفضل النتائج في خفض معدل الخطأ، لكنه فعل ذلك أسرع بنسبة 30% من منافسه الأقرب، وهي طريقة تسمى Riemannian.
الأهم من ذلك، يوضح المؤلفون أن طريقتهم ليست مجرد فكرة نظرية؛ بل هي عملية أيضاً. فبينما تتطلب الطرق المتقدمة الأخرى حسابات ثقيلة وبطيئة (مثل تفكيك وإعادة تجميع المصفوفات المعقدة)، يعتمد sMuon بشكل شبه كامل على عمليات ضرب المصفوفات البسيطة — وهي نوع الرياضيات التي بُنيت عليها رقائق الكمبيوتر الحديثة للعمل بسرعة البرق. وهذا يعني أن sMuon سريع بما يكفي لاستخدامه في التدريب الواقعي دون إبطاء العملية. تشير الورقة إلى أنه من خلال احترام هندسة الطبقة بأكملها بدلاً من معاملة أجزاء LoRA كقطع منفصلة وغير مرتبطة، يمكننا الحصول على دفعة كبيرة في الأداء بتكلفة إضافية ضئيلة جداً. إنه تذكير بأنه في بعض الأحيان، أفضل طريقة لتعليم روبوت عملاق حيلة جديدة هي إعطاؤه دفعة صغيرة، ذكية، وأنيقة رياضياً.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.