The Gaussian Is Enough: Flow-Matching Priors Do Not Help When Fine-Tuning Large Behavior Models
تُثبت هذه الورقة أنه، خلافاً للتوقعات، فإن استبدال التوزيعات المسبقة الغاوسية القياسية ببدائل غير غاوسية لا يؤدي إلى تحسين أداء الضبط الدقيق لنماذج السلوك الكبيرة سابقة التدريب عبر اختبارات محاكاة وأجهزة واسعة النطاق، حيث تهيمن ديناميكيات تدريب المشفر على اختيار التوزيع المسبق.
تتعلم الروبوتات التحرك بنوع جديد من الذكاء، يحاكي الطريقة التي يتعلم بها البشر عن طريق المشاهدة. فبدلاً من برمجتها بقواعد جامدة لكل موقف محتمل، تستخدم هذه الآلات نماذج توليدية للتنبؤ بأفضل خطوة تالية بناءً على ما تراه وتسمعه. تخيل ذراعاً روبوتية تحاول صب الخضروات من وعاء صغير إلى حاوية كبيرة؛ فهي لا تحسب مساراً مثالياً مسبقاً، بل تبدأ بتخمين عشوائي وتقوم بتحسين هذا التخمين تدريجياً حتى تجد حركة سلسة وناجحة. تعتمد هذه العملية على نقطة انطلاق، وهي أساس من العشوائية يبدأ منه الروبوت بحثه عن الإجراء الصحيح. لسنوات طويلة، استخدم المهندسون شكلاً قياسياً وبسيطاً من العشوائية كنقطة انطلاق هذه، تماماً مثل لوحة بيضاء فارغة. ومع ذلك، اقترح بحث حديث أنه إذا كان بإمكانك البدء بتخمين قريب نوعاً ما من الحل، فإن الروبوت سيتعلم بشكل أسرع ويؤدي بشكل أفضل. وقد أثارت هذه الفكرة خطاً جديداً من التفكير: ماذا لو استطعنا تعليم الروبوت أن يبدأ بتخمين أكثر ذكاءً؟
قام فريق من الباحثين في معهد تويوتا للأبحاث، بالتعاون مع زملاء من "Woven by Toyota" وجامعة كورنيل، باختبار هذه الفكرة على جيل جديد من نماذج الروبوتات الضخمة. هذه النماذج، المعروفة باسم "نماذج السلوك الكبيرة" (Large Behavior Models)، تشبه مكتبات ضخمة لمهارات الحركة التي تم تدريبها مسبقاً على آلاف الساعات من البيانات المتنوعة للروبوتات. الطريقة القياسية لاستخدام هذه النماذج هي أخذ هذه المكتبة المدربة مسبقاً وضبطها بدقة (fine-tuning) لمهمة جديدة محددة، مثل فتح خزانة أو تجميع قطعة ما. وقد طرح الباحثون سؤالاً بسيطاً ولكنه عميق: إذا استبدلوا نقطة الانطلاق القياسية البسيطة بنقطة انطلاق أكثر تعقيداً و"ذكاءً" مستمدة من معرفة الروبوت المدربة مسبقاً، فهل ستصبح عملية الضبط الدقيق أكثر فعالية؟ بدا من المنطقي أن البدء بقرب أكبر من الهدف سيساعد الروبوت على الوصول إليه بشكل أسرع. ولإيجاد الإجابة، أجروا أكثر من مائة ألف محاكاة عبر أربعين مهمة مختلفة، واختبروا نتائجهم على أجهزة روبوتية حقيقية في مختبر، مراقبين كيفية أداء هذه الآلات فعلياً.
كانت النتائج مفاجئة ومناقضة للمنطق. فقد اكتشف الباحثون أن استخدام نقطة انطلاق أكثر ذكاءً ومعلوماتية لم يساعد الروبوتات على تعلم المهام الجديدة بشكل أفضل. في الواقع، في كثير من الحالات، أدى الروبوتات أداءً مساوياً، أو حتى أسوأ قليلاً، عند استخدام نقاط الانطلاق المعقدة مقارنة بنقطة الانطلاق البسيطة والقياسية. وقد ظل هذا الأمر ثابتاً سواء كانوا يختبرون في عمليات محاكاة حاسوبية أو على أذرع روبوتية فيزيائية تحرك أشياء حقيقية. اختبر الفريق ذلك عبر ثلاثة أنواع مختلفة من نماذج الروبوتات الكبيرة ووجدوا نفس النمط في كل مكان. الحالة الوحيدة التي أظهرت فيها نقطة الانطلاق الأذكى ميزة واضحة كانت عندما أُعطيت الروبوتات كمية ضئيلة جداً من بيانات التدريب؛ كمية قليلة جداً لدرجة أن الروبوت لم يكن لديه شيء تقريباً ليتعلمه. في هذا السيناريو المحدد، المفتقر للبيانات، قدم التخمين المستند إلى المعلومات دفعة مساعدة. ولكن بالنسبة للغالبية العظمى من المواقف، حيث يمتلك الروبوت أمثلة كافية للتعلم منها، لم يشكل تعقيد نقطة الانطلاق أي فرق في النتيجة النهائية.
لفهم سبب حدوث ذلك، نظر الباحثون في أعماق "دماغ" الروبوت أثناء عملية التعلم. ووجدوا أنه بينما بدأت الروبوتات بتخمينات مختلفة، إلا أنها انتهت جميعاً بتقديم نفس التنبؤات لكيفية الحركة. إن الجزء الذي يعالج فيه الروبوت ما يراه —المُشفّر البصري (visual encoder)— تغير بشكل كبير أثناء عملية الضبط الدقيق، بغض النظر عن نقطة الانطلاق المستخدمة. كان هذا الجزء المعالج للصور هو الذي حدد مدى جودة تعلم الروبوت. ووجد الباحثون أن جودة المعالجة البصرية كانت العامل المهيمن في النجاح. فإذا تم تدريب الجزء البصري جيداً، ينجح الروبوت، بغض النظر عن نقطة البداية. وإذا لم يتم تدريب الجزء البصري جيداً، يعاني الروبوت، حتى لو بدأ بتخمين مثالي. وهذا يشير إلى أن نقطة الانطلاق تؤثر على كيفية تحول التمثيلات الداخلية للروبوت أثناء التعلم، لكنها لا تغير الجودة النهائية لأداء الروبوت.
تقدم هذه النتائج اتجاهاً واضحاً لمستقبل تطوير الروبوتات. فهي تشير إلى أن المهندسين ليسوا بحاجة لقضاء الوقت وقدرات الحوسبة في تصميم نقاط انطلاق معقدة ومخصصة لهذه النماذج الكبيرة؛ إذ إن النهج القياسي البسيط كافٍ وفعال. بدلاً من ذلك، يجب أن يظل التركيز منصباً على ضمان أن تكون قدرة الروبوت على رؤية وفهم العالم قوية ومدربة جيداً. تؤكد هذه الدراسة أنه بالنسبة لنماذج الروبوتات الكبيرة المدربة مسبقاً، فإن الرحلة تهم أقل من الوجهة، وأن الجزء الأهم من الرحلة هو قدرة الروبوت على تفسير ما يراه، وليس التخمين العشوائي الذي يضعه قبل أن يبدأ.
ملخص تقني: التوزيع الغاوسي كافٍ لضبط النماذج السلوكية الدقيقة
بيان المشكلة تعتمد التعلم بالتقليد في الروبوتات الحديثة بشكل متزايد على السياسات التوليدية القائمة على نماذج الانتشار (diffusion) أو مطابقة التدفق (flow-matching). تولد هذه النماذج الأفعال عن طريق نقل العينات من توزيع سابق p0 إلى توزيع الفعل المستهدف المشروط بالملاحظات. وبينما أظهرت الأعمال الحديثة أن استبدال التوزيع الغاوسي المتماثل (isotropic Gaussian) القياسي بتوزيع سابق غير غاوسي، يكون "أقرب إلى الهدف"، يحسن الأداء بشكل كبير عند تدريب السياسات من الصفر، إلا أنه لا يزال من غير المعروف ما إذا كانت هذه الفوائد تنتقل إلى عملية الضبط الدقيق (fine-tuning) للنماذج السلوكية الكبيرة (LBMs) سابقة التدريب. وتكون هذه النماذج، مثل LBM 1.0 وπ0.5 وGR00T N1.5، مدربة مسبقاً عادةً على بيانات متنوعة ثم يتم ضبطها بدقة لمهام محددة. السؤال المركزي الذي تعالجه الدراسة هو: هل يؤدي بدء عملية الضبط الدقيق باستخدام توزيع سابق غير غاوسي ومعلوم (على سبيل المثال، الأفعال المستمدة من النموذج السلوكي الكبير السابق التدريب نفسه) إلى أداء أفضل مقارنة بالتوزيع الغاوسي القياسي؟
المنهجية أجرى المؤلفون دراسة تجريبية واسعة النطاق شملت أكثر من 100,000 تجربة محاكاة عبر أكثر من 40 مهمة في منصتين للمحاكاة (LBM Eval وRoboCasa365)، و1,250 تجربة على الأجهزة (hardware) لخمس مهام تلاعب ثنائية اليد.
متغيرات التوزيع السابق (Prior Variants): قارنت الدراسة سبعة بناءات مختلفة للتوزيع السابق:
الأساس القياسي: توزيع غاوسي متماثل Z∼N(0,I).
التوزيعات المقترحة (المستمدة من النموذج السلوكي الكبير السابق التدريب πpre):
Apre: الأفعال المولدة بواسطة نسخة مجمدة من السياسة سابقة التدريب (بعد إزالة الضجيج جزئياً).
Apre+σAZ: Apre مع إضافة ضجيج غاوسي في فضاء الأفعال.
Epre+σEZ: تضمينات المشفّر (encoder embeddings) سابقة التدريب مع إضافة ضجيج غاوسي، تُستخدم لتوليد الأفعال.
الأسس المرجعية في الأدبيات: Cocos (توزيع غاوسي يعتمد على الحالة)، وBRIDGER (توزيع سابق قائم على CVAE)، وRetrieval (توزيع سابق قائم على k-NN).
الإعدادات التجريبية:
الإعداد (أ): مقارنة محكومة باستخدام توزيع سابق قوي اصطناعياً (نقطة تفتيش تم ضبطها بدقة على 50% من البيانات) لضمان أن التوزيع السابق كان أقرب بشكل ملموس إلى الهدف في مسافة ℓ2.
الإعداد (ب) (المحاكاة والواقع): ضبط دقيق لنموذج LBM 1.0 عبر كسور بيانات متفاوتة (من 5% إلى 100%) في المحاكاة وعلى أجهزة فعلية (أذرع Franka FR3).
الإعداد (ج): التحقق عبر بنيات LBM مختلفة (π0.5 وGR00T N1.5) على معيار RoboCasa.
التحليل والتشخيص:
مقاييس الأداء: معدلات النجاح وتقدم المهمة الجزئي، مع التقييم باستخدام اختبارات إحصائية صارمة (إطار STEP للنتائج الثنائية، واختبار Welch's t-test للمقاييس المستمرة، مع تصحيح Bonferroni).
المقاييس الاستبطانية: LogME (جودة الميزات بدون تدريب)، ومسافة ℓ2 لكل ملاحظة، وتشابه جيب التمام (cosine similarity) في كل من فضاء الأفعال وفضاء التضمينات.
الدراسة الاستبعادية (Ablation): تم إجراء دراسة استبعادية لمعدل التعلم لعزل تأثير تدريب المشفّر مقابل اختيار التوزيع السابق.
النتائج الرئيسية تجد الدراسة باستمرار أن التوزيعات السابقة غير الغاوسية، حتى تلك التي تكون أقرب بشكل مبرهن إلى التوزيع المستهدف، لا تحسن أداء الضبط الدقيق مقارنة بالتوزيع الغاوسي القياسي.
تكافؤ الأداء: عبر جميع البنيات، وكسور البيانات (باستثناء حالة واحدة منخفضة البيانات)، والبيئات (المحاكاة والأجهزة)، كانت معدلات نجاح السياسات التي تم ضبطها بدقة باستخدام توزيعات سابقة غير غاوسية متماثلة إحصائياً، أو أحياناً أسوأ، من تلك التي تم ضبطها باستخدام توزيع غاوسي.
مفارقة التوزيع "الأقرب": في الإعداد (أ)، كان التوزيع السابق غير الغاوسي Apre أقرب بـ 3 أضعاف إلى أفعال الهدف مقارنة بالتوزيع الغاوسي. وبينما حقق هذا نتائج كبيرة عند التدريب من الصفر، إلا أنه لم يقدم أي ميزة أثناء الضبط الدقيق.
استثناء البيانات المنخفضة: لوحظت فائدة هامشية فقط في نظام البيانات المنخفضة جداً (5% من العروض التوضيحية، حوالي 10-20 مثالاً) حيث تفوق توزيع "الارتجاج في فضاء التضمين" (Epre+σEZ) على التوزيع الغاوسي.
التعميم المعماري: ظلت النتيجة السلبية صحيحة لـ LBM 1.0 وπ0.5 وGR00T N1.5.
النتائج التشخيصية: لماذا لا تهم التوزيعات السابقة؟ يقدم المؤلفون تفسيراً آلياً لهذه الظاهرة من خلال ثلاثة تشخيصات:
جودة الميزات: تنتج المشفّرات التي تم ضبطها بدقة ميزات ذات قدرة تنبؤية متساوية (مقاسة بـ LogME) بغض النظر عن التوزيع السابق المستخدم.
تقارب الأفعال: تتقارب تنبؤات الأفعال بعد الضبط الدقيق إلى مسافات مماثلة من الحقيقة الأرضية (ground truth) عبر جميع التوزيعات السابقة.
تباعد التمثيل: رغم تشابه المخرجات، تتباعد التمثيلات الداخلية بشكل كبير. يتسبب التوزيع الغاوسي في تغيير المشفّر بأقل قدر ممكن من حالته السابقة، بينما تجبر التوزيعات غير الغاوسية (خاصة Apre) المشفّر على إعادة الهيكلة بشكل جوهري للتعويض عن التوزيع السابق المزاح.
العامل المهيمن: أكدت الدراسة الاستبعادية لمعدل التعلم أن جودة مشفّر الملاحظات هي العامل المهيمن في الأداء. أدى تقليل معدل تعلم المشفّر إلى انخفاض هائل في معدلات النجاح (15-17%)، في حين كان تغيير التوزيع السابق ضمن نظام معدل تعلم ثابت ذا تأثير ضئيل.
الأهمية والادعاءات تخلص الورقة إلى أنه بالنسبة للضبط الدقيق للنماذج السلوكية الكبيرة، فإن التوزيع الغاوسي القياسي هو خيار كافٍ ومدعوم جيداً. وتتحدى الدراسة الحدس القائل بأن وجود توزيع سابق "أقرب" يسهل الضبط الدقيق عن طريق تقليل مسافة النقل في فضاء الأفعال. بدلاً من ذلك، تشير النتائج إلى أن:
المشفّر سابق التدريب هو المحرك الأساسي لنجاح الضبط الدقيق.
يؤثر اختيار التوزيع السابق على مسار التحسين ودرجة إعادة هيكلة المشفّر، لكنه لا يؤثر على أداء السياسة النهائي.
تنفيذ توزيعات سابقة معقدة ومتعلمة يضيف أعباء هندسية دون فوائد ملموسة في نظام الضبط الدقيق.
يضع المؤلفون هذا العمل كأول دراسة واسعة النطاق للتوزيعات السابقة غير الغاوسية للضبط الدقيق لنماذج LBM، مقدمين نتيجة سلبية توجه الأبحاث المستقبلية نحو فهم ديناميكيات تعلم المشفّر والظروف التي قد تظل فيها التوزيعات السابقة ذات أهمية (مثل نظام البيانات المنخفضة جداً).