Towards Bridging the Gap between Large-Scale Pretraining and Efficient Finetuning for Humanoid Control
تقترح هذه الورقة إطار عمل هجين يستفيد من التدريب المسبق لـ "ساك" (Soft Actor-Critic) واسع النطاق وعالي الـ UTD من أجل حركة بشرية قوية بأسلوب الصفر-خطوة (zero-shot)، ويجمع ذلك مع استراتيجية ضبط دقيق قائمة على النموذج وآمنة تحصر الاستكشاف العشوائي ضمن نموذج عالم مستند إلى الفيزياء، مما يجسّر الفجوة بفعالية بين المحاكاة واسعة النطاق والتكيف الفعال في العالم الحقيقي.
المؤلفون الأصليون:Weidong Huang, Zhehan Li, Hangxin Liu, Biao Hou, Yao Su, Jingwen Zhang
إليك شرح لورقة البحث بعنوان "نحو سد الفجوة بين التدريب المسبق واسع النطاق والضبط الدقيق الفعال للتحكم في الروبوتات البشرية" (LIFT)، مترجمة إلى لغة بسيطة وعملية مع استخدام تشبيهات إبداعية.
الصورة الكبيرة: الروبوت "الطالب المتفوق"
تخيل أنك تريد تعليم روبوت كيف يمشي مثل البشر.
المشكلة: إذا علمته فقط من خلال تركه يجرب ويفشل في العالم الحقيقي، فسوف يسقط كثيراً، وتتحطم أرجله، ويستغرق سنوات ليتعلم.
الطريقة القديمة: يستخدم معظم الباحثين طريقة تسمى PPO. فكر في هذا كطالب بارع في حفظ كتاب مدرسي معين (المحاكاة)، ولكنه يصاب بالارتباك بمجرد أن يطرح المعلم سؤالاً مختلفاً قليلاً (بيئة جديدة). هم سريعون في تعلم الأساسيات ولكنهم سيئون في التكيف.
الطريقة الجديدة (LIFT): يقترح المؤلفون إطار عمل جديد يسمى LIFT (التدريب المسبق واسع النطاق والضبط الدقيق الفعال). إنه يشبه توظيف معلم عبقري يقوم أولاً بتدريب الطالب في صالة ألعاب رياضية افتراضية ضخمة وفوضوية، ثم يستخدم "كرة بلورية" للممارسة الآمنة لبعض الحركات الجديدة قبل أن يخطو الطالب على المسرح الحقيقي.
الرحلة ذات المراحل الثلاث
تصف الورقة عملية مكونة من ثلاث خطوات لجعل الروبوتات قوية وقادرة على التكيف.
المرحلة 1: "صالة الألعاب الرياضية الافتراضية" (التدريب المسبق واسع النطاق)
التشبيه: تخيل لاعب جمباز يتدرب في لعبة فيديو حيث يمكنه تشغيل 1,000 محاكاة في وقت واحد. يمكنه السقوط، والنهوض، والمحاولة مرة أخرى في أجزاء من الثانية.
ماذا فعلوا: بدلاً من استخدام خوارزمية "PPO" القياسية، استخدموا خوارزمية مختلفة تسمى SAC.
السحر: قاموا بتشغيل هذا على شريحة كمبيوتر واحدة قوية (NVIDIA RTX 4090) مع آلاف الروبوتات الافتراضية التي تعمل بالتوازي.
النتيجة: تعلم الروبوت المشي في المحاكاة بشكل جيد جداً لدرجة أنه عندما وضعوه على روبوت حقيقي (Booster T1)، استطاع المشي على العشب، والتلال، والطين دون أي تدريب إضافي. وهذا ما يسمى "النشر الصفري" (Zero-shot deployment). إنه يشبه نجاح طالب في اختبار قيادة سيارة حقيقية مباشرة بعد ممارسته فقط في جهاز المحاكاة.
المرحلة 2: بناء "الكرة البلورية" (التدريب المسبق لنموذج العالم)
التشبيه: الآن، تخيل أنك تريد تعليم لاعب الجمباز هذا حركة جديدة، مثل المشي على حبل مشدود. لا يمكنك جعله يتدرب على الحبل الحقيقي؛ فقد يسقط ويتعرض للأذى.
الحل: تقوم ببناء "كرة بلورية" (نموذج عالم مدعوم بالفيزياء). هذا ليس مجرد تخمين عشوائي؛ إنه نموذج حاسوبي يفهم قوانين الفيزياء (الجاذبية، الزخم، زوايا المفاصل).
كيف يعمل: يستخدم الروبوت البيانات من المرحلة 1 لتعليم هذه "الكرة البلورية" كيف يعمل العالم. تتعلم الكرة البلورية التنبؤ بـ: "إذا حركت ساقي بهذه الطريقة، فسأسقط. إذا حركتها بتلك الطريقة، فسأحافظ على توازني".
لماذا هو مميز: على عكس النماذج الأخرى التي هي مجرد "صناديق سوداء" تخمن الأنماط، فإن هذا النموذج يحتوي على الفيزياء المدمجة فيه. هو يعرف أنه إذا مِلت كثيراً، فسوف تسقط. هذا يجعله أكثر دقة وأماناً.
المرحلة 3: "صندوق الرمل الآمن" (الضبط الدقيق الفعال)
التشبية: هذا هو الجزء الأكثر أهمية. الآن يحتاج الروبوت لتعلم المشي في بيئة جديدة (مثل أرضية زلقة أو سرعة جديدة).
الخطر: إذا حاول الروبوت التعلم عن طريق تحريك ذراعيه بشكل عشوائي في العالم الحقيقي، فسوف يصطدم.
استراتيجية LIFT:
العالم الحقيقي: يمشي الروبوت في العالم الحقيقي، لكنه يفعل فقط ما هو متأكد منه بنسبة 100%. يعمل كأنه روبوت في وضع الطيار الآلي، لا يقوم بأي تخمينات خطيرة. هو فقط يجمع البيانات.
العالم الافتراضي: يأخذ الروبوت تلك البيانات ويعود إلى الكرة البلورية. داخل الكرة البلورية، يُسمح له بأن يكون مجنوناً، جامحاً، وتجريبياً. يحاول القيام بحركات خطيرة، ويسقط، ويتعلم من أخطائه داخل المحاكاة.
الفائدة: يتعلم الروبوت مهارات جديدة بسرعة فائقة (كفاءة العينة) دون المخاطرة أبداً بوقوع حادث في العالم الحقيقي. إنه يشبه ممارسة حركة بهلوانية خطيرة في لعبة فيديو حتى تتقنها، ثم القيام بها مرة واحدة في الحياة الواقعية بإتقان تام.
لماذا يعد هذا أمراً هاماً؟
الأمان: الروبوتات البشرية هشة. إذا سقطت، ستتحطم. نظام LIFT يبقي "التجارب الخطيرة" داخل الكمبيوتر (الكرة البلورية) ويبقي الروبوت الحقيقي آمناً.
السرعة: الطرق التقليدية تستغرق أياماً أو أسابيع للتكيف مع مهمة جديدة. LIFT يمكنه التكيف في دقائق لأن "الكرة البلورية" ذكية جداً.
تعدد الاستخدامات: اختبروا هذا على روبوتين مختلفين (Booster T1 و Unitree G1) ونجح الأمر مع كليهما. حتى أنهم أظهروا قدرته على تعلم المشي في التضاريس الوعرة وبسرعات مختلفة دون البدء من الصصفر.
"ورقة الغش" الملخصة
المفهوم
الشرح البسيط
التشبيه
PPO (الطريقة القديمة)
جيد في الحفظ، سيئ في التكيف.
طالب يدرس بجد ولكنه يصاب بالذعر عندما تتغير أسئلة الاختبار.
SAC (القاعدة الجديدة)
يتعلم من أخطائه الماضية بكفاءة.
طالب يتعلم من كل إجابة خاطئة فوراً.
نموذج العالم (World Model)
محاكي يعرف قوانين الفيزياء.
كرة بلورية تتنبأ بالمستقبل بناءً على قوانين الطبيعة.
التنفيذ الحتمي (Deterministic Execution)
فعل ما تعرف أنه آمن فقط.
المشي على حبل مشدود وأنت مغمض العينين، تتحرك فقط عندما تكون متأكداً.
الاستكشاف العشوائي (Stochastic Exploration)
تجربة أشياء عشوائية وخطيرة.
داخل الكرة البلورية، يمكنك القفز من المنحدر لترى ماذا سيحدث، لأنك لن تتأذى هناك.
الخلاصة
بنى المؤلفون نظاماً يجمع بين سرعة المحاكاة الضخمة وأمان التنبؤ القائم على الفيزياء. يتيح ذلك للروبوتات تعلم مهارات معقدة في صندوق رمل افتراضي ثم تطبيقها بأمان في العالم الحقيقي، مما يسد الفجوة بين "التدريب في المختبر" و"العمل في العالم الحقيقي".
إليك ملخص تقني مفصل لورقة البحث بعنوان "نحو سد الفجوة بين التدريب المسبق واسع النطاق والضبط الدقيق الفعال للتحكم في الروبوتات البشرية" (LIFT)، المنشورة في ICLR 2026.
1. بيان المشكلة
يواجه التحكم في الروبوتات البشرية مقايضة حرجة بين سرعة التدريب وكفاءة العينات:
الأساليب القائمة على السياسة (مثل PPO): رغم قوتها وقدرتها على النشر عبر الصفر (zero-shot deployment) من خلال المحاكاة المتوازية الضخمة (مثل IsaacGym وMuJoCo Playground)، إلا أنها تعاني من انخفاض كفاءة العينات. فهي تتخلص من البيانات خارج السياسة (off-policy)، مما يجعل التكيف مع البيئات أو المهام الجديدة يتطلب كميات هائلة من البيانات ويستغرق وقتاً طويلاً.
الأساليب القائمة على النموذج والأساليب خارج السياسة: توفر خوارزميات مثل SAC أو التعلم المعزز القائم على النموذج (MBPO) كفاءة أفضل في العينات، لكنها غالباً ما تواجه صعوبة في التدريب المسبق واسع النطاق. تطبيق هذه الأساليب مباشرة على الروبوتات البشرية يعد أمراً محفوفاً بالمخاطر بسبب الاستكشاف العشوائي الذي قد يؤدي للسقوط، كما أن تدريبها من الصفر مكلف حوسبياً ومعرض للوقوع في النهايات الصغرى المحلية (local minima).
الفجوة: هناك نقص في إطار عمل موحد يستفيد من كفاءة وقت التنفيذ (wall-clock efficiency) للتدريب المسبق واسع النطاق (مثل PPO) مع الاحتفاظ بكفاءة العينات والأمان للضبط الدقيق القائم على النموذج في البيئات الجديدة.
2. المنهجية: إطار عمل LIFT
يقترح المؤلفون LIFT (التدريب المسبق واسع النطاق والضبط الدقيق الفعال)، وهو مسار مكون من ثلاث مراحل مصمم لسد هذه الفجوة.
المرحلة الأولى: التدريب المسبق للسياسة واسع النطاق
الخوارزمية: تستخدم Soft Actor-Critic (SAC)، وهي خوارزمية خارج السياسة (off-policy)، تم تنفيذها باستخدام JAX لتحقيق توازي ضخم.
التنفيذ:
تعمل على آلاف البيئات المتجهة على وحدة معالجة رسومية واحدة (NVIDIA RTX 4090).
تستخدم تحديثات الدفعات الكبيرة ونسبة عالية من التحديث إلى البيانات (UTD) (تصل إلى 10) لإعادة استخدام الخبرة بقوة دون الحاجة لمثبتات مساعدة.
توظف التعميم في النطاق (Domain Randomization) لضمان المتانة.
تستخدم إعداد (asymmetric actor-critic) حيث يستخدم الممثل (actor) الحالات الحسية الخاصة (proprioceptive states)، بينما يمكن للنقاد (critics) استخدام حالات مميزة (رغم أن الورقة تشير إلى استخدامهم للحالات الحسية الخاصة لكليهما في التنفيذ النهائي).
النتيجة: تحقق تقارباً قوياً في أقل من 30 دقيقة (بعد ضبط المعلمات الفائقة) وتسمح بـ النشر عبر الصفر (zero-shot deployment) للروبوتات البشرية الحقيقية (Booster T1) في التضاريس الخارجية.
المرحلة الثانية: التدريب المسبق لنموذج العالم المستند إلى الفيزياء
التدريب خارج الإنترنت (Offline Training): بدلاً من التدريب عبر الإنترنت (الذي يبطئ المحاكاة المتوازية)، يتم تدريب نموذج العالم خارج الإنترنت على بيانات الانتقال المسجلة خلال المرحلة الأولى.
البنية: شبكة عصبية هجينة مستندة إلى الفيزياء:
القاعدة: تستخدم ديناميكيات الأجسام الصلبة القابلة للتفاضل (معادلات لاغرانج) عبر محرك Brax لنمذجة الديناميكيات المعروفة (الكتلة، كوريوليس، الجاذبية).
متنبئ البواقي (Residual Predictor): تتنبأ شبكة عصبية بـ البواقي (عدم اليقين) مثل قوى التلامس وعزوم الدوران المبددة (τte) التي لا يستطيع نموذج الجسم الصلب التقاطها.
تقدير عدم اليقين: يخرج النموذج توزيعاً غاوسياً للحالة التالية، متنبئاً بكل من المتوسط والتباين (σ2).
الابتكار الرئيسي: يصحح هذا النهج أخطاء الخرائط الموجودة في الأعمال السابقة (SSRL) ويتضمن ارتفاع القاعدة في الحالة، وهو أمر بالغ الأهمية لاستقرار الروبوت البشري.
المرحلة الثالثة: الضبط الدقيق الفعال
الاستراتيجية: حلقة "استكشاف آمن" تجمع بين التنفيذ الحتمي في العالم الحقيقي والاستكشاف العشوائي في نموذج العالم.
جمع البيانات: يقوم السياسة المدربة مسبقاً بتنفيذ أفعال حتمية (متوسط التوزيع) في البيئة الجديدة (محاكاة أو واقع). هذا يمنع الاستكشاف العشوائي غير الآمن الذي قد يؤدي لقلب الروبوت.
تجارب نموذج العالم: يتم حصر الاستكشاف العشوائي داخل نموذج العالم المستند إلى الفيزياء. يقوم الممثل (SAC actor) بأخذ عينات من الأفعال، ويقوم نموذج العالم بمحاكاة المسار.
التدريب: تُستخدم التجارب الاصطناعية من نموذج العالم لتحديث السياسة (Actor-Critic).
آليات الأمان:
إعادة الضبط الآمن (Safety Reset): يتم إنهاء التجارب في نموذج العالم فوراً إذا تم انتهاك الحدود الفيزيائية (مثل ارتفاع القاعدة، حدود المفاصل).
التنفيذ الحتمي: يستخدم جمع البيانات في العالم الحقيقي أي ضوضاء استكشاف معدومة، مما يضمن الأمان.
3. المساهمات الرئيسية
تنفيذ SAC قابل للتوسع: تنفيذ لـ SAC يعتمد على JAX يحقق تقارباً قوياً في المحاكاة المتوازية الضخمة والنقل من المحاكاة إلى الواقع عبر الصفر (zero-shot sim-to-real) على وحدة معالجة رسومية واحدة في أقل من ساعة.
استراتيجية الضبط الدقيق الآمن: طريقة مبتكرة تفصل الاستكشاف عن التنفيذ. من خلال حصر الاستكشاف العشوائي في نموذج عالم مستند إلى الفيزياء واستخدام أفعال حميمة في العالم الحقيقي، تحقق الطريقة كفاءة عالية في العينات وأماناً عالياً.
نموذج عالم مستند إلى الفيزياء: نهج تعلم البواقي الذي يجمع بين ديناميكيات لاغرانج وقوى التلامس المتعلمة، مما يحسن دقة التنبؤ والتعميم بشكل كبير مقارنة بنماذج العالم القائمة على الشبكات العصبية البحتة (مثل MBPO).
مسار مفتوح المصدر: إصدار إطار عمل كامل يغطي التدريب المسبق، والنشر عبر الصفر، والضبط الدقيق للتحكم في الروبوتات البشرية.
4. النتائج التجريبية
تم التحقق من صحة إطار العمل على الروبوتات البشرية Booster T1 (12 درجة حرية و23 درجة حرية) و Unitree G1 (29 درجة حرية).
أداء التدريب المسبق: حقق LIFT (المعتمد على SAC) عوائد مكافأة مساوية أو متفوقة على نماذج PPO و FastTD3، مع تقارب أسرع في التضاريس الوعرة. وقد نجح في النشر عبر الصفر لروبوت Booster T1 حقيقي على العشب، والمنحدرات، والطين.
كفاءة الضبط الدقيق (Sim-to-Sim):
في المهام التي تتطلب التكيف مع سرعات جديدة (بما في ذلك الأهداف خارج النطاق حتى 1.5 م/ث)، تقارب LIFT في غضون 40,000 خطوة بيئة.
فشلت النماذج المرجعية: تدهورت طريقة SAC القياسية بسبب الإفراط في التخصيص (overfitting) للبيانات الحتمية؛ وتراجع أداء PPO بمرور الوقت؛ وتذبذب FastTD3 وانهار؛ وفشل SSRL (المدرب من الصفر) في التقارب في المهام عالية السرعة.
الضبط الدقيق في العالم الحقيقي:
بدءاً من سياسة فشلت في النقل من المحاكة إلى الواقع (zero-shot sim-to-real)، قام LFT بتحسين استقرار المشية وتتبع السرعة باستخدام 80 إلى 590 ثانية فقط من جمع البيانات في العالم الحقيقي.
حقق الروبوت مشيات أكثر سلاسة وتقليلاً للتذبذبات.
دراسات الاستئصال (Ablation Studies):
التدريب المسبق: أدى إزالة التدريب المسبق لـ SAC إلى الفشل (تعلم الوقوف ساكناً)؛ وأدى إزالة التدريب المسبق لنموذج العالم إلى إبطاء التقارب بشكل كبير.
نوع نموذج العالم: استبدال النموذج المستند إلى الفيزياء بنموذج MBPO قياسي أدى إلى انفجار خسارة الناقد (critic loss) وفشل السياسة بسبب تنبؤات الأفعال خارج النطاق.
المعلمات الفائقة: كانت نسب UTD العالية (تصل إلى 10) وآفاق التنبؤ الذاتي متعددة الخطوات (H=4) حاسمة للاستقرار.
5. الأهمية والتوجهات المستقبلية
الأهمية: يوفر LIFT مخططاً عملياً للتعلم المستمر في الروبوتات البشرية. فهو يحل معضلة "الأمان مقابل الكفاءة" من خلال الاستفادة من سرعة المحاكاة للتدريب المسبق ومن أمان تجارب نموذج العالم للتحسين. يثبت أن الأساليب خارج السياسة يمكن توسيع نطاقها للروبوتات البشرية إذا اقترنت بالبنية التحتية الصحيحة والقيود الأمنية المناسبة.
القيود والعمل المستقبلي:
الأمان: يعتمد الضبط الدقيق الحالي في العالم الحقيقي على التقاط الحركة الخارجي (Vicon) لتقدير الارتفاع والإشراف البشري. يهدف العمل المستقبلي إلى دمج التقدير القائم على الكاميرا وإعادة الضبط الآمن التلقائي. متعدد الحواس: يعتمد الإطار الحالي على الحس العميق (proprioception). يتطلب توسيع LIFT لمهام تعتمد على الرؤية (مثل التعامل الدقيق بالأصابع) نماذج عالم كامنة قادرة على التعامل مع مدخلات بصرية عالية الأبعاد.
التفاعل مع الأشياء: تم تحديد نمذجة ديناميكيات الأشياء الخارجية (مثل ركل كرة) كإمتداد مستقبلي.
في الختام، تؤكد الورقة أن التدريب المسبق واسع النطاق + الضبط الدقيق المستند إلى الفيزياء هو مسار فعال ومتفوق لتحقيق تحكم قوي، وقابل للتكيف، وآمن للروبوتات البشرية المعقدة.