Imitating and Finetuning Model Predictive Control for Robust and Symmetric Quadrupedal Locomotion
تقترح هذه الورقة إطار عمل للتحكم التنبئي بالنماذج القائم على المحاكاة والضبط الدقيق (IFM)، والذي يجمع بين سياسة خبير التحكم التنبئي بالنماذج التقليدية وبين التعلم بالتقليد والتعلم التعزيزي العميق لتحقيق حركة رباعية الأرجل قوية ومتناظرة وموفرة للطاقة على التضاريس الصعبة.
المؤلفون الأصليون:Donghoon Youm, Hyunyoung Jung, Hyeongjun Kim, Jemin Hwangbo, Hae-Won Park, Sehoon Ha
تخيل أنك تحاول تعليم روبوت كلب ذي أربعة أرجل كيف يركض، ويقفز فوق العوائق، ويمشي على الأرضيات الزلقة دون أن يسقط. هذه مهمة صعبة للغاية لأن الروبوت يجب أن يوازن نفسه بشكل مثالي بينما تتحرك أرجله في أنماط معقدة.
تقدم هذه الورقة البحثية طريقة تعليم جديدة تسمى IFM (التحكم التنبئي بالنماذج عبر التقليد والضبط الدقيق). فكر في IFM كبرنامج تدريب مهني مكون من ثلاث خطوات يجمع بين أفضل ما في عالمين: معلم صارم يعتمد على الرياضيات، وطالب مبدع يعتمد على التجربة والخطأ.
إليك كيف تسير العملية، باستخدام تشبيهات بسيطة:
الخطوة 1: "معلم الرياضيات الصارم" (الخبير)
أولاً، يقوم الباحثون بإنشاء متحكم "مثالي" باستخدام رياضيات متقدمة (التحكم التنبئي بالنماذج أو MPC).
التشبيه: تخيل لاعب شطرنج عبقري ولكن جامد، يحسب كل حركة محتملة بدقة مثالية. هذا اللاعب يعرف بالضبط كيف يجب أن يتحرك الروبوت بناءً على معادلات الفيزياء.
المشكلة: هذا اللاعب عبقري ولكنه بطيء جداً. لكي يحسب الخطوة التالية، يجب على الكمبيوتر إجراء عمليات حسابية ثقيلة تستغرق وقتاً طويلاً جداً لدرء استجابة روبوت حقيقي في الوقت الفعلي. أيضاً، إذا داس الروبوت على شيء غير متوقع (مثل قشرة موزة أو حزام ناقل متحرك)، فقد تفشل قواعد هذا اللاعب الصارمة لأنها لم تُبرمج لمثل هذه المواقف الغريبة المحددة.
الخطوة 2: "الطالب الظل" (تعلم التقليد)
بعد ذلك، يقومون بتدريب شبكة عصبية (نوع من أنواع أدمغة الذكاء الاصطناعي) لتقليد لاعب الشطرنج.
التشبيه: يضعون طالباً في الغرفة مع لاعب الشطرنج، فيراقب الطالب حركات اللاعب ويحاول تقليدها بدقة. هذا ما يسمى "تعلم التقليد".
النتيجة: يتعلم الطالب أسلوب المشي المثالي، المتماثل، والفعال الخاص بلاعب الشرطرنج. ولكن على عكس اللاعب، فإن الطالب هو مجرد ذكاء اصطناعي بسيط يمكنه اتخاذ القرارات فوراً (بسرعة كبيرة). ومع ذلك، لا يزال الطالب مجرد نسخة؛ فإذا تغير الموقف بشكل جذري، قد يظل الطالب عالقاً.
الخطوة 3: "مخيم المغامرة" (التعلم التعزيزي)
أخيراً، يرسلون هذا الطالب إلى "مخيم تدريبي" يحتوي على تضاريس صعبة (صخور وعرة، جليد زلق، أحزمة متحركة) للتدرب بمفرده.
التشبيه: بدلاً من البدء من الصفر، يعرف الطالب بالفعل كيف يمشي جيداً. الآن، يتم إعطاؤه تحدياً: "امشِ عبر جهاز مشي متحرك دون السقوط". يحاول الطالب أشياء مختلفة؛ إذا انزلق، يتعلم من ذلك، وإذا نجح، يحصل على مكافأة "عمل جيد".
السحر: لأن الطالب بدأ بأساس جيد (من الخطوة 2)، فهو لا يحتاج إلى آلاف الساعات من التجربة والخطأ لتعلم الأساسيات. هو فقط يحتاج إلى "ضبط دقيق" لمهاراته للتعامل مع العالم الحقيقي الفوضوي.
لماذا هذه الطريقة أفضل من الطرق القديمة؟
السرعة مقابل الذكاء: كان "معلم الرياضيات" الأصلي ذكياً ولكنه بطيء. أما "الطالب" الجديد فهو ذكي تقريباً بنفس القدر ولكنه يستطيع التفكير أسرع بـ 15 مرة. هذا يعني أن الروبوت يمكنه الاستجابة فوراً للمطبات والانزلاقات.
أسلوب مشي أفضل: إذا تركت الروبوت يتعلم من الصفر فقط (ما يسمى بـ "التعلم التعزيزي التقليدي" أو Vanilla RL)، فغالباً ما سيتعلم المشي بطريقة غريبة، أو متقطعة، أو غير متماثلة (مثل شخص مخمور يترنح). قد ينجح الأمر، لكنه سيكون غير فعال وصعب النقل إلى الأجهزة الحقيقية. طريقة IFM تجبر الروبوت على الحفاظ على أسلوب المشي "الأنيق" الذي تعلمه من معلم الرياضيات، ليبقى متماثلاً وموفراً للطاقة.
تقليل "تشكيل المكافآت": عادةً، يتطلب تعليم الروبوت من المبرمج البشري كتابة عشرات القواعد المحددة (المكافآت) لإخبار الروبوت، مثل "لا ترفع ساقك عالياً جداً" أو "حافظ على استقامة ظهرك". هذا أمر مرهق وصعب الضبط. ولأن IFM يبدأ بمعلم جيد، فإن الروبوت يعرف بالفعل أساسيات الوضعية الجيدة. احتاج الباحثون فقط إلى بعض القواعد البسيطة لتوجيه الروبوت عبر التضاريس الصعبة.
النتائج
اختبر الفريق هذه الطريقة على روبوت حقيقي يسمى Mini Cheetah.
العوائق: تمكن الروبوت بنجاح من القفز فوق درجة بارتفاع 7.5 سم (حوالي ارتفاع كتاب سميك)، وهو ما فشلت فيه الطرق الأخرى.
الأرضيات الزلقة: استطاع المشي عبر سطح ذي احتكاك منخفض جداً (مثل قشرة الموز) دون السقوط، بينما كان المتحكم الرياضي القديم سينزلق ويتحطم.
الأرض المتحركة: استطاع المشي على حزام ناقل متحرك، مع ضبط خطواته بدقة للحفاظ على توازنه.
باختصار: تقترح الورقة طريقة تبدأ بتعليم الروبوت الطريقة "المثالية" للمشي باستخدام الرياضيات، ثم تعليم ذكاء اصطناعي تقليد هذا الأسلوب المثالي، وأخيراً ترك هذا الذكاء الاصطناد يتدرب على تضاريس وعرة ليصبح عداءً قوياً، سريعاً، ورشيقاً. الأمر يشبه أخذ راقص محترف، وتعليم طالب رقصته، ثم إرسال هذا الطالب للرقص على ترامبولين.
ملخص تقني: محاكاة وضبط التحكم التنبئي بالنماذج لضمان حركة روبوتات رباعية الأرجل قوية ومتماثلة
بيان المشكلة
لا يزال تصميم وحدات التحكم في الحركة القوية للروبوتات ذات الأرجل تحديًا كبيرًا بسبب الديناميكيات ناقصة التفعيل، والمنفصلة، وعالية الأبعاد لهذه الأنظمة. أظهر التحكم القائم على النموذج (مثل التحكم التنبئي بالنماذج - MPC) قدرة مذهلة على الرشاقة والمتانة، ولكنه غالبًا ما يعتمد على نمذجة رياضية مكثفة وقواعد استدلالية محددة مسبقًا (مثل قواعد رايبرت). وتواجه هذه النماذج صعوبة في المواقف غير التقليدية والمعقدة مثل التضاربات الوعرة، أو الزلقة، أو الأراضي المتحركة (السيور الناقلة) حيث يحدث انزلاق القدم أو عوائق غير متوقعة. ومن ناحه أخرى، فإن النهج القائم على التعلم (مثل التعلم التعزيزي العميق - Deep RL) يمكنه حل المشكلات غير البديهية تلقائيًا باستخدام بيانات ضخمة، ولكنه يتطلب غالبًا صياغة مكثفة للمكافآت يدويًا لإنتاج حركات متماثلة ودورية عالية الجودة. وبدون ضبط دقيق، قد تظهر السياسات المتعلمة حركات متقطعة وغير متماثلة تفشل في الانتقال إلى الأجهزة الحقيقية. علاوة على ذلك، تعاني النهج الهجينة الموجودة غالبًا من تكاليف حسابية عالية بسبب الحاجة إلى تنفيذ MPC بترددات عالية أو الفشل في التعميم خارج مسارات المرجع الفردية.
المنهجية: إطار عمل IFM
يقترح المؤلفون إطار عمل جديدًا بعنوان محاكاة وضبط التحكم التنبئي بالنماذج (IFM)، والذي يدمج نقاط القوة في التحكم القائم على النموذج والخوارزميات القائمة على التعلم من خلال عملية مكونة من ثلاث مراحل:
المرحلة 0: التحكم التنبئي بالنماذج الخبير (Expert MPC)
يبدأ إطار العمل بتطوير متحكم خبير (πE) باستخدام البرمجة الديناميكية التفاضلية (DDP) وقواعد رايبرت الاستدلالية.
التصميم: يتنبأ الـ MPC بالحالات المستقبلية ويولد مدخلات تحكم مثالية بناءً على دالة تكلفة محدبة. وهو يستخدم قيود هرم الاحتكاك للأرجل الثابتة وتحكم المعاوقة في مساحة المهمة للأرجل المتأرجحة.
القصور: رغم متانته، إلا أن هذا الـ MPC مكلف حسابيًا (حوالي 12.4 مللي ثانية لكل عملية تحسين) ويعتمد على نموذج ثابت، مما يجعل تنفيذه في الوقت الفعلي على الأجهزة أمرًا صعبًا ويحد من القدرة على التكيف مع التضاريس غير المرئية.
تحويل الإجراء: لسد الفجوة مع خوارزميات التعلم، يتم تحويل مخرجات عزم الدوران الخاصة بالـ MPC إلى زوايا مفاصل مستهدفة باستخدام نموذج عكسي تناسبي-تفاضلي (PD)، مما يجعل البيانات متوافقة مع سياسات الشبكة العصبية.
المرحلة 1: التعلم بالتقليد (Imitation Learning - IL)
يُستخدم الـ MPC الخبير لتوليد مجموعة بيانات للتدريب المسبق لسياسة الشبكة العصبية (πI).
الخوارزمية: يستخدم المؤلفون تجميع مجموعة البيانات (DAgger). فبدلاً من مجرد نسخ السلوك، يتم تشغيل السياسة، ويقوم الـ MPC الخبير بتصحيح الإجراءات للحالات غير المرئية، مما يؤدي لتجميع هذه البيانات للتخفيف من عدم تطابق التوزيع.
البنية: تستخدم شبكة MLP (Perceptron متعدد الطبقات) بثلاث طبقات مخفية (512، 256، 64 عصبون) الملاحظات التي تشمل اتجاه الجسم، وحالات المفاصل، والتاريخ، وأوامر المستخدم.
الهدف: تهدف هذه المرحلة إلى إنشاء "نسخة" من الـ MPC تكون فعالة حسابيًا وقابلة للتعلم، وتكتسب الحركات المتماثلة والدورية من الخبير دون تكلفة التحسين الثقيلة.
المرحلة 2: الضبط الدقيق بالتعلم التعزيزي (RL Finetuning)
يتم ضبط السياسة المقلدة لاحقًا على تضاريس صعبة باستخدام تحسين السياسة القريبة (PPO).
التعلم المنهجي (Curriculum Learning): يتم تدريب السياسة على منهج من التضاريس (وعرة، وعرة متقطعة، درجات، منحدرات) مع زيادة الصعوبة (عامل التضاريس) لمنع فقدان أنماط الحركة التي تم التدريب المسبق عليها.
صياغة المكافأة: يستخدم المؤلفون إعداد المكافأة البسيطة (SR) (تتبع السرعة، تقليل الحركة غير الضرورية، تنظيم عزم الدوران) وإعداد مكافأة الاتصال (CR) (إضافة تحيز الاتصال). ومن الأهمية بمكان أن التدريب المسبق يقلل بشكل كبير من عبء هندسة المكافآت مقارنة بالتعلم التعزيزي التقليدي (Vanilla RL).
الاستكشاف المقيد: للحفاظ على أنماط الحركة المفيدة التي تم تعلمها أثناء التقليد، يستخدم الضبط الدقيق بالتعلم التعزيزي استكشافًا مقيدًا (انحراف معياري أولي صغير، معدلات تعلم منخفضة، ومعاملات قص صغيرة لـ PPO).
النقل من المحاكاة إلى الواقع (Sim-to-Real): يتم تطبيق التغيير العشوائي للمجال (Domain Randomization) على ضوضاء الملاحظات، واحتكاك المحرك، وكسب الـ PD، واحتكاك الأرض، وتأخير الأوامر لضمان النقل الصفري (Zero-shot) إلى الأجهزة الحقيقية.
المساهمات الرئيسية
إطار عمل مبتكر: اقتراح إطار عمل IFM، الذي يجمع بشكل منهجي بين MPC والتعلم التعزيزي للاستفادة من متانة التحكم القائم على النموذج وقدرة الأساليب القائمة على التعلم على التكيف.
تحسين الأداء: إثبات أن IFM يحسن بشكل كبير من متانة الـ MPC الخبير على التضاريس الوعرة، والزلقة، وتضاريس السيور الناقلة، مع تقليل وقت الحساب بشكل جذري (من ~15 مللي ثانية إلى ~1 مللي ثانية).
الكفاءة والجودة: تقديم دليل على أن IFM ينتج حركات أكثر تماثلًا ودورية وكفاءة في استهلاك الطاقة مقارنة بـ Vanilla RL، ويحقق ذلك بأقل قدر من صياغة المكافآت وبسرعة تقارب أكبر.
التحقق من الأجهزة: النجاح في النشر على روبوت Mini Cheetah، مما أظهر معدلات نجاح فائقة في تخطي العقبات وتتبع السرعات مقارنة بكل من الـ MPC الأصلي ونماذج RL الأساسية.
النتائج التجريبية
أجرى المؤلفون تجارب محاكاة وتجارب أجهزة واسعة النطاق على Mini Cheetah:
المتانة: في المحاكاة، تفوق IFM على الـ MPC الخبير وسياسات DAgger فقط في التضاريس الوعرة، والزلقة، وتضاريس السيور الناقلة غير المرئية. وبينما فشل الـ MPC في التضاريس ذات السيور الناقلة بسبب أنماط وضع القدم الثابتة، استطاع IFM تكييف مشيته بفعالية.
أداء التتبع: في التضاريس المستوية، حقق IFM(SR) أدنى أخطاء التتبع الخطي، متفوقًا على كل من MPC و Vanilla RL. أظهر Vanilla RL(SR) تتبعًا ضعيفًا بسبب "القفز" (الحركة الرأسية المفرطة)، وهي مشكلة تم التخفيف منها بواسطة التدريب المسبق لـ IFM.
معدلات النجاح في الأجهزة:
تخطي العقبات: حقق IFM(CR) معدل نجاح بنسبة 90% في تخطي عقبات بارتفاع 7.5 سم، بينما فشل كل من MPC (المعدل للأجهزة عبر WBIC) و DAgger تمامًا عند هذا الارتفاع.
التضاريس الزلقة: نجحت سياسات IFM في عبور سطح بمعامل احتكاك 0.22، بينما سقط كل من MPC و DAgger بسبب الاعتماد على قواعد رايبرت التي لم تستطع التعامل مع الانزلاق الكبير.
جودة الحركة: أظهرت سياسات IFM تكلفة نقل (CoT) ومؤشر مخطط الطور (PPI) أقل مقارنة بـ Vanilla RL، مما يشير إلى حركات أكثر كفاءة في الطاقة وتماثلاً. أظهرت مخططات الطور لـ IFM تداخلًا شبه مثالي بين الأرجل اليسرى واليمنى، على عكس الحركات غير المتماثلة لـ Vanilla RL.
الكفاءة: وصل IFM إلى التقارب في حوالي 2,000 تكرار، وهو أسرع بكثير من Vanilla RL (حوالي 4,000+ تكرار).
الأهمية والادعاءات
يزعم البحث أن إطار عمل IFM يقدم حلاً متوازنًا للمفاضلة بين قابلية التفسير والمتانة في التحكم القائم على النموذج، وبين القدرة على التكيف في الأساليب القائمة على التعلم. من خلال استخدام MPC كخبير للتدريب المسبق، يقوم الإطار بـ:
تقليص مساحة البحث للتعلم التعزيزي، مما يسمح للوكيل بإيجاد حركات عالية الجودة ومتماثلة دون هندسة مكافآت معقدة.
التغلب على قيود المتحكمات ذات النماذج الثابتة (مثل MPC) في البيئات الديناميكية وغير المستقرة.
تمكين التحكم في الوقت الفعلي عن طريق استبدال التحسين الثقيل عبر الإنترنت بشبكة عصبية خفيفة الوزن.
يخلص المؤلفون إلى أن IFM يوفر نهجًا مهيكلًا لتنظيم أنماط الحركة، مما يخفف من تحدي هندسة المكافآت مع تحسين متانة وكفاءة الحركة الرباعية الأرجل على التضاريس الصعبة بشكل كبير. ويُقترح في العمل المستقبلي توسيع هذه الطريقة لتشمل الحركة القائمة على الرؤية، مما قد يتطلب بنيات شبكية أكثر تعقيدًا مثل LSTMs أو CNNs.