← أحدث الأبحاث
💻 computer science

Imitating and Finetuning Model Predictive Control for Robust and Symmetric Quadrupedal Locomotion

تقترح هذه الورقة إطار عمل للتحكم التنبئي بالنماذج القائم على المحاكاة والضبط الدقيق (IFM)، والذي يجمع بين سياسة خبير التحكم التنبئي بالنماذج التقليدية وبين التعلم بالتقليد والتعلم التعزيزي العميق لتحقيق حركة رباعية الأرجل قوية ومتناظرة وموفرة للطاقة على التضاريس الصعبة.

المؤلفون الأصليون: Donghoon Youm, Hyunyoung Jung, Hyeongjun Kim, Jemin Hwangbo, Hae-Won Park, Sehoon Ha

نُشر 2026-05-28
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Donghoon Youm, Hyunyoung Jung, Hyeongjun Kim, Jemin Hwangbo, Hae-Won Park, Sehoon Ha

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تحاول تعليم روبوت كلب ذي أربعة أرجل كيف يركض، ويقفز فوق العوائق، ويمشي على الأرضيات الزلقة دون أن يسقط. هذه مهمة صعبة للغاية لأن الروبوت يجب أن يوازن نفسه بشكل مثالي بينما تتحرك أرجله في أنماط معقدة.

تقدم هذه الورقة البحثية طريقة تعليم جديدة تسمى IFM (التحكم التنبئي بالنماذج عبر التقليد والضبط الدقيق). فكر في IFM كبرنامج تدريب مهني مكون من ثلاث خطوات يجمع بين أفضل ما في عالمين: معلم صارم يعتمد على الرياضيات، وطالب مبدع يعتمد على التجربة والخطأ.

إليك كيف تسير العملية، باستخدام تشبيهات بسيطة:

الخطوة 1: "معلم الرياضيات الصارم" (الخبير)

أولاً، يقوم الباحثون بإنشاء متحكم "مثالي" باستخدام رياضيات متقدمة (التحكم التنبئي بالنماذج أو MPC).

  • التشبيه: تخيل لاعب شطرنج عبقري ولكن جامد، يحسب كل حركة محتملة بدقة مثالية. هذا اللاعب يعرف بالضبط كيف يجب أن يتحرك الروبوت بناءً على معادلات الفيزياء.
  • المشكلة: هذا اللاعب عبقري ولكنه بطيء جداً. لكي يحسب الخطوة التالية، يجب على الكمبيوتر إجراء عمليات حسابية ثقيلة تستغرق وقتاً طويلاً جداً لدرء استجابة روبوت حقيقي في الوقت الفعلي. أيضاً، إذا داس الروبوت على شيء غير متوقع (مثل قشرة موزة أو حزام ناقل متحرك)، فقد تفشل قواعد هذا اللاعب الصارمة لأنها لم تُبرمج لمثل هذه المواقف الغريبة المحددة.

الخطوة 2: "الطالب الظل" (تعلم التقليد)

بعد ذلك، يقومون بتدريب شبكة عصبية (نوع من أنواع أدمغة الذكاء الاصطناعي) لتقليد لاعب الشطرنج.

  • التشبيه: يضعون طالباً في الغرفة مع لاعب الشطرنج، فيراقب الطالب حركات اللاعب ويحاول تقليدها بدقة. هذا ما يسمى "تعلم التقليد".
  • النتيجة: يتعلم الطالب أسلوب المشي المثالي، المتماثل، والفعال الخاص بلاعب الشرطرنج. ولكن على عكس اللاعب، فإن الطالب هو مجرد ذكاء اصطناعي بسيط يمكنه اتخاذ القرارات فوراً (بسرعة كبيرة). ومع ذلك، لا يزال الطالب مجرد نسخة؛ فإذا تغير الموقف بشكل جذري، قد يظل الطالب عالقاً.

الخطوة 3: "مخيم المغامرة" (التعلم التعزيزي)

أخيراً، يرسلون هذا الطالب إلى "مخيم تدريبي" يحتوي على تضاريس صعبة (صخور وعرة، جليد زلق، أحزمة متحركة) للتدرب بمفرده.

  • التشبيه: بدلاً من البدء من الصفر، يعرف الطالب بالفعل كيف يمشي جيداً. الآن، يتم إعطاؤه تحدياً: "امشِ عبر جهاز مشي متحرك دون السقوط". يحاول الطالب أشياء مختلفة؛ إذا انزلق، يتعلم من ذلك، وإذا نجح، يحصل على مكافأة "عمل جيد".
  • السحر: لأن الطالب بدأ بأساس جيد (من الخطوة 2)، فهو لا يحتاج إلى آلاف الساعات من التجربة والخطأ لتعلم الأساسيات. هو فقط يحتاج إلى "ضبط دقيق" لمهاراته للتعامل مع العالم الحقيقي الفوضوي.

لماذا هذه الطريقة أفضل من الطرق القديمة؟

  1. السرعة مقابل الذكاء: كان "معلم الرياضيات" الأصلي ذكياً ولكنه بطيء. أما "الطالب" الجديد فهو ذكي تقريباً بنفس القدر ولكنه يستطيع التفكير أسرع بـ 15 مرة. هذا يعني أن الروبوت يمكنه الاستجابة فوراً للمطبات والانزلاقات.
  2. أسلوب مشي أفضل: إذا تركت الروبوت يتعلم من الصفر فقط (ما يسمى بـ "التعلم التعزيزي التقليدي" أو Vanilla RL)، فغالباً ما سيتعلم المشي بطريقة غريبة، أو متقطعة، أو غير متماثلة (مثل شخص مخمور يترنح). قد ينجح الأمر، لكنه سيكون غير فعال وصعب النقل إلى الأجهزة الحقيقية. طريقة IFM تجبر الروبوت على الحفاظ على أسلوب المشي "الأنيق" الذي تعلمه من معلم الرياضيات، ليبقى متماثلاً وموفراً للطاقة.
  3. تقليل "تشكيل المكافآت": عادةً، يتطلب تعليم الروبوت من المبرمج البشري كتابة عشرات القواعد المحددة (المكافآت) لإخبار الروبوت، مثل "لا ترفع ساقك عالياً جداً" أو "حافظ على استقامة ظهرك". هذا أمر مرهق وصعب الضبط. ولأن IFM يبدأ بمعلم جيد، فإن الروبوت يعرف بالفعل أساسيات الوضعية الجيدة. احتاج الباحثون فقط إلى بعض القواعد البسيطة لتوجيه الروبوت عبر التضاريس الصعبة.

النتائج

اختبر الفريق هذه الطريقة على روبوت حقيقي يسمى Mini Cheetah.

  • العوائق: تمكن الروبوت بنجاح من القفز فوق درجة بارتفاع 7.5 سم (حوالي ارتفاع كتاب سميك)، وهو ما فشلت فيه الطرق الأخرى.
  • الأرضيات الزلقة: استطاع المشي عبر سطح ذي احتكاك منخفض جداً (مثل قشرة الموز) دون السقوط، بينما كان المتحكم الرياضي القديم سينزلق ويتحطم.
  • الأرض المتحركة: استطاع المشي على حزام ناقل متحرك، مع ضبط خطواته بدقة للحفاظ على توازنه.

باختصار: تقترح الورقة طريقة تبدأ بتعليم الروبوت الطريقة "المثالية" للمشي باستخدام الرياضيات، ثم تعليم ذكاء اصطناعي تقليد هذا الأسلوب المثالي، وأخيراً ترك هذا الذكاء الاصطناد يتدرب على تضاريس وعرة ليصبح عداءً قوياً، سريعاً، ورشيقاً. الأمر يشبه أخذ راقص محترف، وتعليم طالب رقصته، ثم إرسال هذا الطالب للرقص على ترامبولين.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →