Guided Riemannian Optimization (GuRO): Bridging Model Predictive Control and Decision Transformers
تقدم هذه الورقة البحثية "التحسين الريماني الموجه" (GuRO)، وهو إطار عمل مبتكر يدمج التحكم التنبؤي بالنماذج مع محولات القرار، ويستخدم التحسين الريماني المدرك للانحناء لتحقيق تدريب أسرع وأكثر متانة وأداء فائق في مهام التحكم الروبوتية غير الخطية وعالية الأبعاد.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تواجه الروبوتات التي تتحرك في العالم الحقيقي توازناً مستمراً وصعباً؛ إذ يتعين عليها تقرير كيفية الخطو، أو الدوران، أو التسلق في بيئات غالباً ما تكون غير مستوية، أو زلقة، أو غير متوقعة. ولاتخاذ هذه القرارات، اعتمد المهندسون تقليدياً على نهجين رئيسيين. الأول يشبه الملاح الحذر الذي يتحقق باستمرار من خريطة ويعيد حساب أفضل مسار للأمام بناءً على نموذج معروف للعالم. هذا الأسلوب فعال وسهل الفهم، لكنه يعاني عندما تكون الخريطة خاطئة أو تتغير التضاريس بطرق لم تتوقعها الخريطة. أما النهج الثاني فهو أشبه بطفل يتعلم المشي: يحاول أشياء كثيرة، ويسقط، ثم ينهض، ويتعلم ببطء ما الذي ينجح من خلال التجربة والخطأ. يمكن لهذا الأسلوب أن يتقن في النهاية حركات معقدة للغاية، ولكنه يتطلب قدراً هائلاً من الوقت والممارسة، وغالباً ما يفشل في التعلم عندما تكون المهمة صعبة للغاية أو عندما تكون الأخطاء مكلفة للغاية.
لسنوات، حاول الباحثون الجمع بين أفضل ما في العالمين: التخطيط الحذر للملاح، والقدرة على التكيف لدى المتعلم. وقد ظهرت فكرة جديدة تعامل تاريخ حركات الروبوت والمكافآت كقصة، باستخدام نماذج حاسوبية قوية صُممت في الأصل لقراءة اللغة البشرية للتنبؤ بالخطوة التالية الأفضل. ورغم كونها واعدة، إلا أن نماذج "قراءة القصص" هذه يصعب تدريبها بشكل ملحوظ؛ إذ غالباً ما تتعثر في دورة من التعلم البطيء وغير المستقر، عاجزة عن إيجال المسار الأكثر كفاءة للوصول إلى الحل. وقد طور فريق من الباحثين في جامعة مانشستر الآن طريقة جديدة لتوجيه هذه النماذج، مما يساعدها على تعلم حركات الروبوت المعقدة بشكل أسرع وأكثر موثوقية من ذي قبل.
ركز الباحثون على تعليم روبوت رباعي الأرجل، يُعرف باسم "كوادروبيد" (quadruped)، التنقل في البيئات الصعبة. أرادوا للروبوت أن يمشي فوق أرض وعرة، ويتسلق السلالم، ويصعد منحدرات زلقة دون السقوط. ولتحقيق ذلك، أنشأوا نظاماً هجيناً يجسّر الفجوة بين المخطط الحذر والمتعلم عبر التجربة والخطأ. استخدموا تقنية تسمى "التحكم التنبئي بالنموذج" (Model Predictive Control)، والتي تعمل كدليل في الوقت الفعلي. عند كل لحظة، يحسب هذا الدليل مساراً قصيراً ومثالياً محلياً ليتبعه الروبوت، مما يوضح للروبوت جوهرياً ما تبدو عليه الحركة الجيدة في تلك اللحظة. لا يحتاج هذا الدليل إلى معرفة المستقبل بأكه، بل يحتاج فقط إلى معرفة الخطوات القليلة القادمة.
هذه المسارات القصيرة عالية الجودة التي يولدها الدليل تم تغذيتها بعد ذلك في "محول القرار" (Decision Transformer)، وهو نموذج "قراءة القصص". وبدلاً من أن يتعين على الربوت تعلم كل شيء من الصفر عبر التجول العشوائي وارتكاب الأخطاء، تعلم النموذج من خلال دراسة الأمثلة الممتازة التي قدمها الدليل. أدى هذا إلى إلغاء الحاجة إلى كميات هائلة من البيانات غير المتصلة بالإنترنت أو ساعات لا نهائية من التجربة والخطأ في العالم الحقيقي. استطاع الروبوت التعلم من اقتراحات الدليل، وصقل فهمه الخاص لكيفية التحرك بكفاءة. ومع ذلك، لا يزال تدريب هذه النماذ الكبيرة مشكلة رياضية صعبة؛ إذ إن مشهد الحلول الممكنة مليء بالقمم الحادة والوديان العميقة، مما يجعل من السهل على خوارزميات التعلم القياسية أن تتعثر أو تتحرك ببطء شديد.
ولحل هذه المشكلة، قدم الباحثون طريقة جديدة للتنقل في عملية التعلم نفسها. فقد عاملوا المساحة الرياضية حيث يوجد "عقل" الروبوت ليس كشبكة مسطحة وبسيطة، بل كسطح منحني، تماماً مثل سطح الأرض. تتحرك طرق التعلم القياسية في خطوط مستقيمة، وهو ما قد يكون غير فعال على سطح منحني. الطريقة الجديدة، التي يسميها المؤلفون "التحسين الريماني الموجه" (Guided Riemannian Optimization)، تفهم انحناء هذا الفضاء. فهي تعدل اتجاه التعلم لتتبع التضاريس الطبيعية للمشكلة، مما يسمح لعقل الروبوت بإيجاد الحل الأفضل بشكل أسرع بكثير. هذا النهج يشبه متنزهاً يعرف تضاريس الأرض ويتخذ المسار الأكثر مباشرة لصعود التل، بدلاً من السير في خط مستقيم قد يؤدي به إلى طريق مسدود أو منحدر شاهق.
اختبر الفريق هذا النظام على روبوت "Unitree AlienGo"، وهو آلة رباعية الأرجل، في بيئة محاكاة تحاكي فيزياء العالم الحقيقي. وضعوا للروبوت ثلاث تحديات متميزة: المشي فوق تضاريس غير مستوية، تسلق مجموعة من السلالم، وصعود سطح مائل منخفض الاحتكاك. وقارنوا طريقتهم الجديدة بعدة تقنيات راسخة، بما في ذلك خوارزميات التعلم المعزز القياسية وإصدارات أخرى من "محول القرار" التي لم تستخدم نهج التعلم القائم على السطح المنحني. أظهرت النتائج ميزة واضحة للنظام الجديد؛ ففي كل مهمة، وصل الروبوت الذي تدرب بالمنهج الموجه والمدرك للانحناء إلى مستوى أعلى من الأداء، وفعل ذلك بعدد أقل من المحاولات مقارنة بالطرق الأخرى.
كشفت البيانات أن الروبوت تعلم المشي على الأرض الوعرة، وتسلق السلالم، وصعود المنحدرات الزلقة باستقرار وسرعة أكبر. كما كانت عملية التدريب نفسها أكثر كفاءة بشكل ملحوست، حيث انخفضت "دالة الخسارة" (loss function) — وهي مقياس لمدى خطأ توقعات الروبوت — بشكل أسرع بكثير مقارنة بالطرق التقليدية. وأكد التحليل الإحصائي أن هذه التحسينات لم تكن وليدة الصدفة؛ فقد تفوقت الطريقة الجديدة باستمرار على أفضل البدائل الموجودة، مما يثبت أن الجمع بين مخطط في الوقت الفعلي ونموذج قراءة القصص، ومن ثم تحسين عملية التعلم بفهم الهندسة الكامنة، يخلق أداة قوية للتحكم في الروبوتات.
يشير هذا العمل إلى أن مستقبل تعلم الروبوتات قد لا يكمن في الاختيار بين التخطيط الحذر أو التعلم عبر التجربة والخطأ، بل في نسجهما معاً. فمن خلال استخدام مخطط لتوفير أمثلة عالية الجودة، واستخدام نهج رياضي متخصص للتنقل في عملية التعلم، يمكن للروبوتات إتقان المهام الفيزيائية المعقدة بسرعة أكبر وبمتانة أعلى. لقد أثبت الباحثون أن هذا النهج يعمل بفعالية في المحاكاة، مما يوفر مساراً واعداً لنشر روبوتات ذكية وقابلة للتكيف في العالم الحقيقي حيث نادراً ما تكون الظروف مثالية وتكون تكلفة الفشل باهظة.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.