No More Marching: Learning Humanoid Locomotion for Short-Range SE(2) Targets
تقدم هذه الورقة نهجاً للتعلم التعزيزي مع دالة مكافأة مبتكرة قائمة على الكوكبة تُمكّن الروبوتات البشرية من الوصول بكفاءة ومتانة إلى وضعيات أهداف قصيرة المدى في فضاء (SE(2، متفوقةً بذلك على طرق تتبع السرعة التقليدية في كل من المحاكاة والأجهزة الواقعية.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أنك تعلم روبوتًا كيف يمشي. لفترة طويلة، كانت أفضل طريقة لتعليم الروبوتات المشي هي إخبارها: "امشِ للأمام بسرعة 1 متر في الثانية". هذا يعمل بشكل رائع إذا كان على الروبوت عبور حقل كامل. ولكن ماذا لو كان على الروبوت فقط اتخاذ خطوتين إلى اليسار ليمسك كوبًا من القهوة؟
إذا قلت لروبوت "امشِ للأمام" بينما يحتاج فقط للتحرك لبضع بوصات، فسينتهي به الأمر بفعل شيء سخيف: يخطو خطوات ثابتة في مكانه، ثم يتوقف، ثم يدور مثل الدبابة، ثم يخطو مجددًا، ثم يتوقف. إنه أمر غير فعال، وخرق، ويستهلك الكثير من الطاقة. الأمر يشبه محاولة ركن سيارة عن طريق القيادة للأمام، ثم التوقف، ثم تدوير المقود بزاوية 90 درجة، ثم القيادة للخلف، وتكرار ذلك حتى تجد مكانك المناسب.
تقدم هذه الورقة البحثية طريقة جديدة لتعليم الروبوتات البشرية (مثل الروبوت "Digit") كيفية التحرك لمسافات قصيرة بكفاءة. بدلًا من إعطائهم أوامر بالمسير، علم الباحثون الروبوت أن يهدف إلى نقطة وزاوية محددتين، تمامًا كما يفعل الإنسان عندما يمشي باتجاه كرسي.
إليك تفصيل حلهم باستخدام تشبيهات بسيطة:
1. المشكلة: الروبوت "الماشي بانتظام"
معظم الروبوتات يتم تدريبها على اتباع أمر بالسرعة (مثل مثبت السرعة في السيارة). عندما تطلب منها الذهاب إلى نقطة محددة قريبة، فإنها لا تعرف كيف تتوقف أو تدور بسلاسة. هي فقط تستمر في "المشي بانتظام" حتى تتجاوز الهدف، ثم تضطر للرجوع للخلف والدوران.
- التشبيه: تخيل جنديًا في عرض عسكري. إذا قلت له أن يتحرك إلى نقطة تبعد 3 أقدام، فقد يتخذ ثلاث خطوات ضخمة ومنتظمة، يتجاوز الهدف، ثم يضطر للدوران بشكل مربك. إنه سلوك جامد وغير طبيعي.
ze 2. الحل: "مكافأة الكوكبة"
استخدم الباحثون تقنية تسمى التعلم المعزز (التجربة والخطأ مع نظام المكافآت). السر يكمن في كيفية تصميم "المكافأة" التي يحصل عليها الروبوت عند أدائه لعمل جيد.
عادةً، قد تكافئ روبوتًا لأنه ضبط الموقع بشكل صحيح، وتكافئه بشكل منفصل لأنه ضبط الاتجاه بشكل صحيح. لكن الباحثين وجدوا أن الموازنة بين هذين الأمرين تشبه محاولة ضبط راديو أثناء القيادة بالسيارة؛ إنها عملية معقدة للغاية وتؤدي إلى عادات سيئة.
بدلاً من ذلك، ابتكروا مكافأة الكوكبة (Constellation Reward).
- التشبيه: تخيل أن لدى الروبوت "هالة" من النقاط المتوهجة وغير المرئية تطفو حوله (مثل كوكبة من النجوم). والهدف أيضًا لديه "هالة" مطابقة من النقاط.
- كيف تعمل: لا يحصل الروبوت على مكافأة لمجرد التحرك للأمام أو مجرد الدوران. بل يحصل على مكافأة بناءً على مدى تطابق "هالته" مع "هالة" الهدف.
- إذا كان بعيدًا جدًا، فلن تتطابق النقاط.
- إذا كان يواجه الاتجاه الخاطئ، فلن تتطابق النقاط.
- إذا كان في المكان الصحيح ولكنه يواجه الاتجاه الخاطئ، فستظل النقاط غير متطابقة.
هذا يجبر الروبوت على اكتشاف أفضل طريقة لتحريك قدميه لجعل النقاط تتطابق تمامًا. يتعلم الروبوت طبيعيًا أن يدور أثناء مشيه، بدلاً من التوقف للدوران. الأمر يشبه الراقص الذي يحرك قدميه ويدور بجسده في آن واحد للوصول إلى وضعية معينة، بدلاً من المشي إلى نقطة ثم الدوران في مكانه.
3. النتيجة: متحكم "GoTo"
قاموا بتدريب روبوت يسمى Digit باستخدام هذه الطريقة الجديدة.
- في المحاكاة (لعبة فيديو): تعلم الروبوت المشي نحو الأهداف في نصف الوقت، وباستخدام نصف الطاقة، واتخاذ خطوات أقل من طرق "المشي المنتظم" القديمة. بدا حركته انسيابية وشبيهة بحركة البشر.
- في العالم الحقيقي: وضعوا الكود البرمجي على روبوت حقيقي. وعلى الرغم من أن الأرضيات الحقيقية قد تكون زلقة والمستشعرات بها ضجيج، إلا أن الروبوت عمل بشكل جيد تقريبًا كما في لعبة الفيديو. لقد نجح في المشي نحو الأهداف، والدوران، والتوقف دون السقوف أو القيام برقصة "المشي-الدوران-المشي" الغريبة.
لماذا يهم هذا؟
تحل هذه الورقة مشكلة عملية للغاية. الروبوتات في العالم الحقيقي (في المستودعات، أو المنازل، أو المصانع) نادرًا ما تحتاج للمشي عبر حقل واسع. معظم احتياجاتها هي التحرك لبضع أقدام لالتقاط صندوق، ثم الدوران، ثم وضعه.
من خلال تغيير "المكافأة" من "استمر في المشي" إلى "طابق الكوكبة"، تعلم الروبوت أن يكون رشيقًا. توقف عن التصرف مثل جندي في عرض عسكري وبدأ يتصرف مثل شخص يريد الوصول إلى الثلاجة بسرعة وكفاءة.
باختصار: لقد توقفوا عن تعليم الروبوتات المشي بانتظام وبدأوا في تعليمهم كيفية التصويب نحو هدف، مما جعل الروبوت يتحرك بالكفاءة الانسيابية الطبيعية للإنسان.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.