Closing the Loop on the Poppy Humanoid: Bipedal Locomotion with Linear-Quadratic Control and Learned Cost Functions
تقدم هذه الورقة متحكماً مغلق الحلقة للمشي لروبوت "Poppy Humanoid" يستخدم إطار المنظم التربيعي الخطي (LQR) مع دالة تكلفة متعلمة لتحقيق حركة ثنائية الأرجل موثوقة وغير مساعدة، مما يظهر تحسينات ذات دلالة إحصائية في الأداء مقارنة بتشغيل المسارات مفتوحة الحلقة.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تُعد المشي عملية من الحسابات المستمرة وغير المرئية. بالنسبة للإنسان، هي تدفق سلس من التوازن، حيث يقوم الدماغ والجسم بإجراء آلاف التعديلات الدقيقة في كل ثانية للحفاظ على استقامتنا. أما بالنسبة للروبوت، فإن هذه المهمة ذاتها هي بمثابة سير على حبل مشدود محفوف بالمخاطر. لا يكمن التحدي في تحريك الأرجل فحسب، بل في القيام بذلك دون السقوط، خاصة عندما تكون الآلة مبنية من أجزاء خفيفة الوزن وغير مكلفة لا تمتلك الحساسات المثالية أو المحركات القوية الموجودة في الروبوتات الصناعية الراقية. هذا هو اللغز المحدد الذي يواجه الباحثين العاملين مع الروبوت "بوبي" (Poppy Humanoid)، وهو روبوت بشري صغير مفتوح المصدر مصمم للتعليم والدراسة. وبينما يعد "بوبي" منصة ميسورة التكلفة للتعلم حول الذكاء الاصطناعي، إلا أنه عانى تاريخياً من صعوبة المشي بمفرده. فبدون مساعدة بشرية مستمرة لتثبيته، سيفقد الروبوت توازنه بسرعة ويسقط، مما يحد من فائدته كآلة للعرض داخل الفصول الدراسية بدلاً من أن يكون آلة مستقلة حقيقية.
يكمن الصعوبة الجوهرية في عتاد الروبوت؛ فهو مصنوع من أطراف بلاستيكية مطبوعة بتقنية ثلاثية الأبعاد ويعتمد على محركات يمكن إخبارها فقط بالاتجاه الذي يجب أن تتجه إليه، وليس مقدار القوة التي يجب أن تطبقها. علاوة على ذلك، يفتقر الروبوت إلى الحساسات عالية السرعة الموجودة في الآلات الأكثر تكلفة، مما يعني أنه لا يستطيع "استشعار" طريقه خلال الخطوة في الوقت الفعلي. تضمنت المحاولات السابقة لجعل "بوبي" يمشي تشغيل تسلسل حركات مسجل مسبقاً، مثل تسجيل شريط صوتي. هذا النهج (الحلقة المفتوحة) لم ينجح إلا إذا كانت الأرضية مثالية وبدأ الروبوت في وضعية مثالية. وفي اللحظة التي يحدث فيها خطأ ضئيل —مثل تمايل طفيف أو انزلاق— لن يملك الروبوت وسيلة لتصحيح نفسه، وسيتضاعف الخطأ حتى يسقط الروبوت. كان السؤال الذي واجهه الباحثون هو ما إذا كان من الممكن تعليم هذه الآلة الهشة ومنخفضة التكلفة التعافي من أخطائها والمشي بشكل موثوق دون تدخل بشري.
وضع فريق من الباحثين في جامعة سيراكيوز حداً لهذا الأمر من خلال منح "بوبي" شكلاً بسيطاً من أشكال التصحيح الذاتي. فبدلاً من مجرد تشغيل نص ثابت، قاموا ببناء نظام يراقب مفاصل الروبوت في الوقت الفعلي ويجري تعديلات طفيفة وفورية لإبقائه على المسار الصحيح. بدأوا بتسجيل مئات محاولات المشي، بعضها ناجح والعديد منها انتهى بالسقوط. ومن خلال تحليل الفرق بين الحركات التي نجحت وتلك التي فشلت، علموا برنامج كمبيوتر التعرف على العلامات المبكرة للتعثر. تعلم البرنامج مجموعة من القواعد التي تخصص "تكلفة" لكل حركة ممكنة، حيث تعني التكلفة العالية خطراً كبيًراً للسقوط. ثم استخدم هذه القواعد لحساب أفضل تصحيح صغير ممكن في كل لحظة، مما خلق فعلياً شبكة أمان يمكن للروبوت استخدامها للبقاء منتصباً.
كانت نتائج هذا النهج مذهلة. فعندما اختبر الباحثون الروبوت في بيئة مكتبية قياسية، سمح الأسلوب القديم المتمثل في تشغيل نص ثابت للروبوت بإكمال متوسط أربع خطوات فقط قبل السقوط. ومع النظام الجديد ذاتي التصحيح، تمكن الروبوت من المشي لمسافة أبعد بكثير، حيث بلغ متوسط خطواته أكثر من خمس خطوات قبل السقوط، ونجح في إكمال تسلسل الخطوات الست كاملة في نحو 80 بالمائة من التجارب. وكان التحسن أكثر وضوحاً عندما تم اختبار الروبوت في غرفة مختلفة ذات أرضية ناعمة، وهي سطح لم يره من قبل. في هذه البيئة الجديدة، انخفض معدل النجاح للأسلوب القديم إلى 30 بالمائة، لكن النظام الجديد ظل قادراً على النجاح بنسبة 42.5 بالمائة. وقد أثبت هذا أن الروبوت لم يكن يحفظ مساراً محدداً فحسب، بل تعلم قدرة عامة على موازنة نفسه ضد الظروف المختلفة.
لم يكن مفتاح هذا النجاح عقلاً جديداً معقداً، بل طريقة منقحة لاستخدام البيانات التي يولدها الروبوت بالفعل. لم يحتج الباحثون إلى بناء مستشعرات جديدة أو تغيير التصميم الفيزيائي للروبوت. بدلاً من ذلك، استخدموا إطاراً رياضياً يُعرف باسم "المنظم الخطي التربيعي" (linear-quadratic regulator)، وهو طريقة لإيجاد المسار الأكثر كفاءة نحو هدف ما مع تقليل الأخطاء إلى أدنى حد. ومن خلال تغذية النظام ببيانات من محاولات الفشل الخاصة بالروبوت، تمكنوا من تعليمه أي الانحرافات عن المسار المخطط له كانت خطيرة. تعلم النظام معاقبة الحركات التي تبدو وكأنها ستؤدي إلى السقوط، مما يوجه الروبوت للعودة نحو مركز مستقر. سمح هذا للروبوت بامتصاص الصدمات والتمايلات الصغيرة التي كانت ستؤدي سابقاً إلى انهياره، محولاً آلة صلبة وهشة إلى آلة يمكنها التكيف مع العالم الحقيقي.
يمثل هذا العمل خطوة مهمة للأمام في مجال الروبوتات ميسورة التكلفة. فهو يثبت أنه حتى الروبوت المبني من أجز_اء رخيصة وجاهزة مع مستشعرات محدودة يمكنه تحقيق حركة موثوقة ومستقلة إذا تم تزويده بنوع صحيح من التعلم. لقد أظهر الباحثون أنه من خلال الجمع بين استراتيجية تحكم بسيطة والتعلم القائم على البيانات، يمكنهم سد الفجوة بين روبوت يحتاج إلى إمساك يد إنسان وروبوت يمكنه المشي بمفرده. وبينما لا يزال الروبوت يتحرك ببطء ولم يتقن بعد المهام المعقدة مثل الدوران أو المشي بسرعة، فإن القدرة على المشي دون السقوط هي متطلب أساسي لأي تطبيق مستقبلي. تؤكد الدراسة أنه مع وجود البرمجيات المناسبة، يمكن التغلب على قيود العتاد منخفض التكلفة، مما يفتح الباب أمام روبوتات أكثر قدرة وسهولة في الوصول إليها في مجالات البحث والتعليم.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.