← أحدث الأبحاث
🤖 AI

Skill Composition for Legged Robot Reinforcement Learning

تجادل هذه الورقة بأن التعامل مع التركيب الموثوق للسياسات الفرعية المستقلة والمتخصصة كمسألة بحثية متميزة أمر ضروري لتحويل مهارات الروبوت المتجزئة إلى مجموعة مهارات قابلة للتحقق والتوسع والأمان، والتي يمكن إدارتها بفعالية من قبل المخططين رفيعي المستوى.

المؤلفون الأصليون: Daniel Gigliotti, Flavio Maiorana, Fabio Patrizi, Luca Iocchi

نُشر 2026-09-15
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Daniel Gigliotti, Flavio Maiorana, Fabio Patrizi, Luca Iocchi

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

لم تعد الروبوتات التي تمشي أو تركض أو تتسلق مجرد أحلام نظرية؛ بل أصبحت واقعاً ملموساً، مدعومة بطريقة تسمى "التعلم التعزيزي العميق". في هذا النهج، يتعلم برنامج حاسوبي كيفية التحكم في روبوت من خلال التجربة والخطأ داخل محاكاة، ليتقن في النهاية حركات معقدة مثل رياضة الباركور أو التنقل في التضاريس الوعرة. وقد كان المفتاح لهذا النجاح هو تدريب الروبوت على أداء مهمة محددة واحدة في كل مرة، مثل المشي للأمام أو ركل كرة. وتتميز هذه المتحكمات المتخصصة بأنها سريعة التدريب وموثوقة للغاية لأنها تركز على مشكلة ضيقة النطاق. ومع ذلك، لا تزال هناك عقبة رئيسية: وهي جعل هذه المهارات المنفصلة تعمل معاً بسلاسة. فإذا احتاج الروبوت إلى المشي ثم القفز، فإن مجرد الانتقال من متحكم "المشي" إلى متحكم "القفز" غالباً ما يؤدي إلى الفشل؛ فقد يتوقف الروبوت فجأة في مكانه، فاقداً كل الزخم الذي بناه، أو قد يسقط لأن متحكم القفز يتوقع أن يكون الروبوت واقفاً في مكانه، وليس متحركاً. ولا يكمن التحدي في امتلاك مكتبة من المهارات فحسب، بل في معرفة كيفية نقل التحكم من مهارة إلى أخرى دون كسر توازن الروبوت أو إهدار طاقته.

ويرى الباحثون في جامعة سابينزا بروما أن عملية التسليم هذه، والتي يسمونها "التركيب" (composition)، تستحق أن تُعامل كمشكلة علمية جادة في حد ذاتها، بدلاً من كونها مجرد تفصيل تقني يتم إصلاحه عند ظهوره. وهم يقترحون أنه بدلاً من محاولة تدريب "دماغ عملاق" واحد للقيام بكل شيء في وقت واحد، أو ببساطة إيقاف الروبوت للتبديل بين المهام، يجب علينا بناء أنظمة يمكن فيها دمج "خبراء مستقلين" بأمان. وقد حددوا طريقتين رئيسيتين للقيام بذلك: الأولى هي "المزج" (blending)، حيث تكون أفعال الروبوت مزيجاً سلسًا من مهارتين تحدثان في وقت واحد، مثل خبير مشي وخبير ركل يعملان معاً. والثانية هي "التجسير" (bridging)، حيث يتولى متحكم متخصص ومؤقت زمام الأمور للحظة وجيزة لتهيئة الروبوت للمهارة التالية. ويضمن هذا "الجسر" أنه حتى لو كان الروبوت في حالة فوضوية عندما يحين وقت التبديل، فإنه يمكن توجيهه إلى وضع يمكن للمهارة التالية أن تتولى السيطرة منه بنجاح.

ولاختبار هذه الأفكار، بنى الفريق نظاماً لروبوت بشري يمكنه المشي في ممر ثم القفز، كل ذلك دون توقف. لقد تم تدريب مهارة المشي على تحريك الروبوت للأمام، بينما تم تدريب مهارة القفز من وضع السكون. وفي الإعداد التقليدي، إذا حاول الروبوت القفز أثناء الجري، فسيفشل متحكم القفز لأنه لم يسبق له رؤية روبوت متحرك من قبل. وقد حل الباحثون هذه المشكلة بإنشاء "جسر"؛ وهذا الجسر هو متحكم قصير الأمد يتم تفعيله في اللحظة التي يتم فيها اتخاذ قرار القفز. ومهمته الوحيدة هي أخذ الربوت، الذي يتحرك حالياً، وتوجيهه إلى وضعية القرفصاء التي يمكن لمهارة القفز التعامل معها، كل ذلك مع الحفاظ على السرعة الأمامية التي بناها الروبوت. وكانت النتيجة روبوتاً ينتقل مباشرة من المشي إلى القفز، مستخدماً زخمه الخاص للمساعدة في القفزة، بدلاً من التوقف أولاً. وقد تم إثبات ذلك في عمليات المحاكاة حيث نجح الروبوت في الانتقال من المشي إلى القفز، محافظاً على سرعته وتوازنه طوال فترة الانتقال.

كما استكشف الباحثون نهج المزج باستخدام مهمة مختلفة: ركل الكرة. هنا، قاموا بدمج مهارة المشي مع مهارة الركل. وبدلاً من التبديل بينهما، استخدموا شبكة صغيرة لخلط هذين الإجراءين معاً. تعلم النظام الاعتماد بشكل أساسي على مهارة المشي عندما يكون الروبوت بعيداً عن الكرة، والتحول تدريجياً إلى مهارة الركل مع اقترابه منها. وسمح هذا للروبوت بتعديل خطوته ووضعية جسمه بشكل طبيعي أثناء اقترابه من الكرة، بدلاً من التوقف للركل. ووجد الباحثون أنه من خلال إبقاء مهارات المشي والقفز الأصلية ثابتة وغير متغيرة، وتدريب الشبكات الصغيرة التي تقرر كيفية المزج أو التبديل بينها فقط، استطاعوا إنشاء سلوكيات معقدة دون الحاجة إلى إعادة تدريب الروبوت بالكامل من الصفر.

ويتمثل جزء حاسم من عملهم في فكرة أن قرار التبديل بين المهارات يجب أن يتم بواسطة مكون منفصل ومفهوم، مثل مخطط أو نظام بسيط قائم على القواعد، بدلاً من شبكة عصبية "صندوق أسود" تتخذ قرارات غير متوقعة. ومن خلال فصل صانع القرار عن منفذ الإجراء، واستخدام "جسر" للتعامل مع الانتقال الفوضوي، يعتقد الباحثون أنه يمكن جعل الروبوتات أكثر أماناً وموثوقية. فإذا قرر المخطط أن الروبوت يجب أن يقفز، فإنه ليس بحاجة لمعرفة الفيزياء المعقدة لكيفية إدخال الروبوت في وضعية القفز؛ بل يحتاج فقط إلى طلب القفز، وسيتولى "الجسر" المهمة الصعبة المتمثلة في تهيئة الروبوت. ويسمح هذا النهج بوجود مكتبة من المهارات يمكن أن تنمو بمرور الوقت، مع إضافة سلوكيات جديدة دون كسر السلوكيات القديمة. وبينما تعتمد النتائج الحالية على عمليات المحاكاة وحالات اختبار محددة، فإن هذا العمل يشير إلى مسار مستقبلي لبناء روبوتات يمكنها التعامل مع مهام طويلة ومعقدة من خلال ربط مهارات بسيطة وموثوقة معاً، بدلاً من محاولة تعلم كل شيء دفعة واحدة.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →