APEX: Learning Adaptive High-Platform Traversal for Humanoid Robots
تقدم الورقة البحثية إطار عمل APEX، وهو إطار للتعلم التعزيزي العميق يُمكّن روبوتًا بشريًا من طراز Unitree G1 بـ 29 درجة حرية من عبور منصات يصل ارتفاعها إلى 114% من طول ساقه بشكل مستقل عبر دمج مهارات التسلق الإدراكي، والمشي، وإعادة التشكيل من خلال مكافأة تقدم "الترس" (ratchet progress) المبتكرة واستراتيجيات إدراك قوية للنقل من المحاكاة إلى الواقع.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل روبوتاً بشرياً كطفل صغير متعثر يتعلم المشي. لفترة طويلة، كانت هذه الروبوتات بارعة في المشي على الأرض المستوية أو تجاوز البرك الصغيرة. ولكن إذا وضعت طاولة عالية أمامها (أطول من أرجلها)، فغالباً ما كانت تحاول القفز فوقها.
المشكلة في القفز هي أنه يشبه محاولة طفل صغير القفز فوق طاولة المطبخ: فهو يتطلب دفعة هائلة من الطاقة، وغالباً ما ينتهي الأمر باصطدام عنيف، وإذا أخطأ الروبوت في القفزة، فقد تكسر مفاصله أو يسقط. إنه أمر خطير وغير فعال.
نظام APEX هو نظام جديد يعلم الروبوت التوقف عن القفز والبدء في التسلق، تماماً كما يفعل البشر. إليك كيف يعمل، مقسماً إلى مفاهيم بسيطة:
1. عقلية "التسلق"
بدلاً من معاملة الروبوت كآلة تستخدم قدميها فقط، يعلم APEX الروبوت استخدام جسده بالكامل.
- التشبيه: فكر في متسلق صخور يتسلق جداراً؛ فهو لا يقفز فحسب، بل يستخدم يديه وركبتيه وجذعه للعثور على مقابض، وتغيير وزنه، وسحب نفسه للأعلى.
- مهارات الروبوت: يتعلم الروبوت ست حركات محددة:
- الصعود (Climb-up): استخدام اليدين والقدمين لسحب نفسه فوق منصة عالية.
- الهبوط (Climb-down): خفض نفسه للأسفل بعناية.
- الوقوف والاستلقاء (Stand-up & Lie-down): تغيير وضعية جسمه (من الوقوف إلى الاستلقاء على بطنه) ليتناسب مع المساحات الضيقة أو لإعادة تموضع نفسه.
- المشي والزحف (Walk & Crawl): التحرك حول المنصة بمجرد وصوله إليها.
2. "مكافأة الترس" (السر الخفي)
هذا هو الجزء الأكثر ذكاءً في الورقة البحثية. عادةً، عندما تعلم روبوتاً، فإنك تعطيه مكافأة عند إنهاء المهمة. لكن بالنسبة للتسلق، فإن الانتظار حتى النهاية لقول "عمل جيد!" هو أمر بطيء للغاية؛ فقد يعلق الروبوت في منتصف الطريق ولا يعرف ماذا يفعل بعد ذلك.
ابتكر المؤلفون ما يسمى بـ "مكافأة التقدم التراجعي" (Ratchet Progress Reward).
- التشبيه: تخيل مفتاح الربط ذو الترس (الأداة التي يستخدمها الميكانيكيون)؛ فهو يدور للأمام فقط ولا يمكنه الرجوع للخلف.
- كيف يعمل: يحتفظ الروبوت بملاحظة ذهنية لـ "أفضل تقدم حققه حتى الآن".
- إذا تحرك الروبوت للأمام (ولو قليلاً) أو اقتربت يده من الحافة، فإنه يحصل على مكافأة صغيرة.
- إذا تحرك للخلف أو بقي في نفس المكان، فإنه يحصل على عقوبة.
- الأهم من ذلك: النظام لا يهتم بمدى سرعة حركة الروبوت، بل يهتم فقط بأن يحرز تقدماً حقيقياً.
- لماذا هذا مهم: هذا يمنع الروبوت من "الغش" عبر الاهتزاز ذهاباً وإياباً أو الاندفاع نحو قفزة خطيرة. إنه يجبر الروبوت على أن يكون صبوراً، ويجد موطئ قدم مستقراً، ويسحب نفسه للأعلى ببطء، تماماً مثل المتسلق الحذر.
3. نظام "المعلم والطالب"
تعلم كل هذه الحركات المعقدة دفعة واحدة هو أمر صعب جداً على عقل واحد. لذا، استخدم الباحثون عملية من خطوتين:
- الخطوة 1: المعلمون. قاموا بتدريب ستة روبوتات "خبيرة" منفصلة (معلمين). أحدهم خبير في التسلق للأعلى، وآخر في التسلق للأسفل، وآخر في الوقوف، وهكذا. تعلموا هذه المهارات في عالم افتراضي (محاكاة) حيث يمكنهم الفشل آلاف المرات دون كسر أي شيء.
- الخطوة 2: الطالب. أنشأوا روبوتاً واحداً "طالباً" وعلموه تقليد جميع المعلمين الستة.
- التشبيه: تخيل طالباً يدون ملاحظاته من ستة أساتذة مختلفين (واحد للرياضيات، وآخر للتاريخ، وآخر للفن). يتعلم الطالب كيفية النظر إلى الموقف (التضاريس) واتخاذ القرار: "أوه، أنا عند حافة مرتفعة؟ سأستخدم ملاحظات بروفيسور التسلق. أنا على الأرض؟ سأستخدم ملاحظات بروفيسور المشي".
- يتعلم الطالب كيفية التبديل بين هذه المهارات بسلاسة دون السقوط.
4. رؤية العالم (العيون)
غالباً ما تعاني الروبوتات في رؤية العالم الحقيقي لأن كاميراتها ترتبك بسبب الظلال، أو الغبار، أو أطرافها التي تحجب الرؤية.
- التشبيه: تخيل محاولة المشي في غرفة ضبابية وأنت ترتدي نظارات بها بقع.
- الحل: علم الباحثون الروبوت توقع وجود "بقع" (ضوضاء وأخطاء) أثناء تدريبه. كما أضافوا "مرشح تنقية" للعالم الحقيقي. وهذا يعني أنه عندما يرى الروبوت بيانات غريبة تبدو وكأنها جدار ولكنها ليست كذلك، فإنه يعرف كيف يتجاهلها.
النتيجة: اختراق في العالم الحقيقي
اختبر الفريق هذا النظام على روبوت Unitite G1، وهو روبوت بشري حقيقي يحتوي على 29 مفصلاً متحركاً.
- التحدي: وضعوا منصة بارتفاع 0.8 متر (حوالي 31 بوصة). بالنسبة لهذا الروبوت، هذا الارتفاع يعادل 114% من طول ساقه. إنه يشبه إنساناً يحاول تسلق طاولة أطول من ساقيه.
- النتيجة: لم يقفز الروبوت، ولم يسقط. بل مشى نحو الحافة، واستخدم يديه لسحب نفسه للأعلى، ثم وقف على المنصة، ومشى عبرها، ثم استلقى، ثم وقف مرة أخرى، وتسلق للأسفل.
- النقل الفوري (Zero-Shot Transfer): الجزء الأكثر إثارة للإعجاب؟ لقد دربوا الروبوت في محاكاة حاسوبية، وعندما وضعوه في العالم الحقيقي، عمل فوراً دون أي ضبط إضافي. كان الأمر وكأن الروبوت استيقظ في العالم الحقيقي وعرف للتو كيف يقوم بالمهمة.
الملخص
APEX يشبه تعليم الروبوت أن يكون متسلق صخور حذراً وصبوراً بدلاً من أن يكون قافزاً متهوراً. ومن خلال استخدام "متتبع تقدم" خاص (الترس) وطريقة تعلم "المعلم والطالب"، خلقوا روبوتاً يمكنه التنقل بأمان في التضاريس العالية والصعبة التي كانت مستحيلة سابقاً على الآلات التعامل معها. إنها قفزة هائلة (بالمعنى الحرفي) نحو روبوتات يمكنها بالفعل مساعدتنا في البيئات الحقيقية المليئة بالتحديات.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.