Robot Squid Game: Quadrupedal Locomotion for Traversing Narrow Tunnels
تقدم هذه الورقة إطار عمل للتعلم التعزيزي يجمع بين التوليد الإجرائي للبيئة وتقطير السياسة لتمكين الروبوتات رباعية الأرجل من عبور بيئات الأنفاق ثلاثية الأبعاد المعقدة والضيقة بمتانة، وذلك عبر نقل المعرفة من سياسات خبيرة متخصصة إلى سياسة طالب موحدة.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أنك تحاول تعليم كلب آلي بأربع أرجل كيف يزحف عبر سلسلة من الأنفاق الضيقة وذات الأشكال الغريبة. بعض الأنفاق دائرية، وبعضها مثلثية، وبعضها أنصاف دوائر مقلوبة، كما توجد فجوات في الأرض حيث يتعين على الروبوت القفز من حافة إلى أخرى.
هذا هو التحدي الذي تعالجه ورقة البحث "Robot Squid Game". فقد ابتكر المؤلفون، أمير حسين راج، وديبيندوي داس، وشيوسو شياو، نظامًا أطلقوا عليه اسم SQUID (التنقل الرباعي الأرجل المعتمد على دمج المهارات باستخدام التقليد والاستخلاص) لمساعدة الروبوتات على التنقل في هذه المساحات ثلاثية الأبعاد الضيقة دون أن تعلق أو تصطدم بالجدران.
إليك كيف فعلوا ذلك، مشروحًا ببساه:
المشكلة: فخ "المقاس الواحد الذي يناسب الجميع"
عادةً، عندما نعلم الروبوتات المشي، قد ندربها على نوع محدد من العوائق. لكن الأنفاق في العالم الحقيقي فوضوية؛ فهي يتغير شكلها وحجمها وزاويتها.
- الطريقة القديمة: تخيل أنك تحاول تعليم روبوت المشي عبر نفق دائري، ثم نفق مربع، ثم نفق متعرج، وكل ذلك في وقت واحد. سيصاب الروبوت بالارتباك. الأمر يشبه محاولة تعلم قيادة سيارة على طريق سريع، ثم طريق ترابي، ثم مرآب ضيق للغاية، في درس واحد. غالبًا ما يفشل الروبوت لأن القواعد لكل منها مختلفة تمامًا.
- القصور: الطرق الموجودة حاليًا إما أن تقع في فخ الأنماط الجامدة (مثل روبوت يعرف فقط كيف يمشي في خط مستقيم) أو أنها تُصاب بالارتباك بسبب "الضجيج" الناتج عن مستشعرات العالم الحقيقي (مثل روبوت يصاب بالذعر عندما ترى "عيناه" جدارًا ضبابيًا).
الحل: "الشيف الماهر" و"المتدرب"
ابتكر المؤلفون استراتيجية تدريب ذكية باستخدام نهج المعلم-التلميذ. فكر في الأمر كمدرسة لتعليم فن الطهي.
الطهاة المتخصصون (المعلمون):
بدلاً من محاولة تعليم روبوت واحد كل شيء في وقت واحد، قاموا بإنشاء أربعة روبوتات "خبيرة" مختلفة.- الخبير (أ) يتدرب فقط في الأنفاق المثلثية.
- الخبير (ب) يتدرب فقط في الأنفاق الدائرية.
- الخبير (ج) يتدرب فقط في أنصاف الدوائر المقلوبة.
- الخبير (د) يتدرب فقط في أنفاق الفجوات (حيث يتعين عليك القفز).
تم تدريب هؤلاء الخبراء في عالم مثالي تم إنشاؤه بواسطة الكمبيوتر حيث يمتلكون "رؤية خارقة". يمكنهم رؤية الشكل الدقيق للنفق والمسار المثالي لاتخاذه، حتى لو كان هذا المسار مستحيلاً رؤيته في العالم الحقيقي. لقد أصبحوا أساتذة في نوع النفق الخاص بهم.
المطبخ الإجرائي (البيئة):
للتأكد من أن هؤلاء الخبراء أقوياء حقًا، لا يقوم الكمبيوتر ببناء نفق واحد فحسب، بل يستخدم "مولدًا إجرائيًا" (مثل مولد الأرقام العشوائية) لبناء آلاف الأنفاق بأحجام وزوايا وصعوبات مختلفة. الأمر يشبه تدريب شيف في مطبخ يتحرك فيه الموقد، ويميل فيه الأرض، وتتغير فيه الجدران في كل مرة يلتفت فيها. هذا يمنع الروبوت من مجرد حفظ مسار معين؛ بل يجب عليه تعلم كيفية الحركة.المتدرب (التلميذ):
بمجرد أن يصبح هؤلاء الخبراء الأربعة أساتذة، يقوم الفريق بإنشاء روبوت نهائي واحد — وهو التلميذ. هذا الروبوت هو الذي سيذهب فعليًا إلى العالم الحقيقي.- التلميذ ليس لديه "رؤية خارقة". لديه فقط كاميرا عمق قياسية (مثل عين ثلاثية الأبعاد) ومستشعرات في أرجله.
- يراقب التلميذ الخبراء الأربعة. عندما يكون في نفق مثلثي، يتعلم من الخبير (أ). وعندما يكون في نفق دائري، يتعلم من الخبير (ب).
- من خلال عملية تسمى الاستخلاص (Distillation)، يمتص التلميذ "ذاكرة العضلات" واستراتيجيات الخبراء الأربعة جميعهم في عقل واحد.
النتيجة: روبوت يمكنه الزحف عبر أي شيء
اختبرت الورقة هذا النظام بطريقتين:
- في الكمبيوتر (المحاكاة): ألقوا بالروبوت في أنفاق تزداد صعوبة. كان روبوت SQUID أفضل بكثير من الطرق القديمة؛ فقد اجتاز الأنفاق بشكل أسرع، واصطدم بجدران أقل، واستهلك طاقة أقل. كان بارعًا بشكل خاص في الأنفاق المثلثية وأنفاق الفجوات الصعبة حيث فشلت الروبوتات الأخرى.
- في العالم الحقيقي: وضعوا الروبوت المدرب (Unitree Go2) في نفق اختبار مادي. على الرغم من وجود "ضجيج" في العالم الحقيقي (صور كاميرا ضبابية، أرضيات غير مستوية)، نجح الروبوت في الزحف عبر دوائر ضيقة، ومثلثات مائلة، وفجوات. حقق معدل نجاح يتراوح بين 60% إلى 80% اعتمادًا على شكل النفق.
لماذا هذا مهم؟
الدرس المستفاد الرئيسي هو أنه من خلال تقسيم المشكلة الكبيرة والمخيفة (التنقل في أي نفق) إلى دروس أصغر يمكن إدارتها (إتقان نوع واحد من الأنفاق في كل مرة) ثم دمج هذه الدروس، يصبح الروبوت أكثر قدرة على التكيف.
بدلاً من روبوت يتجمد عندما يرى شكلاً غريبًا، يمتلك هذا الروبوت "صندوق أدوات" من الحركات. فهو يعرف كيف ينحني لسقف منخفض، وكيف يتمدد لسقف مرتفع، وكيف يتوازن على حافة، وكل ذلك لأنه تعلم من معلمين متخصصين ثم دمج تلك المهارات في استراتيجية واحدة ذكية وعامة الغرض.
باختصار: لقد علموا الكلب الآلي كيف يكون سيدًا في "لعبة الحبار" (Squid Game) الخاصة بالأنفاق، وذلك من خلال السماح له بالتدرب في معسكرات تدريب متخصصة قبل إرساله للعب اللعبة الحقيقية.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.