Approach to Robust Visual Relocalization for Humanoid Robots via Mixture-of-Experts with Hierarchical Distillation
تقترح هذه الورقة إطار عمل متين لإعادة التمركز البصري للروبوتات البشرية يدمج بنية "خليط من الخبراء" مع تقطير المعرفة الهرمي لتحقيق تقدير دقيق ومستقر وفعال لدرجات الحرية الست (6-DoF) في وضعية الجسم تحت ظروف صعبة مثل التغيرات المفاجئة في زاوية الرؤية والانسداد الذاتي.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل روبوتًا يمشي على ساقين، يحاكي توازن وحركة البشر. لكي تتمكن آلة كهذه من التنقل في العالم الحقيقي، يجب أن تعرف باستمرار أين هي وكيف هي موجهة، وهي مهمة تُعرف باسم "إعادة التموضع البصري". يعتمد الروبوت على كاميرته للنظر إلى العالم، والتعرف على الأشكال والأنسجة المألوفة، وحساب موقعه في الفضاء. ومع ذلك، فإن هذه العملية هشة للغاية؛ فعندما يحرك الروبوت رأسه بسرعة، أو عندما يسير شخص أمام عدسته، أو عندما يتغير الضوء من شمس ساطعة إلى ظل عميق، يمكن للروبوت أن يفقد طريقه بسهولة. غالبًا ما تعاني الطرق التقليدية من أجل الموازنة بين الحاجة إلى الدقة المتناهية والحاجة إلى السرعة، خاصة في روبوت يمتلك قدرة حوسبة محدودة ولا يمكنه حمل معالجات ثقيلة وبطيئة.
لقد طور باحثون في جامعة يونان العادية نهجًا جديدًا لحل هذه المشكلة، حيث ابتكروا نظامًا يسمًا للروبوتات البشرية بالعثور على طريقها بشكل موثوق حتى في البيئات الفوضوية. يركز عملهم، الذي نُشر في دراسة حديثة، على تعليم "عقل" الروبوت كيف يكون ذكيًا وفعالًا في آن واحد. لقد حققوا ذلك من خلال الجمع بين مفهومين متطورين: طريقة تسمح للروبوت باختيار استراتيجيات ذهنية مختلفة لمشاهد مختلفة، وتقنية تعمل على تقليص نموذج قوي ومعقد إلى نسخة أصغر وأسرع دون فقدان قدرته على التفكير بوضوح. والنتيجة هي نظام يساعد الروبوت المسمى "KUAVO-4pro" على التنقل في الممرات الداخلية والمساحات الخارجية بدقة تصل إلى مستوى السنتيمتر، مع الحفاظ على توازنه واتجاهه حتى عندما يتغير العالم من حوله بسرعة.
يكمن التحدي الجوهري الذي عالجه الباحثون في أن مجموعة واحدة جامدة من القواعد لا يمكنها التعامل مع تنوع العالم الحقيقي. فالممر ذو الجدران الملساء والمتكررة يبدو مختلفًا تمامًا عن مكتب مزدحم بالزوايا والأشياء الكثيرة. كانت الأنظمة القديمة تحاول غالبًا استخدام نموذج واحد ضخم للتعامل مع كل شيء، مما جعلها بطيئة وعرضة للأخطاء عند تغير المشهد. يقدم الإطار الجديد مفهومًا يسمى "خليط الخبراء" (mixture of experts). فبدلاً من الاعتماد على عقل واحد عملاق، يستخدم النظام مجموعة من الشبكات الفرعية المتخصصة، أو "الخبراء". عندما ينظر الروبوت إلى مشهد ما، تقوم بوابة صغيرة لاتخاذ القرار باختيار الخبير الأنسب لهذا المنظر المحدد تلقائيًا. فإذا رأى الروبوت زاوية غنية بالنسيج، فقد يقوم بتنشيط خبير جيد في التعرف على التفاصيل. وإذا رأى جدارًا طويلاً وفارغًا، فقد ينتقل إلى خبير أفضل في فهم الخطوط المستقيمة. يتيح ذلك للروبوت تكييف تفكيره في الوقت الفعلي، باستخدام الأداة المناسبة للمهمة دون الحاجة إلى معالجة كل الاحتمالات دفعة واحدة.
ولجعل هذا النظام عمليًا لروبوت ذي قدرة محدودة على البطارية والحوسبة، واجه الباحثون عقبة ثانية: النسخة الأكثر قوة من نظام "خليط الخبراء" هذا كبيرة جدًا بحيث لا يمكن تشغيلها مباشرة على الروبوت. ولحل هذه المشكلة، استخدموا تقنية تسمى "التقطير الهرمي" (hierarchical distillation). في هذه العملية، قاموا أولاً بتدريب نموذج "معلم" كبير ومعقد يمكنه التعامل مع جميع السيناريوهات الصعبة بشكل مثالي. ثم قاموا بتدريب نموذج "طالب" أصغر بكثير ليحاكي المعلم. ومع ذلك، لم يطلبوا من الطالب مجرد نسخ الإجابة النهائية، بل علموا الطالب تقليد عملية التفكير الداخلية للمعلم. تعلم الطالب كيف قرر المعلم أي خبير يستخدم، وكيف فسر الأشكال في الصورة، وكيف ربط النقاط والخطوط لفهم البنية ثلاثية الأبعاد للغرفة. ومن خلال محاذاة هذه الخطوات الداخلية، ورث النموذج الطالب الصغير متانة وذكاء المعلم، ليصبح دقيقًا بما يكفي للاستخدام في العالم الحقيقي مع بقائه صغيرًا بما يكفي للعمل بسرعة.
اختبر الباحثون نظامهم باستخدام مجموعة متنوعة من السيناريوهات الصعبة. أجروا عمليات محاكاة على مجموعات بيانات عامة تضمنت غرفًا ذات أنسجة ضعيفة، وتغيرات شديدة في الإضاءة، وأجسامًا متحركة. وفي هذه الاختبارات، تفوق النظام باستمرار على الأساليب السابقة، محافظًا على دقة عالية حتى عندما كان منظور الروبوت محجوبًا جزئيًا أو عندما تغيرت الإضاءة بشكل كبير. كما أجرى الفريق تجارب في العالم الحقيقي باستخدام الروبوت البشري KUAVO-4pro، الذي يبلغ طوله حوالي 1.66 مترًا. وجهوا الروبوت عبر بيئات داخلية وممرات طويلة، وهي مناطق معروفة بإرباك الروبوتات بسبب أنماطها المتكررة وافتقارها للميزات المميزة. نجح الروبوت في التنقل عبر هذه المساحات، وظل مساره المقدر قريبًا بشكل ملحوظ من المسار الحقيقي. في الاختبارات الداخلية، بلغ متوسط الخطأ حوالي 2.1 سنتيمتر، وحتى في الممر الصعب، ظل الخطأ ضمن نطاق يمكن السيطرة عليه، ولم يخرج أبدًا عن السيطرة.
كانت النتيجة الرئيسية للدراسة هي مدى جودة تعامل النظام مع الانتقال بين أنواع البيئات المختلفة. فعندما انتقل الروبوت من منطقة مشرقة ومفتوحة إلى زاوية خافتة الإضاءة، أو عندما مر شخص أمام الكاميرا، لم يصاب النظام بالذعر أو يفقد مكانه. كانت الخبراء المتخصصون داخل النموذج يتم تنشيطهم وإلغاء تنشيطهم بسلاسة، مما ضمن بقاء فهم الروبوت لمحيطه مستقرًا. وكان النموذج الطالب الأصغر، الذي يقل حجم بارامتراته بنسبة 70% عن المعلم الأصلي، يعمل بشكل يقارب أداء النسخة الأكبر. وقد أثبت ذلك أن عملية التقطير نجحت في نقل الاستدلال الهندسي المعقد للنموذج الكبير إلى حزمة مدمجة. تمكن الروبوت من حساب موقعه في حوالي 33 مللي ثانية، وهي سرعة كافية لمواكبة الحركات السريعة للروبوت البشري الذي يمشي.
يشير نجاح هذا النهج إلى مسار قابل للتطبيق للروبوتات المستقلة التي تحتاج إلى العمل في بيئات بشرية ديناميكية وغير منظمة. فمن خلال الجمع بين مرونة اختيار الخبراء المختلفين وكفاءة النموذج الطالب المقطر، نجح الباحثون في إنشاء نظام لا يضطر للتضحية بالدقة من أجل السرعة. يمكن للروبوت الآن التعامل مع عدم القدرة على التنبؤ في العالم الحقيقي، من الظلال المفاجئة إلى الأشخاص المتحركين، دون الحاجة إلى حاسوب خارق على ظهره. وبينما يشير الباحثون إلى أن العمل المستقبلي قد يتضمن إضافة بيانات من مستشعرات أخرى مثل الجيروسكوبات لزيادة تحسين الاستقرار، فإن هذا العمل الحالي يثبت أن الروبوت يمكن أن يكون خفيف الوزن وموثوقًا للغاية. إنه يمثل خطوة مهمة نحو آلات يمكنها التحرك عبر عالمنا بنفس الثقة والقدرة على التكيف التي يمتلكها البشر، لتجد طريقها حتى عندما يكون المنظر محجوبًا أو المسار غير واضح.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.