HaWMPO: Hallucination-Aware World Model-based Policy Optimization for Generalist Robot Policy
تقترح الورقة البحثية إطار عمل HaWMPO، وهو تحسين سياسة قائم على نموذج عالمي مدرك للهلوسة، يعمل على تعزيز سياسات الروبوتات العامة من خلال تقدیم وتثبيط هلوسات التنبؤ أثناء عمليات التدحرج المتخيلة، مما يحسن بشكل كبير معدلات النجاح في مهام التلاعب المعقدة طويلة الأمد في كل من الاختبارات القياسية والروبوتات الحقيقية.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
لطالما كان تطوير روبوتات يمكنها تعلم أداء مجموعة واسعة من المهام، من رص المكعبات إلى طي الملابس، هدفاً طالما سعى إليه الذكاء الاصطناعي. ولتحقيق ذلك، طور الباحثون سياسات "عامة"، وهي في الأساس أنظمة تشبه الدماغ تم تدريبها على فهم اللغة والرؤية لتقرير كيفية تحرك الروبوت. ومع ذلك، فإن تعليم هذه الأنظمة في العالم الحقيقي عملية بطيئة ومكلفة ومحفوفة بالمخاطر؛ ففي كل مرة يحاول فيها الروبوت تجربة إجراء جديد، قد يكسر شيئاً ما أو يتلف نفسه، مما يجعل عملية التجربة والخطأ خطيرة. ولحل هذه المشكلة، لجأ العلماء إلى "نماذج العالم"، وهي محاكيات رقمية تسمح للروبوتات بالتدرب داخل جهاز كمبيوتر. تتنبأ هذه النماذج بما سيحدث لاحقاً بناءً على الأفعال الحالية، مما يخلق مساحة آمنة للتعلم. ومع ذلك، فإن هذه المحاكيات الرقمية ليست مثالية؛ فكلما تنبأت بمدى أبعد في المستقبل، بدأت غالباً في ابتكار تفاصيل لم تحدث قط، وهي ظاهرة تُعرف باسم "الهلوسة". وإذا تعلم الروبوت من هذه السيناريوهات الوهمية، فقد يتعلم القيام بأفعال تنجح في الكمبيوتر ولكنها تفشل تماماً في العالم الحقيقي.
لقد طور فريق من الباحثين طريقة جديدة لمساعدة الروبوتات على التعلم بفعالية من هذه المحاكاة الرقمية غير الكاملة دون أن تضللها أخطاؤها. وقد أطلقوا على نهجهم اسم HaWMPO، وهو نظام مصمم لجعل الروبوتات مدركة للحظات التي يكذب فيها ميدان تدريبها الرقمي عليها. وبدلاً من معاملة كل سيناريو متخيّل على أنه ذو قيمة متساوية، يتضمن النظام الجديد مكوناً خاصاً يعمل مثل مفتش مراقبة الجودة. ينظر هذا المفتش إلى تسلسل الصور التي يولدها المحاكي ويخصص درجة تشير إلى مدى موثوقية ذلك التسلسل. فإذا بدأ المحاكي في الانزلاق نحو الخيال، مبتكراً صوراً لا تتوافق مع قوانين الفيزياء أو النتائج المتوقعة، يقوم المفتش بوضع علامة تحذير. ثم يستخدم النظام هذه المعلومات لتعديل عملية التعلم، مما يخبر الروبوت فعلياً بتجاهل أجزاء المحاكاة التي تبدو غير موثوقة للغاية والتركيز على الأجزاء التي تبدو واقعية.
اختبر الباحثون هذه الطريقة باستخدام مجموعة قياسية من المهام الروبوتية في بيئة حاسوبية تسمى LIBERO، والتي تتضمن نقل الأشياء إلى مواقع محددة. وقارنوا نظامهم الجديد بطرق أخرى تستخدم نماذج العالم ولكنها تفتقر إلى ميزة مراقبة الجودة هذه. وأظهرت النتائج ميزة واضحة للنهج الجديد؛ ففي المحاكاة، حقق الروبوت الذي يستخدم نظاماً واعياً بالهلوسة نسبة نجاح بلغت 63.7 بالمئة، وهي أعلى بكlu significantly من أفضل طريقة تالية. وكان التحسن ملحوظاً بشكل خاص في المهام التي تتطلب التفكير المكاني والتعامل مع الأشياء، حيث ساعدت قدرة الروبوت على التمييز بين السيناريوهات الحقيقية والزائفة في تعلم استراتيجيات أكثر قوة. ووجد الباحثون أنه من خلال معاقبة الروبوت عندما يعتمد على سيناريوهات عالية الهلوسة، منع النظام الروبوت من تعلم عادات سيئة لا تعمل إلا في محاكاة معطلة.
ولضمان نجاح هذه الطريقة خارج نطاق الكمبيوتر، اختبر الفريق أيضاً طريقة عملها على روبوت مادي في بيئة واقعية. كلفوا الروبوت بتحديين محددين: وضع منديل ورقي في صندوق ووضع سماعات الرأس على حامل. بدون النظام الجديد، نجح الروبوت في هذه المهام بنسبة 60 بالمئة تقريباً في مهمة سماعات الرأس. وبعد تطبيق التدريب الواعي بالهلوسة، ارتفعت نسبة النجاح إلى متوسط (AUC) قدره 0.8، حيث حقق الروبوت 85% في مهمة المنديل و75% في مهمة سماعات الرأس. يثبت هذا القفزة في الأداء أن الدروس المستفادة في العالم الرقمي كانت قابلة للنقل بالفعل إلى العالم المادي، لأن الروبوت تعلم تجاهل الضجيج الرقمي الذي يربك هذه الأنظمة عادةً. وأشار الباحثون إلى أن النظام يعمل من خلال التحقق باستمرار من اتساق المستقبل المحاكى، مما يضمن أن الروبوت يتعلم فقط من المسارات التي تبدو منطقية فيزيائياً.
تسلط الدراسة الضوء على أن المفتاح لتحسين تعلم الروبوتات ليس مجرد امتلاك محاكي، بل امتلاك وسيلة للوثوق به. ومن خلال بناء نظام يمكنه اكتشاف اللحظات التي يفقد فيها المحاكي سيطرته على الواقع، خلق الباحثون مساراً أكثر استقراراً لتطور الروبوتات. وبينما أجريت الاختبارات الحالية على مهام قصيرة نسبياً، فإن هذا النجاح يشير إلى أن هذا النهج قد يكون حيوياً لمهام أكثر تعقيداً وطويلة الأمد حيث يجب على الروبوت التخطيط لخطوات عديدة مستقبلاً. ويؤكد العمل أنه لكي تصبح الروبوتات مساعدات عامة الغرض حقاً، يجب أن تتعلم التمييز بين التنبؤ المفيد والكذب المقنع، وهي مهارة يوفرها هذا المنهج الجديد من خلال جعل عملية التعلم نفسها واعية بحدودها.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.