HaWMPO: Hallucination-Aware World Model-based Policy Optimization for Generalist Robot Policy
यह शोध पत्र HaWMPO का प्रस्ताव करता है, जो एक मतिभ्रम-जागरूक (hallucination-aware) वर्ल्ड मॉडल-आधारित नीति अनुकूलन ढांचा है जो काल्पनिक रोलआउट के दौरान भविष्यवाणी मतिभ्रम (prediction hallucinations) का अनुमान लगाकर और उन्हें दबाकर सामान्यज्ञ रोबोट नीतियों को बढ़ाता है, जिससे बेंचमार्क और वास्तविक दुनिया के रोबोटों दोनों पर जटिल दीर्घ-क्षितिज हेरफेर कार्यों (complex long-horizon manipulation tasks) में सफलता दर में उल्लेखनीय सुधार होता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
रोबोट जो ब्लॉक को एक के ऊपर एक रखने से लेकर कपड़े तह करने जैसे विभिन्न प्रकार के कार्यों को करना सीख सकते हैं, लंबे समय से आर्टिफिशियल इंटेलिजेंस का एक लक्ष्य रहे हैं। इसे प्राप्त करने के लिए, शोधकर्ताओं ने "जनरलिस्ट" (सामान्यज्ञ) नीतियों को विकसित किया है, जो अनिवार्य रूप से मस्तिष्क जैसी प्रणालियाँ हैं जिन्हें भाषा और दृष्टि को समझने के लिए प्रशिक्षित किया गया है ताकि यह तय किया जा सके कि एक रोबोट को कैसे हिलना-डुलना चाहिए। हालाँकि, इन प्रणालियों को वास्तविक दुनिया में सिखाना धीमा, महंगा और जोखिम भरा है। हर बार जब एक रोबोट कोई नया कार्य करने की कोशिश करता है, तो वह कुछ तोड़ सकता है या खुद को नुकसान पहुँचा सकता है, जिससे परीक्षण और त्रुटि (ट्रायल एंड एरर) की प्रक्रिया खतरनाक हो जाती है। इसे हल करने के लिए, वैज्ञानिक "वर्ल्ड मॉडल्स" (विश्व मॉडल) की ओर मुड़े हैं, जो डिजिटल सिम्युलेटर हैं जो रोबकों को कंप्यूटर के भीतर अभ्यास करने की अनुमति देते हैं। ये मॉडल वर्तमान कार्यों के आधार पर यह भविष्यवाणी करते हैं कि आगे क्या होगा, जिससे सीखने के लिए एक सुरक्षित स्थान बनता है। फिर भी, ये डिजिटल सिम्युलेटर पूर्ण नहीं हैं; जैसे-जैसे वे भविष्य में और आगे की भविष्यवाणी करते हैं, वे अक्सर ऐसी विवरणों का आविष्कार करने लगते हैं जो कभी हुए ही नहीं थे, जिसे "हैलुसिनेशन" (भ्रम) नामक घटना कहा जाता है। यदि एक रोबोट इन नकली परिदृश्यों से सीखता है, तो वह ऐसे कार्य करने के लिए सीख सकता है जो कंप्यूटर में तो काम करते हैं लेकिन वास्तविक दुनिया में पूरी तरह विफल हो जाते हैं।
शोधकर्ताओं की एक टीम ने रोबोटों को इन अपूर्ण डिजिटल सिमुलेशन से उनकी गलतियों से भ्रमित हुए बिना प्रभावी ढंग से सीखने में मदद करने के लिए एक नई विधि विकसित की है। वे अपने दृष्टिकोण को HaWMPO कहते हैं, जो एक ऐसी प्रणाली है जिसे रोबोट को यह समझने के लिए डिज़ाइन किया गया है कि उनका डिजिटल प्रशिक्षण क्षेत्र कब झूठ बोल रहा है। प्रत्येक काल्पनिक परिदृश्य को समान रूप से मूल्यवान मानने के बजाय, नई प्रणाली में एक विशेष घटक शामिल है जो एक गुणवत्ता नियंत्रण निरीक्षक की तरह कार्य करता है। यह निरीक्षक सिम्युलेटर द्वारा उत्पन्न छवियों के अनुक्रम (सीक्वेंस) को देखता है और एक स्कोर प्रदान करता है जो उस अनुक्रम की विश्वसनीयता को दर्शाता है। यदि सिम्युलेटर कल्पना की दुनिया में भटकने लगता है, और ऐसी छवियां बनाने लगता है जो भौतिकी के नियमों या अपेक्षित परिणाम से मेल नहीं खाती हैं, तो निरीक्षक इसे चिह्नित कर देता है। सिस्टम फिर इस जानकारी का उपयोग सीखने की प्रक्रिया को समायोजित करने के लिए करता है, प्रभावी रूप से रोबोट को उन हिस्सों को अनदेखा करने के लिए कहता है जो बहुत अविश्वसनीय लगते हैं और उन हिस्सों पर ध्यान केंद्रित करने के लिए कहता है जो यथार्थवादी दिखते हैं।
शोधकर्ताओं ने इस विधि का परीक्षण LIBERO नामक एक कंप्यूटर वातावरण में रोबोटिक कार्यों के एक मानक सेट का उपयोग करके किया, जिसमें वस्तुओं को विशिष्ट स्थानों पर ले जाना शामिल है। उन्होंने अपने नए सिस्टम की तुलना अन्य विधियों से की जो वर्ल्ड मॉडल्स का उपयोग करती हैं लेकिन उनमें गुणवत्ता नियंत्रण सुविधा का अभाव है। परिणामों ने नए दृष्टिकोण के लिए एक स्पष्ट लाभ दिखाया। सिमुलेशन में, इस हॉलुसिनेशन-अवेयर (भ्रम-जागरूक) सिस्टम का उपयोग करने वाले रोबोट ने 63.7 प्रतिशत की सफलता दर हासिल की, जो अगली सबसे अच्छी विधि से काफी अधिक थी। सुधार विशेष रूप से स्थानिक तर्क (स्पेशियल रीजनिंग) और वस्तु हेरफेर वाले कार्यों में देखा गया, जहाँ वास्तविक और नकली परिदृश्यों के बीच अंतर करने की रोबोट की क्षमता ने इसे अधिक मजबूत रणनीतियाँ सीखने में मदद की। शोधकर्ताओं ने पाया कि जब उन्होंने रोबोट को अत्यधिक हॉलुसिनेटेड परिदृश्यों पर निर्भर होने के लिए दंडित किया, तो सिस्टम ने रोबोट को उन बुरी आदतों को सीखने से रोका जो केवल एक टूटे हुए सिमुलेशन में काम करतीं।
यह सुनिश्चित करने के लिए कि यह विधि कंप्यूटर के बाहर भी काम करती है, टीम ने एक वास्तविक सेटिंग में एक भौतिक रोबोट पर भी इसका परीक्षण किया। उन्होंने रोबोट को दो विशिष्ट चुनौतियों के साथ कार्य दिया: एक बॉक्स में टिश्यू रखना और स्टैंड पर हेडफ़ोन रखना। नए सिस्टम के बिना, रोबोट हेडफ़ोन कार्य पर लगभग 60 प्रतिशत बार सफल होता था। हॉलुसिनेशन-अवेयर ट्रेनिंग लागू करने के बाद, सफलता दर बढ़कर औसतन 0.8 का AUC हो गई, जिसमें रोबोट ने टिश्यू कार्य पर 85% और हेडफ़ोन कार्य पर 75% की सफलता प्राप्त की। प्रदर्शन में यह उछाल यह प्रदर्शित करता है कि डिजिटल दुनिया में सीखे गए सबक वास्तव में भौतिक दुनिया में हस्तांतरणीय थे, क्योंकि रोबोट ने उस डिजिटल शोर को अनदेखा करना सीख लिया था जो आमतौर पर इन प्रणालियों को भ्रमित करता है। शोधकर्ताओं ने नोट किया कि सिस्टम निरंतर सिम्युलेटेड भविष्य की निरंतरता की जांच करके काम करता है, यह सुनिश्चित करता है कि रोबोट केवल उन्हीं पथों (ट्रैजेक्टरीज) से सीखे जो भौतिक रूप से प्रशंसनीय दिखते हैं।
यह अध्ययन इस बात पर प्रकाश डालता है कि बेहतर रोबोट लर्निंग के लिए कुंजी केवल एक सिम्युलेटर होना नहीं है, बल्कि उस पर विश्वास करने का एक तरीका होना है। एक ऐसी प्रणाली बनाने के माध्यम से जो यह पता लगा सके कि सिमुलेशन वास्तविकता से अपना नियंत्रण खो रहा है, शोधकर्ताओं ने रोबोटों के सुधार के लिए एक अधिक स्थिर मार्ग बनाया है। जबकि वर्तमान परीक्षण अपेक्षाकृत छोटे कार्यों के लिए किए गए थे, सफलता यह सुझाव देती है कि यह दृष्टिकोण अधिक जटिल, दीर्घकालिक मिशनों के लिए महत्वपूर्ण हो सकता है जहाँ रोबोट को कई चरणों की योजना बनानी होती है। यह कार्य पुष्टि करता है कि रोबोटों को वास्तव में सामान्य-उद्देश्य के सहायक बनने के लिए, उन्हें एक उपयोगी भविष्यवाणी और एक विश्वसनीय झूठ के बीच अंतर करना सीखना होगा, एक कौशल जो यह नई विधि प्रदान करती है क्योंकि यह सीखने की प्रक्रिया को स्वयं की सीमाओं के प्रति जागरूक बनाती है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।