CWM: Contrastive World Models for Action Feasibility Learning in Embodied Agent Pipelines
यह शोधपत्र कॉन्ट्रास्टिव वर्ल्ड मॉडल्स (CWM) प्रस्तुत करता है, जो एक नवीन दृष्टिकोण है जो हार्ड-नेगेटिव उदाहरणों पर एक कॉन्ट्रास्टिव ऑब्जेक्टिव के साथ लार्ज लैंग्वेज मॉडल्स को फाइन-ट्यून करके एम्बॉडीड एजेंट्स में एक्शन फिएसिबिलिटी स्कोरिंग को बढ़ाता है, जिससे यह भौतिक रूप से वैध कार्यों को सूक्ष्म अमान्य कार्यों से अलग करने में पारंपरिक सुपरवाइज्ड फाइन-ट्यूनिंग की तुलना में काफी बेहतर प्रदर्शन करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक रोबोट को एक जटिल व्यंजन, जैसे कि सूफ़ले (soufflé) बनाना सिखा रहे हैं। रोबोट के पास अगले कदम के रूप में हज़ारों संभावित चीज़ों की एक सूची हो सकती है: "अंडे फोड़ना," "ओवन चालू करना," "कच्चा आटा खाना," या "हवा में चीनी घोलना।"
इनमें से अधिकांश क्रियाएं बेतुकी या शारीरिक रूप से असंभव हैं। यदि रोबोट "हवा में चीनी घोलने" की कोशिश करता है, तो वह समय बर्बाद करेगा, गंदगी फैलाएगा, या रेसिपी खराब कर देगा।
यह पेपर रोबोटों के लिए एक नया "स्मार्ट फ़िल्टर" पेश करता है जिसे CWM (कॉन्ट्रास्टिव वर्ल्ड मॉडल) कहा जाता है। इसका काम रसोई के दरवाजे पर खड़ा होकर यह कहना है: "रुको! तुम यह नहीं कर सकते। लेकिन तुम यह कर सकते हो।"
यह कैसे काम करता है और यह पुराने तरीके से बेहतर क्यों है, इसका सरल विवरण यहाँ दिया गया है।
पुराना तरीका: "हाँ/नहीं" क्विज़ (SFT)
पहले, इंजीनियर रोबोट को क्रियाओं को फ़िल्टर करने के लिए सिखाने के लिए सुपरवाइज्ड फाइन-ट्यूनिंग (SFT) नामक विधि का उपयोग करते थे।
इसे ऐसे समझें जैसे एक शिक्षक छात्र को क्विज़ दे रहा है जहाँ उन्हें प्रत्येक प्रश्न का उत्तर व्यक्तिगत रूप से "सही" या "गलत" देना होता है।
- प्रश्न: "क्या मैं कच्चा आटा खा सकता हूँ?"
- उत्तर: गलत।
- प्रश्न: "क्या मैं अंडे फोड़ सकता हूँ?"
- उत्तर: सही।
समस्या: यह स्पष्ट गलतियों (जैसे कच्चा आटा खाना) के लिए ठीक काम करता है। लेकिन यह तब विफल हो जाता है जब गलती पेचीदा हो।
- प्रश्न: "क्या मैं उबलते पानी को ठंडा कर सकता हूँ?" (रेसिपी कहती है कि इसे "उबालना" है)।
- प्रश्न: "क्या मैं उबलते पानी को गर्म कर सकता हूँ?" (यह सही है)।
इंसानों के लिए ये स्पष्ट हैं। लेकिन "हाँ/नहीं" पद्धति से प्रशिक्षित रोबोट के लिए, ये दोनों वाक्य बहुत समान दिखते हैं। रोबोट भ्रमित हो सकता है क्योंकि उसने प्रत्येक वाक्य को अलग-थलग करके सीखा है, बिना उनकी आपस में तुलना किए। वह गलती से गलत वाले के लिए भी "सही" कह सकता है।
नया तरीका: "टेस्ट-टेस्ट" मुकाबला (CWM)
इस पेपर के लेखक CWM का प्रस्ताव देते हैं, जो प्रशिक्षण के खेल को बदल देता है। "हाँ/नहीं" क्विज़ के बजाय, वे एक "टेस्ट-टेस्ट" प्रतियोगिता का उपयोग करते हैं।
कल्पना कीजिए कि रोब का एक कुकिंग शो का जज है। एक व्यंजन चखने और यह तय करने के बजाय कि वह अच्छा है या नहीं, जज को एक साथ एक परफेक्ट डिश (सही क्रिया) और 16 खराब डिश (गलत क्रियाएं) दी जाती हैं।
रोबोट का एकमात्र काम पूरे समूह को देखना और कहना है: "विजेता कौन है?"
- "हार्ड नेगेटिव्स" (कठिन गलत विकल्प): शोधकर्ताओं ने रोबोट को केवल स्पष्ट रूप से खराब डिश (जैसे "बर्तन खाना") नहीं दीं। उन्होंने उसे "हार्ड नेगेटिव्स" दिए—ऐसी डिश जो विजेता के लगभग समान दिखती हैं लेकिन थोड़ी सी गलत हैं।
- विजेता: "पानी को गर्म करना।"
- हार्ड लूज़र: "पानी को ठंडा करना।" (केवल एक शब्द का अंतर, लेकिन भौतिक विज्ञान के हिसाब से आपदा)।
रोबोट को विजेता की तुलना "लगभग-सही" लूज़र्स से करने के लिए मजबूर करके, यह सीखता है कि भौतिक रूप से क्या संभव है उसकी सूक्ष्म सीमाएं क्या हैं। वह सीखता है कि "गर्म करना" और "ठंडा करना" एक दूसरे के विपरीत हैं, भले ही वाक्य दिखने में समान हों।
परिणाम: यह क्यों मायने रखता है
शोधकर्ताओं ने इसका परीक्षण ScienceWorld नामक एक डिजिटल दुनिया में किया, जहाँ रोबोटों को विज्ञान की पहेलियाँ सुलझानी होती हैं।
- "ट्रिकी वर्ड" टेस्ट: जब गलत क्रिया सही क्रिया से केवल एक शब्द अलग थी (जैसे "ठंडा" बनाम "गर्म"), तो पुराने रोबोट ने इसे 86% बार सही किया। नए CWM रोबोट ने इसे 93% बार सही किया। यह सुनने में छोटा लग सकता है, लेकिन चरणों की एक लंबी श्रृंखला में, यह अंतर रोबोट को दीवार से टकराने से बचाता है।
- "स्ट्रेस टेस्ट": उन्होंने रोबोट को एक ऐसी नई रसोई में रखा जिसे उसने पहले कभी नहीं देखा था। पुराना रोबोट बेतरतीब ढंग से अनुमान लगाने लगा और गलत क्रियाओं को बहुत उच्च रैंक देने लगा। हालाँकि, नया रोबोट, भ्रमित होने के बावजूद, सही क्रिया को सूची में शीर्ष के पास बनाए रखता है। यह अधिक "सुरक्षित" और विश्वसनीय था।
बड़ी तस्वीर का रूपक
रोबोट के मस्तिष्क को एक हायरिंग मैनेजर (भर्ती प्रबंधक) के रूप में सोचें।
पुराना तरीका (SFT) एक ऐसे मैनेजर की तरह है जो एक-एक करके रेज़्यूमे (बायोडेटा) की समीक्षा करता है। "क्या यह व्यक्ति योग्य है?" "हाँ।" "क्या यह व्यक्ति योग्य है?" "हाँ।" वे दो ऐसे लोगों को काम पर रख सकते हैं जो कागज़ पर समान दिखते हैं लेकिन उनके कौशल में बहुत अंतर है, क्योंकि उन्होंने सीधे तौर पर उनकी तुलना नहीं की।
नया तरीका (CWM) एक ऐसे मैनेजर की तरह है जो एक साथ रेज़्यूमे का पूरा ढेर देखता है। "ठीक है, हमें एक शेफ चाहिए। यह व्यक्ति खाना बना सकता है, लेकिन यह व्यक्ति केवल बेक कर सकता है। यह व्यक्ति बेक कर सकता है, लेकिन यह गर्मी को नहीं संभाल सकता। अभी के लिए इस विशिष्ट काम के लिए सबसे अच्छा फिट कौन है?"
निष्कर्ष
यह पेपर साबित करता है कि रोबोटों को भौतिक दुनिया को समझने में स्मार्ट बनाने के लिए, हमें केवल उन्हें क्रियाओं के लिए "हाँ" या "नहीं" कहना नहीं सिखाना चाहिए। हमें उन्हें एक-दूसरे के विरुद्ध क्रियाओं की तुलना करना सिखाना चाहिए, विशेष रूप से उन पेचीदा क्रियाओं के विरुद्ध जो लगभग सही दिखती हैं लेकिन वास्तव में गलत हैं।
यह नया "कॉन्ट्रास्टिव वर्ल्ड मॉडल" एक तेज़ और अधिक आलोचनात्मक फ़िल्टर के रूप में कार्य करता है, यह सुनिश्चित करता है कि रोबोट असंभव काम करने में समय बर्बाद न करे, जिससे यह मनुष्यों के लिए एक बहुत अधिक सुरक्षित और कुशल साथी बन जाता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।