RoboTTT: Context Scaling for Robot Policies
यह शोध पत्र RoboTTT को प्रस्तुत करता है, जो एक रोबोट नीति ढांचा (robot policy framework) है जो विज़ुओमोटर संदर्भ (visuomotor context) को 8,000 टाइमस्टेप्स तक स्केल करने के लिए टेस्ट-टाइम ट्रेनिंग (Test-Time Training) को एकीकृत करता है, जिससे वन-शॉट इमिटेशन (one-shot imitation), ऑन-द-फ्लाई सुधार, और लॉन्ग-होरिज़ॉन कार्यों पर काफी बेहतर प्रदर्शन सक्षम होता है, जो इन्फरेंस लेटेंसी (inference latency) को बढ़ाए बिना फास्ट वेट्स (fast weights) में हिस्ट्री को कंप्रेस करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
एक ऐसी दुनिया की कल्पना करें जहाँ रोबोट अविश्वसनीय रूप से प्रतिभाशाली लेकिन अदूरदर्शी शेफ की तरह हैं। वे आपको ठीक से बताने पर एक गाजर काट सकते हैं या बर्गर को बिल्कुल सही तरीके से पलट सकते हैं, लेकिन यदि आप उन्हें शून्य से एक जटिल केक बनाने के लिए कहते हैं, तो वे अक्सर दूसरे कदम तक पहुँचते-पहुँचते पहला कदम भूल जाते हैं। आधुनिक रोबोटों के पीछे के स्मार्ट दिमाग, यानी "रोबोट फाउंडेशन मॉडल्स" की वर्तमान स्थिति यही है। वे आमतौर पर केवल उस आखिरी चीज़ को देखते हैं जो उन्होंने चलने से ठीक पहले देखी थी, जैसे कि केवल अपने पैरों के नीचे के फर्श को देखकर एक भूलभुलैया में रास्ता खोजने की कोशिश करना। हालाँकि यह सरल कार्यों के लिए काम करता है, लेकिन यह तब बुरी तरह विफल हो जाता है जब एक रोबोट को घटनाओं के एक लंबे क्रम को याद रखने की आवश्यकता होती है, जैसे कि एक खिलौना कार को असेंबल करना या एक सर्किट बोर्ड को ठीक करना, खासकर यदि बीच में कुछ अप्रत्याशित हो जाए। वैज्ञानिक लंबे समय से सोचते रहे हैं: क्या होगा यदि एक रोबोट सब कुछ याद रख सके जो उसने अभी-अभी किया है, न कि केवल पिछला एक सेकंड, और उस लंबी स्मृति का उपयोग करके तुरंत सीख और अनुकूलित हो सके?
यहाँ RoboTTT आता है, जो NVIDIA, स्टैनफोर्ड और टेक्सास विश्वविद्यालय के ऑस्टिन के शोधकर्ताओं द्वारा विकसित एक नए प्रकार का रोबोट मस्तिष्क है। RoboTTT को केवल एक ऐसे रोबोट के रूप में न सोचें जो चरणों की एक लंबी सूची को "याद" रखता है, बल्कि एक ऐसे रोबोट के रूप में सोचें जिसके पास एक जादुई, स्वयं-अपडेट होने वाली नोटबुक है। जबकि पारंपरिक रोबोटों का मस्तिष्क स्थिर होता है जो बनने के बाद एक जैसा ही रहता है, RoboTTT के पास एक विशेष "फास्ट वेट" (fast weight) प्रणाली है। कल्पना कीजिए कि हर बार जब रोबोट कुछ नया देखता है या कोई चाल चलता है, तो वह तुरंत अपनी नोटबुक में एक छोटा सा नोट लिख देता है, जिससे उसका अपना आंतरिक वायरिंग इस तरह बदल जाता है कि वह वर्तमान स्थिति को बेहतर ढंग से समझ सके। यह वास्तविक समय में होता है, यहाँ तक कि जब रोबोट काम कर रहा होता है। इस "नोटबुक" को एक विशाल इतिहास—8,000 टाइमस्टेप्स (जो उच्च गति पर निरंतर क्रिया के लगभग पाँच मिनट के बराबर है) तक स्केल करके, RoboTTT उन सुपरपावर्स को अनलॉक करता है जिनका सपना पिछले रोबोट भी नहीं देख सकते थे। यह एक इंसान को कार्य करते हुए एक बार देख सकता है और बिना किसी पूर्व प्रशिक्षण के उस विशिष्ट सेटअप पर उसे पूरी तरह से कॉपी कर सकता है। यह अपनी गलतियों को भी तुरंत सुधार सकता है, चाहे किसी इंसान ने उसे टक्कर दी हो या उसने कोई हिस्सा गिरा दिया हो, यह सब अपने हालिया इतिहास को देखकर यह पता लगाने के लिए कि क्या गलत हुआ।
शोधकर्ताओं ने पाया कि रोबोट को यह लंबी-संदर्भ स्मृति (long-context memory) देना केवल एक छोटा अपग्रेड नहीं है; यह एक गेम-चेंजर है। अपने परीक्षणों में, RoboTTT एक जटिल, दस-चरणीय असेंबली कार्य को पूरा करने में सक्षम था जिसमें पांच मिनट का समय लगा—एक ऐसा कार्य जिसे कोई अन्य रोबोट मॉडल, यहाँ तक कि सबसे अच्छे शॉर्ट-मेमोरी वाले मॉडल भी कभी पूरा नहीं कर सके। जहाँ मानक रोबोट पहले कुछ चरणों के बाद ही विफल हो गए, वहीं RoboTTT ने 10 में से 6 वन-शॉट इमिटेशन ट्रायल्स (एक मानव वीडियो को कॉपी करना जिसे उसने पहले कभी नहीं देखा था) में सफलता प्राप्त की और बाहरी धक्कों से 83% की सफलता दर के साथ उबर गया, जबकि सबसे अच्छे शॉर्ट-मेमोरी रोबोट की दर केवल 53% थी। शोध पत्र सुझाव देता है कि केवल रोबोट की स्मृति को लंबा करना उन्हें स्मार्ट बनाने का एक नया तरीका है, जो यह दिखाता है कि जैसे-जैसे स्मृति कुछ सेकंड से बढ़कर चार मिनट से अधिक हुई, इसमें निरंतर सुधार हुआ।
सबसे शानदार ट्रिक्स में से एक जिसे RoboTTT अंजाम देता है, वह है "DAgger डिस्टिलेशन" (DAgger Distillation)। कल्पना कीजिए कि एक छात्र साइकिल चलाना सीख रहा है। यदि वह गिरता है, तो एक अभिभावक उसे पकड़ सकता है और वापस पटरी पर ला सकता है। एक सामान्य रोबोट शायद गिरने को भूल जाएगा और फिर से वही गलती करते हुए चलाने की कोशिश करेगा। हालाँकि, RoboTTT, गिरने और सुधार को एक ही कहानी के रूप में मानता है। यह गलती (गिरने) से सुधार (अभिभावक की मदद) को देखकर सीखता है और अपने आंतरिक "नोटबुक" को अपडेट करता है: "जब मैं इस तरफ झुकता हूँ, तो मुझे उस तरफ मुड़ना चाहिए।" यह इसे बिना किसी इंसान को दोबारा सिखाए, अपनी कार्यक्षमता में सुधार करने की अनुमति देता है। अध्ययन से पता चलता है कि यह तकनीक इसे त्रुटियों से 36% बेहतर तरीके से उबरने में मदद करती है।
यह शोध पत्र रोबोट की स्मृति को ठीक करने के बारे में कुछ सामान्य विचारों को भी खारिज करता है। उदाहरण के लिए, केवल अतीत की छवियों की एक लंबी सूची को रोबोट के मस्तिष्क में चिपकाना (जैसे एक लंबा वीडियो फीड) काम नहीं करता है; यह वास्तव में रोबोट को भ्रमित करता है और इसके प्रदर्शन को खराब कर देता है। इसी तरह, एक मानक "रिकरेंट" (recurrent) मेमोरी (जैसे एक साधारण लूप जो एक स्टेट को अपडेट करता है) पर्याप्त नहीं है। शोधकर्ताओं ने पाया कि कुंजी इस बात में है कि स्मृति कैसे अपडेट होती है: इसे एक लचीली, नॉन-लीनियर प्रणाली होने की आवश्यकता है जो अपने मापदंडों को उस प्रक्रिया का उपयोग करके बदलती है जो मानव अनुभव से सीखने के समान है (ग्रेडिएंट डिसेंट), न कि केवल एक स्थिर स्टेट को बदलना।
अंत में, RoboTTT सुझाव देता है कि रोबोट इंटेलिजेंस का भविष्य केवल रोबोट के मस्तिष्क को बड़ा या स्थिर रूप से स्मार्ट बनाने के बारे में नहीं है, बल्कि इसे काम करते समय निरंतर सीखने और अनुकूलित होने की क्षमता देने के बारे में है। संदर्भ को 8,000 टाइमस्टेप्स तक स्केल करके, शोधकर्ताओं ने दिखाया कि रोबोट बहुत अधिक मजबूत हो सकते हैं, लंबे, जटिल कार्यों को संभालने में सक्षम हो सकते हैं, और यहाँ तक कि एक एकल मानव प्रदर्शन से भी सीख सकते हैं। हालाँकि शोध पत्र नोट करता है कि इन मॉडलों को प्रशिक्षित करना महंगा है और वे अभी भी हर संभावित विफलता को संभाल नहीं सकते हैं, परिणाम दृढ़ता से संकेत देते हैं कि "लॉन्ग-कॉन्टेक्स्ट" (long-context) रोबोट इंटेलिजेंस को स्केल करने का एक नया, शक्तिशाली अक्ष है, जो अनाड़ी, कम दृष्टि वाले मशीनों को अनुकूलन योग्य, दीर्घकालिक समस्या समाधानकर्ताओं में बदल देता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।