Embodied Agents Take Control: Minimal-Interface Zero-Shot Agents Rival Industrial-Scale Policies in Vision-and-Language Navigation
यह शोध पत्र प्रदर्शित करता है कि न्यूनतम इंटरफेस के साथ सामान्य-उद्देश्य वाले एजेंटिक नियंत्रण का उपयोग करने वाले ज़ीरो-शॉट एम्बोडीड एजेंट, विज़न-एंड-लैंग्वेज नेविगेशन में औद्योगिक-स्तर की नीतियों को टक्कर दे सकते हैं, जो 78% तक सफलता प्राप्त करते हैं और यह रेखांकित करते हैं कि विशिष्ट सॉफ़्टवेयर हार्नेस की तुलना में मॉडल का चयन प्रदर्शन का प्राथमिक चालक है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
एक ऐसी दुनिया की कल्पना करें जहाँ आपका टोस्टर न केवल ब्रेड को टोस्ट कर सके, बल्कि यह भी तय कर सके कि कौन सा स्लाइस टोस्ट करना है, यह भी देख सके कि रसोई साफ है या नहीं, और यह भी समझ सके कि घर को जलाए बिना ब्रेड को मेज तक कैसे पहुँचाया जाए। यह एम्बोडीड एआई (Embodied AI) का सपना है: कंप्यूटर को एक भौतिक शरीर (जैसे कि एक रोबोट) देना और उन्हें वास्तविक दुनिया में अपने आप नेविगेट करने के लिए दिमागी शक्ति प्रदान करना। लंबे समय से, वैज्ञानिक इन रोबोटों को या तो कुत्तों की तरह "प्रशिक्षित" करके (एक ही कार्य को हजारों बार दोहराना जब तक कि वे इसे सही ढंग से न कर लें) या उन्हें एक सख्त "स्क्रिप्ट" देकर (इंसानों द्वारा लिखा गया नियमों की एक सूची जैसे "यदि आप दरवाजा देखें, तो उसे खोलें") सिखाने की कोशिश कर रहे हैं। लेकिन क्या होगा अगर हम बस एक सुपर-स्मार्ट कंप्यूटर को एक कैमरा और कुछ बुनियादी बटन दे दें, उसे कहें कि "रसोई ढूंढो," और बाकी सब कुछ खुद समझने दें? यही वह बड़ा सवाल है जो यह शोध पत्र पूछता है: क्या एक सामान्य-उद्देश्य वाला एआई, बिना किसी विशेष रोबोट प्रशिक्षण के, खुद को संभाल सकता है और एक घर के माध्यम से खुद को चला सकता है?
इस अध्ययन के पीछे के शोधकर्ताओं ने इस विचार का परीक्षण करने का निर्णय लिया कि एक डिजिटल रोबोट का उपयोग करके एक सिम्युलेटेड (कृत्रिम) घर में नेविगेशन किया जाए। उन्होंने उन सभी शानदार उपकरणों को हटा दिया जो आमतौर पर नेविगेशन के लिए उपयोग किए जाते हैं—कोई मानचित्र नहीं, कोई जीपीएस नहीं, कोई पूर्व-निर्धारित पथ नहीं, और कोई विशेष "रोबोट मस्तिष्क" प्रशिक्षण नहीं। इसके बजाय, उन्होंने एआई को एक एकल कैमरा दिया जो केवल वही देखता है जो सीधे उसके सामने है (जैसे कि एक इंसान की सुराख से देखने वाली दृष्टि) और चार सरल कमांड दिए: आगे बढ़ें, बाएं मुड़ें, दाएं मुड़ें, और रुकें। फिर उन्होंने एआई को जटिल मौखिक निर्देशों का पालन करने के लिए कहा, जैसे कि "पूल के पास से गुजरें, बार और कुर्सियों के बीच से जाएं, और कोने पर रुकें।" लक्ष्य यह देखना था कि क्या एआई एक वास्तविक "एजेंट" की तरह कार्य कर सकता है—एक निर्णय लेने वाला जो बिना किसी मानवीय सहायता के देखता है, सोचता है, कार्य करता है और अपनी गलतियों को सुधारता है।
परिणाम आश्चर्यजनक रूप से रोमांचक थे, लेकिन साथ ही विनम्र भी। टीम ने पाया कि ये "ज़ीरो-शॉट" एजेंट (जिसका अर्थ है कि उन्होंने पहले कभी रोबोट नहीं देखा था) वास्तव में काफी अच्छी तरह से नेविगेट कर सकते थे। fable-5 नामक एक शक्तिशाली एआई मॉडल का उपयोग करते हुए, रोबोट मानक परीक्षण में 78% बार सफलतापूर्वक अपने लक्ष्य तक पहुँच गया, भले ही उसके पास कोई मानचित्र या विशेष प्रशिक्षण नहीं था। यह एक बहुत बड़ी बात है क्योंकि यह लाखों उदाहरणों पर प्रशिक्षित महंगे, औद्योगिक-स्तर के रोबots के प्रदर्शन की बराबरी करता है। यह सुझाव देता है कि "मस्तिष्क" ही अधिकांश भारी काम कर रहा है, न कि उसके चारों ओर बनाया गया विशेष सॉफ्टवेयर।
हालाँकि, शोध पत्र एक स्पष्ट रेखा भी खींचता है। जबकि एआई छोटी यात्राओं के लिए बेहतरीन है, जब यात्रा लंबी होती है तो वह लड़खड़ाने लगता है। यदि कार्य के लिए कई कमरों से गुजरने या यह याद रखने की आवश्यकता है कि वह पाँच मिनट पहले कहाँ था, तो सफलता दर तेजी से गिरकर 26% से 39% के बीच हो जाती है। एआई इसलिए भ्रमित हो जाता है क्योंकि उसे हर उस चीज़ को याद रखना पड़ता है जो उसने देखी थी, और उसकी "स्मृति" बहुत अधिक भर जाती है। इसके अलावा, जब शोधकर्ताओं ने इसे एक वास्तविक, भौतिक रोबोट कुत्ते पर आज़माया, तो एआई ने तर्क तो पूरी तरह से दिया लेकिन दीवारों से टकराता रहा क्योंकि वह यह नहीं समझ पाया कि उसका अपना शरीर कितनी जगह घेरता है। वह जानता था कि उसे कहाँ जाना है, लेकिन यह नहीं कि वह दरवाजे से कैसे निकल सकता है।
अंत में, यह शोध पत्र सुझाव देता है कि हम एक नए युग के किनारे पर खड़े हैं। हमें हर कार्य के लिए एक नया, विशेष रोबोट मस्तिष्क बनाने की आवश्यकता नहीं है; हमें बस अपने मौजूदा सुपर-स्मार्ट एआई को नियंत्रण लेने देने की आवश्यकता है, बशर्ते हम उन्हें अपनी स्मृति को प्रबंधित करने और अपने भौतिक शरीर को समझने के लिए सही उपकरण प्रदान करें। यह उस दिन की ओर एक कदम है जब आपका रोबोट केवल आदेशों का पालन नहीं करेगा, बल्कि वास्तव में अपने स्वयं के साहसिक कार्य की कमान संभालेगा।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।