GPT-6-Astra in a Navigation Workflow: Behavioral Analysis in Zero-Shot Vision-and-Language Navigation in Continuous Environments
यह शोध पत्र निरंतर विजन-एंड-लैंग्वेज नेविगेशन में GPT-6-Astra के ज़ीरो-शॉट प्रदर्शन का मूल्यांकन करता है, यह प्रदर्शित करते हुए कि हालांकि मॉडल निर्देशों की प्रभावी ढंग से व्याख्या करता है और स्पष्टीकरण मांगता है, लेकिन यह सही स्थानीय निर्णयों को निरंतर स्वायत्त प्रगति और उपयुक्त ठहराव में बदलने में संघर्ष करता है, जिससे R2R-CE val-unseen बेंचमार्क पर 52.0% सफलता दर प्राप्त होती है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि एक रोबोट को एक ऐसे कमरे में रखा गया है जिसे उसने पहले कभी नहीं देखा है, और उसे एक सरल मौखिक निर्देश दिया गया है जैसे "बेडरूम से बाहर निकलें, गलियारे में बाएं मुड़ें, और मेज के पास रुकें।" उसका कार्य केवल शब्दों को समझना नहीं है, बल्कि उस स्थान के माध्यम से भौतिक रूप से आगे बढ़ना, जो वह देखता है उसकी व्याख्या करना और यह जानना है कि उसे ठीक कब रुकना है। यह चुनौती, जिसे विजन-एंड-लैंग्वेज नेविगेशन कहा जाता है, इस बात के संगम पर स्थित है कि मशीनें दुनिया को कैसे देखती हैं और वे मानवीय भाषा को कैसे समझती हैं। वर्षों से, शोधकर्ताओं ने रोबोटों को इन निर्देशों का पालन करना सिखाने की कोशिश की है, उन्हें डेटा की विशाल मात्रा पर प्रशिक्षित करके, अनिवार्य रूप से उन्हें कमरों और रास्तों के हजारों उदाहरण दिखाकर जब तक कि वे पैटर्न सीख न लें। हालाँकि, एक नया दृष्टिकोण एक अलग प्रश्न पूछता है: क्या एक शक्तिशाली कृत्रिम बुद्धिमत्ता, जिसने विशेष रूप से नेविगेशन के लिए प्रशिक्षण नहीं लिया है, केवल चित्रों को देखकर और निर्देशों को पढ़कर एक नए वातावरण में आगे बढ़ने का तरीका निकाल सकती है? यह "जीरो-शॉट" नेविगेशन का क्षेत्र है, जहाँ सिस्टम को विशिष्ट कमरों की विशेष स्मृति के बजाय दुनिया की अपनी सामान्य समझ पर भरोसा करना होगा।
एक टीम ने हाल ही में GPT-6-Astra नामक एक परिष्कृत आर्टिफिशियल इंटेलिजेंस मॉडल का उपयोग करके इस विचार का परीक्षण किया। उन्होंने कोई कस्टम रोबोट नहीं बनाया और न ही मॉडल को नेविगेशन डेटा पर प्रशिक्षित किया। इसके बजाय, उन्होंने एक वर्कफ़्लो बनाया जहाँ मॉडल एक वर्चुअल एजेंट के मस्तिष्क के रूप में कार्य करता है। इस सेटअप में, मॉडल अपने परिवेश का एक पैनोरमिक दृश्य और एक प्राकृतिक भाषा निर्देश प्राप्त करता है। फिर उसे यह तय करना होता है कि आगे क्या करना है: आगे बढ़ना, बाएं मुड़ना, दाएं मुड़ना, या रुकना। महत्वपूर्ण रूप से, शोधकर्ताओं ने केवल मॉडल को अनुमान लगाने के लिए नहीं छोड़ा; उन्होंने एक ऐसा सिस्टम बनाया जो मॉडल के विचारों को रिकॉर्ड करता है, उसके निर्णयों की भौतिक वास्तविकता के साथ जांच करता है, और इसे नए दृश्य (views) के लिए अनुरोध करने की अनुमति देता है यदि वह अनिश्चित हो। लक्ष्य यह देखना था कि क्या यह सामान्य-उद्देश्य वाली बुद्धिमत्ता किसी एजेंट को गंतव्य तक सफलतापूर्वक निर्देशित कर सकती है और, शायद अधिक महत्वपूर्ण रूप से, यह जान सकती है कि वह कब पहुँच गया है।
शोधकर्ताओं ने इस सिस्टम को विभिन्न अनदेखे इनडोर वातावरणों, जैसे अपार्टमेंट से लेकर ऑफिस स्पेस तक, पचास अलग-अलग नेविगेशन कार्यों के माध्यम से चलाया। परिणाम प्रभावशाली समझ और निराशाजनक सीमाओं का मिश्रण थे। सिस्टम ने उम्मीद के मुताबिक प्रदर्शन किया, लगभग आधे प्रयासों में गंतव्य के सामान्य क्षेत्र तक सफलतापूर्वक पहुँच गया। जब यह सफल हुआ, तो इसने जो रास्ता लिया वह अक्सर काफी कुशल था, जो उस आदर्श मार्ग के काफी करीब था जिसे एक मानव ले सकता है। मॉडल ने जो वह देख रहा था और उसे जो बताया गया था, उनके बीच संबंध स्थापित करने की उल्लेखनीय क्षमता दिखाई। उदाहरण के लिए, यदि निर्देश "बाएं ओर दूसरा दरवाजा" खोजने का था, तो मॉडल उस विशिष्ट दरवाजे को पहले या दाएं वाले दरवाजे से अलग पहचान सका, भले ही वे दिखने में बहुत समान हों। यह अपने इतिहास को भी देख सकता था, यह याद रखते हुए कि इसने अभी-अभी एक कोने को पार किया है, और इस स्मृति का उपयोग यह पुष्टि करने के लिए कर सकता था कि यह सही रास्ते पर है।
शोधकर्ताओं ने जो सबसे दिलचस्प व्यवहार देखा वह था मॉडल की भ्रमित होने पर अधिक जानकारी मांगने की इच्छा। यदि मॉडल ने एक दरवाज़ा देखा लेकिन वह सुनिश्चित नहीं था कि वह सही जगह की ओर ले जाता है या नहीं, तो सिस्टम ने उसे करीब से देखने या एक अलग कोण से देखने का अनुरोध करने की अनुमति दी। कई मामलों में, इस अतिरिक्त दृश्य ने छिपे हुए विवरणों को प्रकट किया, जैसे कि एक दरवाजा द्वारा अवरुद्ध मार्ग या एक शेल्फ जिसने साबित कर दिया कि एक गलियारा डेड एंड (बंद रास्ता) था। मॉडल फिर अपनी योजना में संशोधन करता, गलत पथ को खारिज करता या सही पथ की पुष्टि करता। साक्ष्य खोजने और नई दृश्य जानकारी के आधार पर अपना निर्णय बदलने की यह क्षमता एक स्पष्ट शक्ति थी, जो दर्शाती है कि मॉडल एक स्क्रिप्ट का आँख मूंदकर पालन करने वाले रोबोट के बजाय एक सतर्क खोजकर्ता की तरह कार्य कर सकता था।
हालाँकि, अध्ययन ने एक कार्य को समझने और उसे पूरा करने के बीच के एक महत्वपूर्ण अंतर को भी उजागर किया। मॉडल अक्सर यह समझने में उत्कृष्ट था कि वह कहाँ है और उसने क्या किया है, पूर्ण हुए कार्यों और लंबित कार्यों के बीच सही ढंग से अंतर कर सकता था, फिर भी सिस्टम बिना क्रॉसिंग किए घूमता रहा। अन्य मामलों में, मॉडल ने अपने समर्पित 'अराइवल असेसमेंट' (आगमन मूल्यांकन) रोल के माध्यम से आगमन का सही आकलन किया, लेकिन अंतिम रुकने का निर्णय लेने के लिए मॉडल के अपने आकलन और बाहरी वर्कफ़्लो चेक्स के संयोजन की आवश्यकता थी। डेटा ने दिखाया कि जबकि सिस्टम ने कई एपिसोड में सही पड़ोस तक पहुँच लिया था, यह केवल उन मामलों में लगभग छत्तीस प्रतिशत बार ही सही स्थान पर रुका जहाँ वर्कफ़्लो-स्वीकृत निर्णय के साथ था। यह सुझाव देता है कि जबकि "मस्तिष्क" मानचित्र और निर्देशों को समझ सकता था, उस समझ को अंतिम, सटीक रुकने के निर्णय में अनुवादित करना हमेशा स्वचालित नहीं था।
शोधकर्ताओं ने पाया कि सिस्टम की सफलता उनके द्वारा बनाए गए बाहरी उपकरणों पर अत्यधिक निर्भर थी। मॉडल स्वयं विशिष्ट भूमिकाएँ निभाता था, जिसमें "अराइवल असेसमेंट" शामिल था, लेकिन वर्कफ़्लो 'STOP' कमांड को स्वीकार करने से पहले पूर्णता की जांच करने के लिए जिम्मेदार था। यह अंतर महत्वपूर्ण है: बुद्धिमत्ता वातावरण के बारे में तर्क करने और अपने आगमन का आकलन करने में सक्षम थी, लेकिन वह अपने आप लूप को बंद करने में विश्वसनीय नहीं थी। अध्ययन निष्कर्ष निकालता है कि भविष्य की चुनौती केवल लैंडमार्क पहचानने में मॉडलों को स्मार्ट बनाना नहीं है, बल्कि उन्हें अपने स्वयं के निर्णयों पर इतना भरोसा करना सिखाना है कि जब वे पहुँच जाएँ तो वे रुक सकें। आगे का रास्ता यह सुनिश्चित करने में है कि जानने और वास्तव में वहाँ रुकने के बीच के अंतर को पाटा जा सके, यह सुनिश्चित करते हुए कि समझ का क्षण सीधे पूर्णता के क्षण की ओर ले जाए।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।