← नवीनतम पेपर
💻 computer science

Beyond Transformers: Linear Attention Policy for Open-Vocabulary Object Goal Navigation

यह शोध पत्र LANav को प्रस्तुत करता है, जो एक ऐसा नेविगेशन पॉलिसी है जो मौजूदा बेसलाइनों की तुलना में बेहतर ओपन-वोकेबुलरी ऑब्जेक्ट गोल नेविगेशन प्रदर्शन, कम्प्यूटेशनल दक्षता और सुदृढ़ सिम-टू-रियल ट्रांसफर प्राप्त करने के लिए मानक ट्रांसफॉर्मर-आधारित सेल्फ-अटेंशन को एक स्ट्रक्चर्ड लीनियर अटेंशन मैकेनिज्म—विशेष रूप से वेटेड स्टेट-एक्सपेंशन लीनियर अटेंशन (WSLA) द्वारा संवर्धित—से प्रतिस्थापित करता है।

मूल लेखक: Jiahong Zhang, Yifan Lin, Yandong Zhang, Sijun Shen, Kexin Wang, Yuqi Pan, Hongjuan Pei, Wei Wang, Guoqi Li

प्रकाशित 2026-07-22
📖 9 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Jiahong Zhang, Yifan Lin, Yandong Zhang, Sijun Shen, Kexin Wang, Yuqi Pan, Hongjuan Pei, Wei Wang, Guoqi Li

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक ऐसी वस्तु खोज रहे हैं, जैसे कि एक "विंटेज टोस्टर," एक ऐसे घर में जिसे आपने पहले कभी नहीं देखा है। आप केवल एक संकीर्ण खिड़की के माध्यम से सीधे अपने सामने देख सकते हैं, और आपको यह याद रखना होगा कि आप कहाँ गए थे, आपने क्या देखा था, और आप क्या खोज रहे हैं ताकि आप अपना अगला कदम उठा सकें। यह एक रोबोट के जीवन का हिस्सा है जो दुनिया में नेविगेट कर रहा है, जिसे एम्बोडीड एआई (Embodied AI) नामक विज्ञान का क्षेत्र कहा जाता है। ऐसा करने के लिए, रोबट एक "मस्तिष्क" (पॉलिसी नेटवर्क) का उपयोग करते हैं जो एक अल्पकालिक स्मृति (short-term memory) की तरह कार्य करता है, जो नई दृष्टि और ध्वनियों के आधार पर अपनी आंतरिक स्थिति को लगातार अपडेट करता है। लंबे समय तक, वैज्ञानिकों ने इसे बनाने के दो मुख्य तरीके आजमाए: एक जो इतिहास को एक एकल, सिकुड़ते हुए सारांश में संकुचित करता है (एक पुराने ज़माने की नोटबुक की तरह), और दूसरा जो हाल ही में देखी गई हर चीज़ की एक लंबी सूची रखता है और कनेक्शन खोजने के लिए हर बार पूरी सूची को फिर से पढ़ता है (एक सुपर-संगठित लेकिन धीमे लाइब्रेरियन की तरह)। बड़ा सवाल यह था: कौन सा तरीका रोबोट को रास्ता खोजने में सबसे अच्छा मदद करेगा जब वह जिस वस्तु को खोज रहा है उसका नाम अजीब हो या वह पूरी तरह से नए घर में हो?

यह शोध पत्र LANav (लीनियर अटेंशन-बेस्ड नेविगेशन) नामक एक नया दृष्टिकोण और WSLA नामक एक विशेष अपग्रेड पेश करता है। शोधकर्ताओं ने पाया कि "सुपर-लाइब्रेरियन" तरीका (सेल्फ-अटेंशन के साथ ट्रांसफॉर्मर्स का उपयोग करना), जिसे स्टेट-ऑफ-द-आर्ट माना जाता था, वास्तव में तब विफल हो जाता है जब रोबोट को एक लंबी यात्रा को याद रखने की आवश्यकता होती है। आश्चर्यजनक रूप से, ट्रांसफॉर्मर को अधिक लंबा इतिहास दिखाने से वह बेहतर नहीं हुआ; बल्कि, कभी-कभी यह और भी खराब हो गया। इसके बजाय, टीम ने पाया कि लीनियर अटेंशन (Linear Attention) नामक एक विधि, जो इसकी स्मृति को एक स्थिर, संरचित प्रवाह के रूप में अपडेट करती है न कि पूरी सूची को फिर से पढ़ने के रूप में, बहुत बेहतर काम करती है। उन्होंने इस विचार को WSLA के साथ सुदृढ़ किया, जो स्मृति को कई "सब-स्ट्रीम्स" (उप-प्रवाहों) में विभाजित करता है और सीखता है कि प्रत्येक को कितना महत्व देना है। परीक्षणों में, इस नए सिस्टम ने एक चुनौतीपूर्ण सिमुलेशन में वस्तुओं को 36.4% बार खोजा, जो बेहतरीन ट्रांसफॉर्मर मॉडलों को स्पष्ट अंतर से पीछे छोड़ गया। इससे भी शानदार बात यह है कि उन्होंने इसे एक वास्तविक कमरे में एक वास्तविक रोबोट कुत्ते पर टेस्ट किया, और यह 82% बार सफल रहा, जिससे यह साबित हुआ कि यह "स्ट्रीमिंग मेमोरी" का विचार न केवल कंप्यूटरों में, बल्कि वास्तविक दुनिया में भी काम करता है।

समस्या: रोबोट का स्मृति संकट

कल्पना कीजिए कि आप एक "नीली कुर्सी" की तलाश में एक विशाल, अपरिचित भूलभुलैया में चल रहे हैं। आप केवल कुछ कदम आगे देख सकते हैं। हर बार जब आप कोना मुड़ते हैं, तो आप कुछ नया देखते हैं, लेकिन आप यह भी भूल जाते हैं कि आपने दस सेकंड पहले क्या देखा था। कुर्सी को खोजने के लिए, आपके मस्तिष्क को सुरागों को थामे रखने की आवश्यकता है: "मैं एक लाल दरवाजे के पास से गुजरा," "मैंने एक पंखे की आवाज़ सुनी," "मैं दो बार बाईं ओर मुड़ा।"

वर्षों से, रोबोट वैज्ञानिकों ने इसे दो मुख्य प्रकार की स्मृति के साथ हल करने की कोशिश की:

  1. द कंप्रेसर (RNNs): ये एक ऐसे रोबोट की तरह हैं जो अपनी पिछली सभी यादों को एक छोटे, घने गोले में सिकोड़ देता है। यह तेज़ है, लेकिन जैसे-जैसे यात्रा लंबी होती जाती है, वह गोला इतना छोटा और अव्यवस्थित हो जाता है कि रोबोट महत्वपूर्ण विवरण भूल जाता है।
  2. द री-रीडर (Transformers): ये एक ऐसे रोबोट की तरह हैं जो उसने जो कुछ भी देखा है उसकी एक आदर्श, लंबी स्क्रॉल (लिखित सूची) रखता है। हर बार जब उसे यह तय करने की आवश्यकता होती है कि आगे कहाँ जाना है, तो वह कनेक्शन खोजने के लिए शुरुआत से अंत तक पूरी स्क्रॉल को फिर से पढ़ता है। यह शक्तिशाली है, लेकिन यह धीमा है और यदि स्क्रॉल बहुत लंबा हो जाए तो यह अव्यवस्थित हो जाता है।

शोधकर्ताओं ने पूछा: "यदि हम रोबोट को एक लंबी स्क्रॉल (एक लंबा इतिहास) दें, तो क्या वह चीजों को खोजने में बेहतर होगा?" उन्होंने इस कार्य के साथ "री-रीडर" (ट्रांसफॉर्मर) दृष्टिकोण का परीक्षण किया जिसे ओपन-वोकैबुलरी ऑब्जेक्ट गोल नेविगेशन (Open-Vocabulary Object Goal Navigation) कहा जाता है। यह एक फैंसी तरीका है यह कहने का: "मुझे जो वस्तु मैं वर्णित करता हूँ उसे ढूंढो, भले ही मैं उसके लिए किसी ऐसे अजीब नाम का उपयोग करूँ जो आपने पहले कभी नहीं सुना हो, जैसे कि 'एक चीज़ जो सूप रखती है' बजाय 'एक बर्तन' के।"

आश्चर्य: अधिक इतिहास ने मदद नहीं की

टीम ने नियंत्रित प्रयोगों की एक श्रृंखला चलाई। उन्होंने सब कुछ समान रखा—रोबोट की आँखें, मानचित्र, प्रशिक्षण नियम—और केवल स्मृति प्रणाली को बदला। उन्हें उम्मीद थी कि यदि वे ट्रांसफॉर्मर रोबोट को पढ़ने के लिए एक लंबी स्क्रॉल देते, तो वह वस्तुओं को अधिक बार खोज पाएगा।

लेकिन यहाँ एक मोड़ आया: यह काम नहीं किया।

जब उन्होंने इतिहास की लंबाई बढ़ाई जिसे ट्रांसफॉर्मर देख सकता था, तो रोबोट का प्रदर्शन बेहतर नहीं हुआ। वास्तव में, कुछ मामलों में, यह थोड़ा खराब हो गया। ऐसा लग रहा था जैसे रोबोट अपनी ही यादों में डूब रहा था, यह समझने में असमर्थ था कि लंबी स्क्रॉल के कौन से हिस्से वास्तव में मायने रखते हैं। "री-रीडर" विधि एक सीमा से टकराती हुई प्रतीत हुई। यह स्पष्ट है कि एक भूलभुलैया में भटकते हुए रोबोट के लिए, अपने पूरे इतिहास को लगातार फिर से पढ़ना उसके स्टेट को अपडेट करने का सबसे अच्छा तरीका नहीं है।

समाधान: "स्ट्रीमिंग" मेमोरी

शोधकर्ताओं ने फिर एक अलग दृष्टिकोण आजमाया: लीनियर अटेंशन (Linear Attention)। पूरी स्क्रॉल को फिर से पढ़ने के बजाय, एक ऐसे रोबोट की कल्पना करें जिसकी "स्ट्रीमिंग मेमोरी" है। जैसे-जैसे वह चलता है, वह अपनी आंतरिक स्थिति को चरण-दर-चरण अपडेट करता है, जैसे एक नदी बह रही हो। वह पूरे नदी के पीछे नहीं देखता; वह बस नए वर्षा (नए अवलोकन) और वर्तमान प्रवाह के आधार पर जल स्तर को अपडेट करता है।

उन्होंने इस स्ट्रीमिंग पद्धति का उपयोग करके LANav नामक एक प्रणाली बनाई। परिणाम तत्काल और प्रभावशाली थे।

  • पुराने तरीकों से बेहतर: LANav ने "कंप्रेसर" (RNN) और "री-रीडर" (ट्रांसफॉर्मर) दोनों मॉडलों को पछाड़ दिया।
  • लंबा होना बेहतर है: ट्रांसफॉर्मर के विपरीत, जब उन्होंने LANav रोबोट को सीखने के लिए एक लंबा इतिहास दिया, तो वह वास्तव में बेहतर हो गया। जितना लंबा प्रशिक्षण इतिहास होता, रोबोट उतना ही स्मार्ट होता जाता।

अपग्रेड: WSLA (द मल्टी-स्ट्रीम ब्रेन)

शोधकर्ताओं ने वहीं नहीं रोका। उन्होंने महसूस किया कि स्ट्रीमिंग मेमोरी को भी सुधारा जा सकता है। उन्होंने पूछा, "क्या होगा यदि हमारे रोबलेट के पास केवल एक स्ट्रीमिंग मेमोरी नहीं, बल्कि कई स्ट्रीम हों, और वह सीख सके कि किस स्ट्रीम को सुनना है?"

उन्होंने WSLA (वेटेड स्टेट-एक्सपेंशन लीनियर अटेंशन) बनाया।

  • उपमा: कल्पना कीजिए कि रोबोट के मस्तिष्क में एक के बजाय चार अलग-अलग "नोटबुक" (सब-स्टेट्स) हैं। एक नोटबुक रंगों को ट्रैक करती है, दूसरी आकृतियों को, तीसरी मोड़ों को, और चौथी ध्वनियों को।
  • जादू: एक विशेष "कंडक्टर" (सीखने योग्य वेटिंग) यह तय करता है कि किसी भी दिए गए क्षण में प्रत्येक नोटबुक को कितना सुनना है। यदि रोबोट एक "लाल बॉक्स" की तलाश में है, तो कंडक्टर "रंग" वाली नोटबुक की आवाज़ बढ़ा सकता है और "ध्वनि" वाली नोटबुक की आवाज़ कम कर सकता है।

यह WSLA सिस्टम चैंपियन साबित हुआ।

  • HM3D-OVON सिमुलेशन (एक विशाल, यथार्थवादी 3D घर डेटासेट) में, WSLA रोबोट ने 36.4% की सफलता दर हासिल की।
  • सर्वश्रेष्ठ ट्रांसफॉर्मर मॉडल केवल 30.1% ही प्राप्त कर सका।
  • यह 6.3 प्रतिशत अंक का सुधार है, जो इस क्षेत्र में बहुत बड़ा है।

यह क्यों मायने रखता है: दूरी और वास्तविक जीवन

शोधकर्ताओं ने यह भी देखा कि रोबोट कैसे नेविगेट करता है। उन्होंने पाया कि नया सिस्टम लंबी यात्राओं के लिए विशेष रूप से अच्छा था।

  • छोटी यात्राएं: दोनों रोबोट ठीक थे।
  • लंबी यात्राएं: ट्रांसफॉर्मर रोबोट अक्सर खो जाता था या जल्दी हार मान लेता था। हालाँकि, WSLA रोबोट शांत रहा। उसने 15 मीटर या उससे अधिक की दूरी सफलतापूर्वक तय की, जिसमें सफलता दर 14.36% रही, जबकि ट्रांसफॉर्मर केवल 6.68% ही कर पाया।

लेकिन असली परीक्षण इसे कंप्यूटर से बाहर निकालकर वास्तविक दुनिया में ले जाना था। टीम ने अपने LANav सिस्टम को एक Unitree Go2 रोबोट (एक वास्तविक, भौतिक रोबोट कुत्ता) पर लगाया। उन्होंने इसे एक वास्तविक कमरे में कचरे के डिब्बे, पौधे या कुर्सी जैसी चीजों को खोजने के लिए कहा।

  • उन्होंने 50 परीक्षण किए।
  • रोबोट 41 बार सफल रहा।
  • यह वास्तविक दुनिया में 82% सफलता दर है!

यह साबित करता है कि "स्ट्रीमिंग मेमोरी" का विचार केवल एक कूल कंप्यूटर ट्रिक नहीं है; यह वास्तव में वास्तविक स्थानों में चलने वाले रोबोटों के लिए काम करता है, जो वास्तविक जीवन की अव्यवस्था को संभाल सकते हैं।

निष्कर्ष

यह शोध पत्र सुझाव देता है कि जटिल, अज्ञात वातावरण में रास्ता खोजने की कोशिश करने वाले रोबोटों के लिए, पुराना "सब कुछ फिर से पढ़ने" वाला तरीका (ट्रांसफॉर्मर्स) सबसे अच्छा उपकरण नहीं हो सकता है। इसके बजाय, एक ऐसी विधि जो इसकी स्मृति को एक संरचित, स्ट्रीमिंग तरीके से अपडेट करती है (लीनियर अटेंशन), विशेष रूप से जब इसे कई विशिष्ट उप-स्मृतियों (WSLA) के साथ बढ़ाया जाता है, बहुत अधिक प्रभावी है। यह तेज़ है, लंबी यात्राओं के साथ बेहतर स्केल करती है, और सबसे महत्वपूर्ण बात यह है कि यह वास्तव में एक रोबोट कुत्ते पर एक वास्तविक कमरे में काम करती है। रोबोट नेविगेशन का भविष्य अधिक इतिहास को याद रखने के बारे में नहीं है, बल्कि इसे बेहतर तरीके से याद रखने के बारे में है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →