← नवीनतम पेपर
💻 computer science

Learning Goal-Oriented Vision-and-Language Navigation with Self-Improving Demonstrations at Scale

यह शोध पत्र SID को प्रस्तुत करता है, जो एक स्व-सुधार फ्रेमवर्क (self-improving framework) है जो शॉर्टेस्ट-पाथ ट्रेनिंग की सीमाओं को दूर करने के लिए पुनरावृत्ति रूप से नवीन अन्वेषण प्रक्षेपवक्र (exploration trajectories) उत्पन्न करता है, जिससे नेविगेशन एजेंटों की अन्वेषण क्षमताओं में उल्लेखनीय वृद्धि होती है और लक्ष्य-उन्मुख विजन-एंड-लैंग्वेज नेविगेशन बेंचमार्क पर अत्याधुनिक प्रदर्शन प्राप्त होता है।

मूल लेखक: Songze Li, Zun Wang, Gengze Zhou, Jialu Li, Xiangyu Zeng, Ziyang Gong, Limin Wang, Yu Qiao, Qi Wu, Mohit Bansal, Yi Wang

प्रकाशित 2026-03-19
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Songze Li, Zun Wang, Gengze Zhou, Jialu Li, Xiangyu Zeng, Ziyang Gong, Limin Wang, Yu Qiao, Qi Wu, Mohit Bansal, Yi Wang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को एक विशाल, अपरिचित घर में किसी विशिष्ट वस्तु को खोजने के लिए नेविगेट करना सिखा रहे हैं, जैसे कि "किचन काउंटर पर रखा लाल मग।"

अतीत में, रोबोट को यह कार्य सिखाना एक बच्चे को केवल किसी को सबसे छोटे, सीधे रास्ते पर चलते हुए वीडियो दिखाकर चलने का प्रशिक्षण देने जैसा था। रोबोट सबसे सीधा रास्ता लेना सीख जाता, लेकिन यदि दरवाजा अवरुद्ध होता या कमरा थोड़ा अलग दिखता, तो रोबोट फंस जाता। उसके पास "एक्सप्लोरेशन मसल" (खोजने की क्षमता) नहीं थी क्योंकि उसने कभी भटकने और वापस रास्ता खोजने का अभ्यास नहीं किया था।

अन्य तरीकों ने लोगों को घूमते हुए हजारों वीडियो रिकॉर्ड करने के लिए काम पर रखने की कोशिश की, लेकिन यह अविश्वत रूप से महंगा, धीमा और बड़े पैमाने पर लागू करना कठिन था।

पेश है SID-VLN (सेल्फ-इंप्रूविंग डेमोन्स्ट्रेशन - स्वयं सुधारने वाले प्रदर्शन)।

SID-VLN को "ट्राय, फेल, एंड गेट बेटर" (कोशिश करो, असफल हो और बेहतर बनो) के खेल को खेलने वाले एक रोबोट के रूप में समझें। यह यहाँ कैसे काम करता है, इसे सरल चरणों में विभाजित किया गया है:

1. "ट्रेनिंग व्हील्स" चरण

सबसे पहले, रोबोट एक बुनियादी मानचित्र के साथ शुरू करता है और कमरों के बीच सरल, छोटे रास्तों को सीखता है। यह वर्णमाला सीखने वाले एक छात्र की तरह है। वह जानता है कि यदि सब कुछ सही है, तो पॉइंट A से पॉइंट B तक कैसे पहुँचना है।

2. "सेल्फ-प्ले" चरण (जादुई हिस्सा)

मानव द्वारा उसे नया रास्ता दिखाने का इंतज़ार करने के बजाय, रोबोट को कहा जाता है: "जाओ लाल मग ढूंढो। तुम इधर-उधर घूम सकते हो, लेकिन तुम्हें इसे अपने दम पर खोजना होगा।"

  • एक्सप्लोरेशन (खोज): रोबोट चलना शुरू करता है। वह गलत दिशा में मुड़ सकता है, ऐसे कमरे में प्रवेश कर सकता है जो किचन जैसा दिखता है लेकिन है नहीं, और महसूस कर सकता है, "ओह, यह वह नहीं है।" वह वापस मुड़ता है और दूसरे दरवाजे को आजमाता है।
  • फिल्टर: यदि रोबक खो जाता है या किसी डेड एंड (बंद रास्ते) पर पहुँच जाता है, तो उस प्रयास को कचरे में डाल दिया जाता है। लेकिन यदि वह कुछ कमरों में भटकने के बाद सफलतापूर्वक मग ढूंढ लेता है, तो उस विशिष्ट यात्रा को सहेज लिया जाता है।
  • सबक: रोबोट फिर अपनी ही सफल "भटकने" वाली यात्रा का अध्ययन करता है। वह सीखता है: "आह, मैं पहले गलत कमरे में गया था, लेकिन फिर मैंने हॉलचेक किया और सही जगह ढूंढ ली। अगली बार, मैं हॉल को जल्दी चेक करूँगा।"

3. "फ्लाईव्हील" प्रभाव

यहीं पर "सेल्फ-इंप्रूविंग" (स्वयं सुधारने वाला) हिस्सा काम आता है।

  • राउंड 1: रोबोट छोटे रास्तों से सीखता है।
  • राउंड 2: वह जो सीखा है उसका उपयोग करके अधिक एक्सप्लोर करता है, जिससे बेहतर "भटकने" वाले रास्ते बनते हैं। वह खुद को एक नया, स्मार्ट वर्शन सिखाता है।
  • राउंड 3: वह उन नए, स्मार्ट रास्तों का उपयोग खुद को एक और भी बेहतर वर्शन सिखाने के लिए करता है।

यह एक वीडियो गेम कैरेक्टर की तरह है जो, एक लेवल जीतने के बाद, अपने नए कौशल का उपयोग अगले लेवल को तेज़ी से जीतने के लिए करता है, और फिर उन कौशलों का उपयोग बॉस को हराने के लिए करता है। रोबोट अनिवार्य रूप से खुद को एक बेहतर खोजकर्ता बनने के लिए सिखा रहा है बिना किसी मानव शिक्षक के हाथ पकड़ने के।

4. "लैंग्वेज ट्रांसलेटर" (भाषा अनुवादक)

एक बार जब रोबोट आभासी घर में एक मास्टर एक्सप्लोरर बन जाता है, तो शोधकर्ताओं चाहते थे कि वह "किचन से मेरे लिए एक चम्मच लाओ" जैसे मानव भाषा के निर्देशों को समझे।

चूंकि रोबोट केवल छवियों और रास्तों की "भाषा" बोलता था, इसलिए उन्होंने एक सुपर-स्मार्ट AI (विज़न-लैंग्वेज मॉडल) का उपयोग एक अनुवादक के रूप में किया।

  • रोबोट ने चम्मच तक पहुँचने का एक रास्ता खोजा।
  • AI ने उस पथ की तस्वीरों को देखा और एक कहानी लिखी: "नीले सोफे के पास से गुजरें, बाईв टर्न लें और चमकदार किचन में प्रवेश करें, और काउंटर पर चांदी का चम्मच खोजें।"
  • अब, रोबोट के पास ऐसे 46 मिलियन "कहानी + पथ" के जोड़े हैं। यह रोबोट को 46 मिलियन अलग-अलग तरीकों की लाइब्रेरी देने जैसा है, जो मानव भाषा में लिखे गए हैं।

परिणाम: एक सुपर-एक्सप्लोरर

क्योंकि रोबोट ने एक्सप्लोर करना और अपनी गलतियों को सुधारना सीखा, वह पहले से न देखे गए स्थानों में चीजों को खोजने में अविश्वसनीय रूप से कुशल हो गया।

  • पुराना तरीका: यदि आप किसी रोबोट को नए घर में कुर्सी खोजने के लिए कहते, तो यदि लेआउट थोड़ा अलग होता, तो वह भ्रमित हो सकता था।
  • SID का तरीका: रोबोट कहता है, "मैं पहले भी खोया हूँ और वापस आया हूँ। मुझे पता है कि कमरे को कैसे स्कैन करना है, कोनों की जांच कैसे करनी है, और डाइनिंग रूम और लिविंग रूम के बीच अंतर कैसे करना है।"

संक्षेप में:
SID-VLN एक ऐसा सिस्टम है जो महंगे मानव शिक्षकों और छोटे, पूर्ण रास्तों पर निर्भर रहना बंद कर देता है। इसके बजाय, यह रोबोट को खो जाने, अपनी गलतियों से सीखने और अपने स्वयं के सफल साहसिक कार्यों को पाठ्यपुस्तक के रूप में उपयोग करके दुनिया में नेविगेट करना सीखने की अनुमति देता है। यह एक ऐसे रोबोट को बदल देता है जो सिर्फ निर्देशों का पालन करता है, एक ऐसे रोबोट में जो एक्सप्लोर (खोज) करना जानता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →