← नवीनतम पेपर
💻 computer science

Joint On-and-Off Policy Learning for Vision-and-Language Navigation

यह शोध पत्र JOP-VLN को प्रस्तुत करता है, जो एक नवीन ढांचा है जो विजन-एंड-लैंग्वेज नेविगेशन बेंचमार्क पर अत्याधुनिक प्रदर्शन प्राप्त करने के लिए तीन-चरणीय प्रशिक्षण पाइपलाइन के माध्यम से ऑफ-पॉलिसी इमिटेशन लर्निंग को ऑन-पॉलिसी एक्सप्लोरेशन के साथ सहक्रियात्मक रूप से एकीकृत करता है।

मूल लेखक: Qingrong He, Lin Zhao, Kevin Zheng, Liang Lin

प्रकाशित 2026-07-16
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Qingrong He, Lin Zhao, Kevin Zheng, Liang Lin

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को अपना व्यक्तिगत टूर गाइड बनने के लिए प्रशिक्षित कर रहे हैं। आप चाहते हैं कि वह आपके वॉयस कमांड्स को सुने जैसे, "किचन की ओर चलो, नीले फूलदान के पास बाएं मुड़ो, और फ्रिज के सामने रुक जाओ," और फिर बिना दीवारों से टकराए या रास्ता भटके उसे वास्तव में करे। यह विज़न-एंड-लैंग्वेज नेविगेशन (VLN) की दुनिया है। यह रोबोटिक्स की एक शाखा है जहाँ एक "एम्बोडीड एजेंट" (एक शरीर और आँखों वाला रोबोट) को एक कैमरे के माध्यम से वास्तविक दुनिया को समझना होता है और घूमने के लिए मानवीय भाषा का अर्थ निकालना होता है।

बड़ी चुनौती यह है कि रोबोट अपनी गलतियों से सीखने में बहुत खराब होते हैं। यदि आप रोबोट को चलने के आदर्श वीडियो दिखाकर सिखाते हैं, तो वह उन वीडियो की नकल करना सीख जाता है। लेकिन जैसे ही वह किसी नए कमरे में कदम रखता है या किसी कुर्सी को अलग जगह पर देखता है, वह घबरा जाता है क्योंकि उसने कभी यह नहीं सीखा कि चीजें गलत होने पर खुद को कैसे संभालना है। यह उस छात्र की तरह है जिसने अभ्यास टेस्ट के उत्तर रट लिए हैं लेकिन जब शिक्षक नंबर बदल देता है तो वह जम जाता है। इसे ठीक करने के लिए, वैज्ञानिक आमतौर पर दो अलग-अलग चीजें करने की कोशिश करते हैं: या तो वे रोबोट को आदर्श रास्तों के अधिक उदाहरण दिखाते हैं (इमिटेशन लर्निंग/अनुकरण सीखना), या वे रोबोट को इधर-उधर घूमने देते हैं और उसे एक "ट्रीट" (पुरस्कार) देते हैं जब वह लक्ष्य के करीब पहुँच जाता है (रीइन्फोर्समेंट लर्निंग/सुदृढ़ीकरण सीखना)। लंबे समय तक, ये दोनों तरीके दो अलग-अलग स्कूलों की तरह थे जो आपस में कभी बात नहीं करते थे।

यहाँ JOP-VLN आता है, एक नया फ्रेमवर्क जो इन दोनों स्कूलों के लिए एक संयुक्त पार्टी आयोजित करने का निर्णय लेता है। शोधकर्ताओं ने एक ऐसा सिस्टम बनाया है जो रोबट को तीन अलग-अलग चरणों में सिखाता है, जिसमें विशेषज्ञों की नकल करने की सुरक्षा और अपने आप खोजने के साहस का मिश्रण है। इसे एक प्रशिक्षण शिविर की तरह समझें जहाँ रोबोट पहले एक मास्टर कोच से बुनियादी बातें सीखता है, फिर एक "ट्रेनिंग व्हील्स" वाले दुनिया के संस्करण में अभ्यास करता है जहाँ एक सुरक्षा जाल उसे गिरने पर पकड़ लेता है, और अंत में, वह दुनिया में घूमने जाता है, लेकिन एक विशेष नियम के साथ: वह केवल उन समयों पर ध्यान देता है जब वह भ्रमित था या उसने गलती की थी, इन क्षणों का उपयोग खुद को स्मार्ट बनाने के लिए करता है।

यह पेपर इस तीन-चरणीय पाइपलाइन को रोबोट के नए अनुभवों के सामने फंस जाने की समस्या को हल करने के लिए पेश करता है। पहले चरण में, रोबोट बुनियादी नेविगेशन कौशल सीखता है और जो कुछ भी वह देखता है उसका सारांश बनाना सीखता है, ठीक वैसे ही जैसे कोई छात्र वर्णमाला सीखना और वाक्य लिखना सीखता है। दूसरे चरण में, रोबोट नेविगेट करने की कोशिश करता है, और जब भी वह रास्ते से भटकने लगता है, एक "गॉड-मोड" सुरक्षा प्रणाली (जिसे ऑरेकल कहा जाता है) उसके पथ को ठीक करने के लिए हस्तक्षेप करती है। रोबोट फिर इन सुधारे गए रास्तों से सीखता है, प्रभावी रूप से गलतियों से उबरने का अभ्यास करता है। यह "ऑफ-पॉलिसी" वाला हिस्सा है, जहाँ वह अपने स्वयं के प्रयासों और सुरक्षा जाल के सुधारों के मिश्रण से एकत्र किए गए डेटा से सीखता है।

जादू तीसरे चरण में होता है, जहाँ यह पेपर सब कुछ मिला देता है। शोधकर्ताओं ने महसूस किया कि यदि वे रोबोट को बेतरतीब ढंग से घूमने देते हैं, तो वह शायद गोल-गोल घूम सकता है या बुरी आदतों में बहुत अधिक आत्मविश्वासी हो सकता है। इसलिए, उन्होंने एक चतुर फ़िल्टर जोड़ा: वे केवल उन क्षणों से सीखने देते हैं जहाँ रोबोट वास्तव में अनिश्चित था या "हाई-एन्ट्रॉपी" (एक फैंसी तरीका कहने का कि वह बेतरतीब अंदाज़े लगा रहा था) था। यह रोबोट को उन आसान कार्यों पर समय बर्बाद करने से रोकता है जिन्हें वह पहले से जानता है और उसे कठिन चीजों पर ध्यान केंद्रित करने के लिए मजबूर करता है। इसके अलावा, उन्होंने प्रशिक्षण डेटा को इस तरह से छाँटा कि रोबोट उन विशिष्ट रास्तों पर सबसे अधिक समय बिताता है जहाँ वह पहले विफल हुआ था, जिससे यह सुनिश्चित होता है कि वह अपनी गलतियों को सुधारना सीखता है।

इसके परिणाम प्रभावशाली हैं। जब मानक नेविगेशन बेंचमार्क पर परीक्षण किया गया, तो JOP-VLN ने R2R डेटासेट पर 69.9% और RxR डेटासेट पर 68.0% की सफलता दर हासिल की। ये संख्याएँ एक नया स्टेट-ऑफ-द-आर्ट दर्शाती हैं, जिसका अर्थ है कि इसने पिछले तरीकों से बेहतर प्रदर्शन किया जो केवल एक प्रकार के लर्निंग पर निर्भर थे। शोधकर्ताओं ने वास्तविक दुनिया में भी रोबोट का परीक्षण किया, जिसमें एक चार पैरों वाले रोबोट कुत्ते का उपयोग करके इनडोर ऑफिस और आउटडोर गार्डन दोनों में परीक्षण किया गया। वास्तविक दुनिया की रोशनी और बनावट की जटिलताओं के बावजूद, रोबोट जटिल निर्देशों का पालन कर सका, जिससे साबित हुआ कि यह "संयुक्त" शिक्षण शैली इसे पहले की तुलना में बेहतर तरीके से सामान्य बनाने में मदद करती है। पेपर सुझाव देता है कि विशेषज्ञ मार्गदर्शन और स्मार्ट, त्रुटि-केंद्रित अन्वेषण को सावधानीपूर्वक मिलाकर, हम ऐसे रोबोट बना सकते हैं जो न केवल नियमों का पालन करने में अच्छे हैं, बल्कि वास्तविक दुनिया के अप्रत्याशित मोड़ और बदलावों को संभालने के लिए पर्याप्त लचीले भी हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →