Joint On-and-Off Policy Learning for Vision-and-Language Navigation
यह शोध पत्र JOP-VLN को प्रस्तुत करता है, जो एक नवीन ढांचा है जो विजन-एंड-लैंग्वेज नेविगेशन बेंचमार्क पर अत्याधुनिक प्रदर्शन प्राप्त करने के लिए तीन-चरणीय प्रशिक्षण पाइपलाइन के माध्यम से ऑफ-पॉलिसी इमिटेशन लर्निंग को ऑन-पॉलिसी एक्सप्लोरेशन के साथ सहक्रियात्मक रूप से एकीकृत करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक रोबोट को अपना व्यक्तिगत टूर गाइड बनने के लिए प्रशिक्षित कर रहे हैं। आप चाहते हैं कि वह आपके वॉयस कमांड्स को सुने जैसे, "किचन की ओर चलो, नीले फूलदान के पास बाएं मुड़ो, और फ्रिज के सामने रुक जाओ," और फिर बिना दीवारों से टकराए या रास्ता भटके उसे वास्तव में करे। यह विज़न-एंड-लैंग्वेज नेविगेशन (VLN) की दुनिया है। यह रोबोटिक्स की एक शाखा है जहाँ एक "एम्बोडीड एजेंट" (एक शरीर और आँखों वाला रोबोट) को एक कैमरे के माध्यम से वास्तविक दुनिया को समझना होता है और घूमने के लिए मानवीय भाषा का अर्थ निकालना होता है।
बड़ी चुनौती यह है कि रोबोट अपनी गलतियों से सीखने में बहुत खराब होते हैं। यदि आप रोबोट को चलने के आदर्श वीडियो दिखाकर सिखाते हैं, तो वह उन वीडियो की नकल करना सीख जाता है। लेकिन जैसे ही वह किसी नए कमरे में कदम रखता है या किसी कुर्सी को अलग जगह पर देखता है, वह घबरा जाता है क्योंकि उसने कभी यह नहीं सीखा कि चीजें गलत होने पर खुद को कैसे संभालना है। यह उस छात्र की तरह है जिसने अभ्यास टेस्ट के उत्तर रट लिए हैं लेकिन जब शिक्षक नंबर बदल देता है तो वह जम जाता है। इसे ठीक करने के लिए, वैज्ञानिक आमतौर पर दो अलग-अलग चीजें करने की कोशिश करते हैं: या तो वे रोबोट को आदर्श रास्तों के अधिक उदाहरण दिखाते हैं (इमिटेशन लर्निंग/अनुकरण सीखना), या वे रोबोट को इधर-उधर घूमने देते हैं और उसे एक "ट्रीट" (पुरस्कार) देते हैं जब वह लक्ष्य के करीब पहुँच जाता है (रीइन्फोर्समेंट लर्निंग/सुदृढ़ीकरण सीखना)। लंबे समय तक, ये दोनों तरीके दो अलग-अलग स्कूलों की तरह थे जो आपस में कभी बात नहीं करते थे।
यहाँ JOP-VLN आता है, एक नया फ्रेमवर्क जो इन दोनों स्कूलों के लिए एक संयुक्त पार्टी आयोजित करने का निर्णय लेता है। शोधकर्ताओं ने एक ऐसा सिस्टम बनाया है जो रोबट को तीन अलग-अलग चरणों में सिखाता है, जिसमें विशेषज्ञों की नकल करने की सुरक्षा और अपने आप खोजने के साहस का मिश्रण है। इसे एक प्रशिक्षण शिविर की तरह समझें जहाँ रोबोट पहले एक मास्टर कोच से बुनियादी बातें सीखता है, फिर एक "ट्रेनिंग व्हील्स" वाले दुनिया के संस्करण में अभ्यास करता है जहाँ एक सुरक्षा जाल उसे गिरने पर पकड़ लेता है, और अंत में, वह दुनिया में घूमने जाता है, लेकिन एक विशेष नियम के साथ: वह केवल उन समयों पर ध्यान देता है जब वह भ्रमित था या उसने गलती की थी, इन क्षणों का उपयोग खुद को स्मार्ट बनाने के लिए करता है।
यह पेपर इस तीन-चरणीय पाइपलाइन को रोबोट के नए अनुभवों के सामने फंस जाने की समस्या को हल करने के लिए पेश करता है। पहले चरण में, रोबोट बुनियादी नेविगेशन कौशल सीखता है और जो कुछ भी वह देखता है उसका सारांश बनाना सीखता है, ठीक वैसे ही जैसे कोई छात्र वर्णमाला सीखना और वाक्य लिखना सीखता है। दूसरे चरण में, रोबोट नेविगेट करने की कोशिश करता है, और जब भी वह रास्ते से भटकने लगता है, एक "गॉड-मोड" सुरक्षा प्रणाली (जिसे ऑरेकल कहा जाता है) उसके पथ को ठीक करने के लिए हस्तक्षेप करती है। रोबोट फिर इन सुधारे गए रास्तों से सीखता है, प्रभावी रूप से गलतियों से उबरने का अभ्यास करता है। यह "ऑफ-पॉलिसी" वाला हिस्सा है, जहाँ वह अपने स्वयं के प्रयासों और सुरक्षा जाल के सुधारों के मिश्रण से एकत्र किए गए डेटा से सीखता है।
जादू तीसरे चरण में होता है, जहाँ यह पेपर सब कुछ मिला देता है। शोधकर्ताओं ने महसूस किया कि यदि वे रोबोट को बेतरतीब ढंग से घूमने देते हैं, तो वह शायद गोल-गोल घूम सकता है या बुरी आदतों में बहुत अधिक आत्मविश्वासी हो सकता है। इसलिए, उन्होंने एक चतुर फ़िल्टर जोड़ा: वे केवल उन क्षणों से सीखने देते हैं जहाँ रोबोट वास्तव में अनिश्चित था या "हाई-एन्ट्रॉपी" (एक फैंसी तरीका कहने का कि वह बेतरतीब अंदाज़े लगा रहा था) था। यह रोबोट को उन आसान कार्यों पर समय बर्बाद करने से रोकता है जिन्हें वह पहले से जानता है और उसे कठिन चीजों पर ध्यान केंद्रित करने के लिए मजबूर करता है। इसके अलावा, उन्होंने प्रशिक्षण डेटा को इस तरह से छाँटा कि रोबोट उन विशिष्ट रास्तों पर सबसे अधिक समय बिताता है जहाँ वह पहले विफल हुआ था, जिससे यह सुनिश्चित होता है कि वह अपनी गलतियों को सुधारना सीखता है।
इसके परिणाम प्रभावशाली हैं। जब मानक नेविगेशन बेंचमार्क पर परीक्षण किया गया, तो JOP-VLN ने R2R डेटासेट पर 69.9% और RxR डेटासेट पर 68.0% की सफलता दर हासिल की। ये संख्याएँ एक नया स्टेट-ऑफ-द-आर्ट दर्शाती हैं, जिसका अर्थ है कि इसने पिछले तरीकों से बेहतर प्रदर्शन किया जो केवल एक प्रकार के लर्निंग पर निर्भर थे। शोधकर्ताओं ने वास्तविक दुनिया में भी रोबोट का परीक्षण किया, जिसमें एक चार पैरों वाले रोबोट कुत्ते का उपयोग करके इनडोर ऑफिस और आउटडोर गार्डन दोनों में परीक्षण किया गया। वास्तविक दुनिया की रोशनी और बनावट की जटिलताओं के बावजूद, रोबोट जटिल निर्देशों का पालन कर सका, जिससे साबित हुआ कि यह "संयुक्त" शिक्षण शैली इसे पहले की तुलना में बेहतर तरीके से सामान्य बनाने में मदद करती है। पेपर सुझाव देता है कि विशेषज्ञ मार्गदर्शन और स्मार्ट, त्रुटि-केंद्रित अन्वेषण को सावधानीपूर्वक मिलाकर, हम ऐसे रोबोट बना सकते हैं जो न केवल नियमों का पालन करने में अच्छे हैं, बल्कि वास्तविक दुनिया के अप्रत्याशित मोड़ और बदलावों को संभालने के लिए पर्याप्त लचीले भी हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।