From Seeing to Experiencing: Scaling Navigation Foundation Models with Reinforcement Learning
यह शोध पत्र सीइंग-टू-एक्सपीरियंसिंग (S2E) फ्रेमवर्क प्रस्तुत करता है, जो वेब-स्केल वीडियो पर ऑफलाइन प्रीट्रेनिंग को सिमुलेशन में रिइन्फोर्समेंट लर्निंग के साथ जोड़कर नेविगेशन फाउंडेशन मॉडल्स को बेहतर बनाता है ताकि इंटरैक्टिव रीजनिंग और सुरक्षा में सुधार किया जा सके, जिसे नव-बेंच-जीएस (NavBench-GS) नामक एक नए इवैल्यूएशन बेंचमार्क द्वारा समर्थित किया गया है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
यहाँ "From Seeing to Experiencing: Scaling Navigation Foundation Models with Reinforcement Learning" पेपर का सरल भाषा और रचनात्मक उपमाओं (analogies) के साथ विवरण दिया गया है।
बड़ी समस्या: "पर्यटक" बनाम "स्थानीय निवासी"
कल्पना कीजिए कि आप एक रोबोट को व्यस्त शहर में चलना सिखाना चाहते हैं।
पुराना तरीका (सिर्फ "देखना"):
वर्तमान में, अधिकांश नेविगेशन रोबोटों को एक ऐसे पर्यटक की तरह प्रशिक्षित किया जाता है जिसने शहरों में चलने के बारे में हजारों घंटों के यूट्यूब वीडियो देखे हैं। उन्होंने स्क्रीन पर हर प्रकार की सड़क, भीड़ और बाधा को देखा है। इसे ऑफलाइन प्री-ट्रेनिंग (Offline Pre-training) कहा जाता है।
- खामी: किसी व्यक्ति को स्केटबोर्ड से बचते हुए देखने और वास्तव में खुद बचकर निकलने में बहुत अंतर है। रोबोट जानता है कि टक्कर कैसी दिखती है, लेकिन वह गिरने के भौतिक विज्ञान (physics) या रुकने के लिए आवश्यक पलक झपकते ही होने वाली टाइमिंग को नहीं समझता। यदि रोबोट वास्तविक दुनिया में चलने की कोशिश करता है, तो वह जम सकता है या टकरा सकता है क्योंकि उसने कभी गलत मोड़ के परिणामों को "महसूस" नहीं किया है। उसमें कारणता (causality) यानी 'कारण और प्रभाव' की कमी है।
नया तरीका (S2E फ्रेमवर्क):
लेखक एक नई विधि प्रस्तावित करते हैं जिसे सीइंग-टू-एक्सपीरियंसिंग (Seeing-to-Experiencing - S2E) कहा जाता है। इसे एक ऐसे पर्यटक को एक अत्यधिक यथार्थवादी, सुरक्षित वीडियो गेम सिम्युलेटर में भेजने के रूप में सोचें जहाँ वे वास्तव में चल सकते हैं, लड़खड़ा सकते हैं और बिना चोट लगे अपनी गलतियों से सीख सकते हैं।
लक्ष्य वीडियो देखने वाले पर्यटक के व्यापक ज्ञान को उस व्यक्ति की सड़क की समझ (street smarts) के साथ जोड़ना है जिसने वास्तव में वास्तविक दुनिया में अभ्यास किया है।
यह कैसे काम करता है: दो चरणों वाली रेसिपी
S2E फ्रेमवर्क इसे कुशलतापूर्वक करने के लिए दो मुख्य "ट्रिक्स" का उपयोग करता है।
1. "एंकर" सिस्टम (वीडियो चरण के दौरान)
चुनौती: जब एक रोबोट वीडियो देखता है, तो वह देखता है कि कभी लोग सीधे चलते हैं, कभी कुत्ते से बचने के लिए बाएं मुड़ते हैं, और कभी रेड लाइट के लिए रुक जाते हैं। ये सभी स्थितियाँ एक ही स्थिति के लिए वैध क्रियाएं हैं। यदि रोबोट केवल एक औसत पथ का अनुमान लगाने की कोशिश करता है, तो वह विफल हो जाएगा।
समाधान: लेखक एंकर-गाइडेड डिस्ट्रीब्यूशन मैचिंग (Anchor-Guided Distribution Matching) का उपयोग करते हैं।
- उपमा: कल्पना कीजिए कि रोबोट एक शेफ है जो रेसिपी का अनुमान लगाने की कोशिश कर रहा है। केवल एक स्वाद का अनुमान लगाने के बजाय, वे मेज पर कई "एंकर" (जैसे विशिष्ट स्वाद प्रोफाइल: "तीखा," "मीठा," "नमकीन") रखते हैं।
- यह कैसे मदद करता है: रोबॉर्म यह सीखता है कि एक विशिष्ट स्थिति के लिए, उत्तर "तीखा" (सीधे जाना) या "नमकीन" (बाएं मुड़ना) हो सकता है। इन एंकर्स का उपयोग करके, रोबोट केवल एक औसत अनुमान के बजाय संभावित अच्छे कार्यों का एक "मेन्यू" बनाना सीखता है। यह रोबोट को बहुत अधिक लचीला और विभिन्न परिदृश्यों के लिए तैयार बनाता है।
2. "रेसिड्यूअल" मस्तिष्क (अभ्यास चरण के दौरान)
चुनौती: एक बार जब रोबोट सिम्युलेटर में अभ्यास करना शुरू कर देता है, तो हम चाहते हैं कि वह नए करतब सीखे (जैसे चलते हुए पैदल यात्री से बचना)। लेकिन यदि हम रोबोट को सब कुछ फिर से शून्य से सीखने दें, तो वह सीधा चलना या फुटपाथ पहचानना भूल सकता है। इसे "कैटास्ट्रॉफिक फॉरगेटिंग" (Catastrophic Forgetting) कहा जाता है। इसके अलावा, सिम्युलेटर वास्तविक दुनिया से थोड़ा अलग दिखता है (अलग रोशनी, बनावट), जो रोबोट को भ्रमित कर सकता है।
समाधान: वे एक रेसिड्यूअल-अटेंशन मॉड्यूल (Residual-Attention Module) का उपयोग करते हैं।
- उपमा: कल्पना कीजिए कि रोबोट के पास एक "बेस ब्रेन" (वह हिस्सा जो वीडियो पर प्रशिक्षित है) है जो सड़कों को पहचानने में उत्कृष्ट है। जब वह सिम्युलेटर में प्रवेश करता है, तो हम बेस ब्रेन को बदलते नहीं हैं। इसके बजाय, हम उसके ऊपर एक छोटा, हल्का "एड-ऑन ब्रेन" (रेसिड्यूअल मॉड्यूल) जोड़ देते हैं।
- यह कैसे मदद करता है: बेस ब्रेन स्थिर रहता है और अपने सामान्य ज्ञान को सुरक्षित रखता है। एड-ऑन ब्रेन ही एकमात्र हिस्सा है जो सीखता है। यह केवल नई, संवादात्मक चीजों पर ध्यान केंद्रित करता है: "ओह, वह व्यक्ति हिल रहा है, मुझे धीमा होना चाहिए।"
- लाभ: यह आपके फोन में अपने कॉन्टैक्ट्स को हटाए बिना एक नया ऐप जोड़ने जैसा है। रोबोट अपने पुराने सामान्य ज्ञान (सड़क पहचानना) को खोए बिना नए प्रतिक्रियात्मक कौशल (बचना, रुकना) प्राप्त करता है।
टेस्ट ड्राइव: NavBench-GS
यह साबित करने के लिए कि यह काम करता है, लेखकों ने एक नया परीक्षण मैदान बनाया जिसे NavBench-GS कहा जाता है।
- यह क्या है? 2D छवियों (जैसे सड़क की फोटो देखना) पर परीक्षण करने के बजाय, उन्होंने एक 3D दुनिया बनाई है जो बिल्कुल वास्तविक दुनिया जैसी दिखती है और जिसमें वास्तविक भौतिकी (physics) है। आप रोबोट की ओर गेंद फेंक सकते हैं, और वह प्रतिक्रिया करेगा।
- परिणाम:
- केवल वीडियो पर प्रशिक्षित रोबोट (जो "पर्यटक" थे) चलते हुए लोगों या बाधाओं के सामने आने पर अक्सर टकरा गए।
- S2E पद्धति के साथ प्रशिक्षित रोबोट (जो "स्थानीय निवासी" थे) बहुत बेहतर थे। वे अपने गंतव्य तक अधिक बार पहुँचे और बहुत कम बार टकराए।
- दक्षता का आश्चर्य: S2E रोबोट ने कम डेटा के साथ तेजी से सीखा। केवल 100 घंटे के डेटा + सिम्युलेटर अभ्यास के साथ प्रशिक्षित रोबोट ने 2,000 घंटों से अधिक के वीडियो वाले अन्य रोबोटों से बेहतर प्रदर्शन किया। यह साबित करता है कि इंटरैक्टिव अभ्यास, केवल अधिक वीडियो देखने की तुलना में अधिक मूल्यवान है।
वास्तविक दुनिया का प्रमाण
टीम ने केवल सिमुलेशन तक ही सीमित नहीं रही। उन्होंने अपने रोबोट को दो वास्तविक मशीनों पर भी लगाया:
- एक पहिए वाला रोबोट (जैसे डिलीवरी बॉट)।
- एक क्वाड्रुपेड रोबोट (कुत्ते जैसा रोबोट)।
उन्होंने इन रोबोटों को वास्तविक बाधाओं और लोगों के साथ वास्तविक शहर की सड़कों में टेस्ट किया। S2E रोबोट उन जटिल वातावरणों में सफलतापूर्वक नेविगेट करने में सक्षम रहे, बिना किसी पूर्व विशिष्ट प्रशिक्षण के (Zero-Shot Generalization)। वे फुटपाथ पर बने रहे और पैदल यात्रियों से बचते रहे, जिससे साबित हुआ कि सिम्युलेटर में सीखे गए कौशल वास्तविक दुनिया में पूरी तरह से स्थानांतरित हो गए।
सारांश
यह पेपर तर्क देता है कि रोबोट को वास्तव में स्मार्ट नेविगेटर बनाने के लिए, हम उन्हें केवल अधिक वीडियो खिलाकर नहीं छोड़ सकते। हमें उन्हें अभ्यास करने देना होगा। एक स्थिर "वीडियो-आधारित" आधार को एक "अभ्यास-आधारित" लर्निंग मॉड्यूल के साथ जोड़कर, जो उनके मूल ज्ञान को ओवरराइट नहीं करता है, रोबोट अराजक वास्तविक दुनिया में सुरक्षित और कुशलता से नेविगेट करना सीख सकते हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।