LocalNav: Distilling Frontier VLMs and Embodied RL for On-Device Object Goal Navigation
यह शोध पत्र "LocalNav" प्रस्तुत करता है, जो एक ऐसा फ्रेमवर्क है जो अत्याधुनिक विजन लैंग्वेज मॉडल्स से जटिल स्थानिक-सिमेंटिक तर्क (spatial-semantic reasoning) को एक हल्के 4B-पैरामीटर वाले मॉडल में संकुचित (distill) करता है और इसे E-RLVR एवं क्वांटाइजेशन के साथ अनुकूलित करता है, जिससे क्लाउड निष्पादन पर निर्भर रहे बिना संसाधन-सीमित एज डिवाइसेस पर उच्च-प्रदर्शन, कम-विलंबता वाला ऑब्जेक्ट गोल नेविगेशन सक्षम होता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास एक बहुत ही बुद्धिमान, लेकिन बहुत भारी, रोबोट मस्तिष्क है। यह मस्तिष्क ज्ञान के एक विशाल पुस्तकालय की तरह है जो "माइक्रोवेव के नीचे वाले दराज ढूँढो" जैसे जटिल निर्देशों को समझ सकता है। समस्या यह है कि यह मस्तिष्क इतना बड़ा और भारी है कि यह एक छोटे रोबोट के अंदर नहीं समा सकता; इसे दूर स्थित एक विशाल क्लाउड कंप्यूटर में रहना पड़ता है। हर बार जब रोबोट को कोई निर्णय लेने की आवश्यकता होती है, तो उसे क्लाउड को एक संदेश भेजना पड़ता है, जवाब का इंतज़ार करना पड़ता है, और फिर चलना पड़ता है। यह धीमा, महंगा है और तब काम नहीं करता जब रोबोट ऐसी जगह हो जहाँ इंटरनेट न हो।
यह शोध पत्र LocalNav पेश करता है, जो उस विशाल क्लाउड मस्तिष्क को छोटा करने का एक नया तरीका है ताकि वह एक छोटे रोबोट (जैसे कि जेटसन ओरिन चिप वाला रोबोट) के अंदर समा सके और बिना क्लाउड की मदद के पूरी तरह से अपने आप काम कर सके।
उन्होंने इसे तीन सरल चरणों का उपयोग करके किया है:
1. "शैडो स्टूडेंट" (डिस्टिलेशन - Distillation)
उस विशाल क्लाउड मस्तिष्क (जैसे क्लॉड या GPT) को एक मास्टर शेफ की तरह समझें। मास्टर शेफ एक जटिल और उत्तम भोजन बना सकता है, लेकिन इसमें बहुत समय लगता है और एक बहुत बड़े किचन की आवश्यकता होती है। शोधकर्ता एक स्टूडेंट शेफ (एक बहुत छोटा, 4-बिलियन-पैरामीटर वाला मॉडल जिसे Qwen3.5-4B कहा जाता है) को वही व्यंजन बनाना सिखाना चाहते थे।
स्टूडेंट को लाखों कुकबुक्स पढ़ने के लिए मजबूर करने के बजाय, उन्होंने स्टूडेंट को नेविगेशन पहेलियों को हल करने के लगभग 500 उदाहरण दिखाए। उन्होंने कहा, "देखें कि मास्टर शेफ कैसे सोचता है: 'मुझे एक माइक्रोवेव दिख रहा है, इसलिए दराज इसके नीचे होने चाहिए।'" इन विशिष्ट उदाहरणों की नकल करके, स्टूडेंट शेफ ने नेविगेशन उतना ही अच्छी तरह से सीखा जितना कि मास्टर शेफ ने, लेकिन उसका मस्तिष्क इतना छोटा था कि वह एक बैकपैक में भी समा सके।
- परिणाम: छोटे रोबोट मस्तिष्क ने 34.5% की सफलता दर हासिल की, जो विशाल क्लाउड मस्तिष्क की 39.7% की दर के बहुत करीब है।
2. "ब्रेविटी कोच" (E-RLVR)
एक समस्या थी: स्टूडेंट शेफ थोड़ा ज्यादा बातें करने लगा था। जब दराज खोजने के लिए कहा जाता, तो मास्टर शेफ कह सकता था, "मैं एक चांदी जैसा दिखने वाला उपकरण देख रहा हूँ जो माइक्रोवेव जैसा दिखता है, और मुझे याद है कि दराज आमतौर पर माइक्रोवेव के नीचे होते हैं, इसलिए मैं वहाँ जाऊँगा।" यह बहुत सारे शब्द हैं जिन्हें टाइप करना पड़ता है! सीमित बैटरी और प्रोसेसिंग पावर वाले रोबोट के लिए, इतने सारे शब्द टाइप करने में बहुत समय लगता है।
इसे ठीक करने के लिए, शोधकर्ताओं ने E-RLVR (एम्बॉडीड रीइन्फोर्समेंट लर्निंग फ्रॉम वेरीफिएबल रिवार्ड्स) नामक तकनीक का उपयोग किया। एक सख्त कोच की कल्पना करें जो स्टूडेंट रोबोट को देख रहा है।
- यदि रोबोट उत्तर देने में बहुत अधिक समय लेता है या बहुत अधिक शब्द बोलता है, तो कोच उसे "खराब ग्रेड" देता है।
- यदि रोबोट जल्दी से वस्तु को ढूंढ लेता है और केवल कुछ शब्दों में कहता है, "दराज मिल गए। समाप्त!", तो कोच उसे "गोल्ड स्टार" देता है।
रोबोट ने "बात करने" के बजाय "करने" के बारे में सीखा। उसने यह समझ लिया कि कम से कम शब्दों का उपयोग करके काम को कैसे पूरा किया जाए। इसने सोचने और बोलने में लगने वाले समय को 71.8% तक कम कर दिया।
3. "कॉम्पैक्ट सूट" (क्वांटाइजेशन - Quantization)
अंत में, रोबोट को और भी तेज़ बनाने के लिए, उन्होंने मस्तिष्क को एक "कॉम्पैक्ट सूट" पहनाया। यह क्वांटाइजेशन नामक एक तकनीकी ट्रिक है, जो एक हाई-रिज़ॉल्यूशन फोटो को उसके महत्वपूर्ण विवरणों को खोए बिना एक छोटी फ़ाइल आकार में कंप्रेस करने जैसा है। इसने रोबोट के मस्तिष्क को उसके छोटे हार्डवेयर पर और भी तेज़ी से चलाने में मदद की।
अंतिम परिणाम
इन तीन ट्रिक्स को मिलाकर:
- मास्टर से सीखना (डिस्टिलेशन),
- संक्षिप्त होना सीखना (E-RLVR), और
- मस्तिष्क को कंप्रेस करना (क्वांटाइजेशन),
शोधकर्ताओं ने एक ऐसा रोबोट बनाया जो "मेज पर बैठे व्यक्ति को ढूँढो" जैसे जटिल निर्देशों को समझ सकता है और बिना इंटरनेट के पूरी तरह से अपने आप एक वास्तविक अपार्टमेंट में नेविगेट कर सकता है।
अपने वास्तविक दुनिया के परीक्षण में, उन्होंने एक हैंडहेल्ड रोबोट को चार अलग-अलग मिशनों के साथ एक अपार्टमेंट में भेजा: सोफा, पियानो, बाथटब और एक व्यक्ति को ढूँढना। रोबोट ने सफलतापूर्वक कमरों का मानसिक मानचित्र बनाया, वस्तुओं को खोजा, और ठीक वहीं रुक गया जहाँ उसे रुकना था, जिससे यह साबित हुआ कि एक छोटा, स्थानीय मस्तिष्क एक विशाल क्लाउड मस्तिष्क का काम कर सकता है।
संक्षेप में: उन्होंने एक सुपर-स्मार्ट लेकिन धीमे क्लाउड मस्तिष्क को लिया, एक छोटे स्थानीय मस्तिष्क को उसकी तरह सोचना सिखाया, छोटे मस्तिष्क को इतनी बातें करना बंद करने के लिए सिखाया, और उसे एक छोटे पैकेज में फिट कर दिया। अब, रोबोट सीधे डिवाइस पर ही तेज़ी से सोच और चल सकता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।