LightNav-0: Eliciting VLM Spatial Intelligence for Generalist Embodied Navigation
LightNav-0 एक कॉम्पैक्ट, जनरलइस्ट एम्बोडीड नेविगेशन मॉडल है जो प्रीट्रेन्ड विजन-लैंग्वेज मॉडल्स की स्थानिक बुद्धिमत्ता को रोबोट कंट्रोल के साथ उभारने और संरेखित करने के लिए एक यूनिफाइड टोकन इंटरफेस का लाभ उठाता है, जिससे बिना किसी टास्क-विशिष्ट प्रेडिक्शन हेड के विविध कार्यों, वातावरणों और एम्बॉडिमेंट्स में अत्याधुनिक प्रदर्शन और ज़ीरो-शॉट जनरलाइजेशन प्राप्त होता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
रोबोट लंबे समय से मनुष्यों की तरह सहजता से दुनिया में घूमने के लिए संघर्ष करते रहे हैं। जहाँ एक व्यक्ति एक कमरे में प्रवेश कर सकता है, एक नीली कुर्सी देख सकता है, और बोले गए निर्देश को सुनते हुए एक मेज के चारों ओर रास्ता बना सकता है, वहीं एक रोबोट अक्सर केवल पिक्सेल और ध्वनियों का एक अराजक ढेर देखता है। इस अंतर को पाटने के लिए, वैज्ञानिकों ने वर्षों तक विशेष प्रणालियाँ बनाने में बिताए हैं जो देखने, सोचने और चलने को अलग-अलग कार्यों के रूप में देखती हैं। सॉफ्टवेयर का एक हिस्सा वस्तुओं को पहचान सकता है, दूसरा नक्शा बना सकता है, और तीसरा यह तय कर सकता है कि किस दिशा में मुड़ना है। यह दृष्टिकोण नियंत्रित वातावरण में तो अच्छा काम करता है लेकिन अक्सर तब विफल हो जाता है जब रोबोट किसी नए कमरे, किसी अलग प्रकार की मशीन, या किसी जटिल निर्देश का सामना करता है। चुनौती एक ऐसे एकल मस्तिष्क को बनाने की रही है जो एक दृश्य को समझ सके, इस बारे में तर्क कर सके कि कहाँ जाना है, और वहाँ पहुँचने के लिए शरीर को नियंत्रित कर सके, वह भी एक साथ।
शोधकर्ताओं की एक टीम ने अब 'लाइटनेव-0' (LightNav-0) नामक एक नई प्रणाली पेश की है जो इस समस्या को हल करने का प्रयास करती है, और यह रोबोट को इंसानों की तरह सोचना सिखाती है: एक तस्वीर देखकर, जहाँ उसे जाना है वहाँ इशारा करके, और फिर आगे बढ़कर। हर कार्य के लिए अलग-अलग उपकरण बनाने के बजाय, शोधकर्ताओं ने एक बड़े, पूर्व-प्रशिक्षित कंप्यूटर मॉडल का उपयोग किया जो पहले से ही भाषा और छवियों को समझता है और उसे नेविगेशन (रास्ता खोजने) के लिए सिखाया। इस मॉडल को हर नए रोबोट या हर नए कमरे के लिए पुन: प्रोग्राम करने की आवश्यकता नहीं है। यह बस जो देखता है उसे देखता है, एक निर्देश सुनता है, और एक पथ तय करता है। परिणाम एक संक्षिप्त प्रणाली है जो निर्देशों का पालन कर सकती है, विशिष्ट वस्तुओं को खोज सकती है, और यहाँ तक कि चलते हुए लक्ष्यों का पीछा भी कर सकती है, और यह सब पहियों वाली गाड़ियों से लेकर चार पैरों वाले रोबोटों तक, विभिन्न प्रकार की मशीनों पर बिना किसी विशेष समायोजन के काम करती है।
इस प्रणाली का मूल आधार रोबोट के विचारों को कार्यों में बदलने का एक चतुर तरीका है। कल्पना कीजिए कि एक रोबोट स्क्रीन देख रहा है जिसमें एक गलियारा दिखाई दे रहा है। जब वह "पत्थर की इमारत के पास स्थित नीले रंग के फूड मेनू साइन की ओर चलो" जैसा आदेश सुनता है, तो वह तुरंत अपने पहिए घुमाना शुरू नहीं करता। पहले, वह अपने आंतरिक तर्क का उपयोग करके स्क्रीन पर दो विशिष्ट स्थानों की ओर इशारा करता है। एक बिंदु एक सुरक्षित स्थान को दर्शाता है जहाँ आगे बढ़ना है, जैसे कि फर्श का एक खुला हिस्सा, और दूसरा बिंदु वास्तविक लक्ष्य, यानी नीले साइन की पहचान करता है। यह इशारा करना रोबोट के मस्तिष्क और उसके शरीर के बीच एक स्पष्ट, साझा भाषा के रूप में कार्य करता है। एक बार ये बिंदु स्थापित हो जाने के बाद, रोबोट उस स्थान तक पहुँचने के लिए दस कदमों का एक छोटा रास्ता अनुमानित करता है। फिर वह इस पथ का पालन करता है, नए दृश्य को देखता है, और इस प्रक्रिया को दोहराता है। यात्रा को इन छोटे, तर्कपूर्ण चरणों में विभाजित करके, रोबोट बिना खोए या भ्रमित हुए जटिल वातावरण को संभाल सकता है।
रोबोट को यह कौशल सिखाने के लिए, शोधकर्ताओं ने उसे केवल कुछ उदाहरण नहीं दिखाए। उन्होंने 2,000 से अधिक विभिन्न दृश्यों और 4,000 घंटों से अधिक के नेविगेशन डेटा वाले एक विशाल प्रशिक्षण पुस्तकालय का निर्माण किया। इस पुस्तकालय में वस्तुओं को खोजने, लोगों का पीछा करने और इनडोर एवं आउटडोर दोनों स्थानों में चलने के निर्देश शामिल थे। प्रशिक्षण प्रक्रिया चरणों में हुई। पहले, मॉडल को स्थानिक संबंधों को समझने और छवियों में वस्तुओं और स्थानों पर सटीक रूप से इशारा करने के लिए सिखाया गया। फिर, इसे इस इशारा करने की क्षमता को वास्तविक गति कमांड के साथ जोड़ने के लिए सिखाया गया। अंत में, सिस्टम को परीक्षण और त्रुटि (trial and error) की एक प्रक्रिया के माध्यम से परिष्कृत किया गया, जहाँ इसने अपनी गलतियों को सुधारना और समय के साथ अपने पथ नियोजन (path planning) को बेहतर बनाना सीखा। इस कठोर प्रशिक्षण ने मॉडल को सामान्यीकरण (generalize) करने में सक्षम बनाया, जिसका अर्थ है कि वह प्रशिक्षण डेटा से सीखी गई बातों को पूरी तरह से नई स्थितियों में लागू कर सकता था।
इस कार्य के परिणाम महत्वपूर्ण हैं क्योंकि वे दिखाते हैं कि एक एकल, अपेक्षाकृत छोटा कंप्यूटर मॉडल उन बहुत बड़े, अधिक जटिल सिस्टम से बेहतर प्रदर्शन कर सकता है जो कई अलग-अलग विशिष्ट भागों पर निर्भर करते हैं। दस अलग-अलग सिमुलेशन वातावरणों में परीक्षणों के दौरान, इस नई प्रणाली ने निर्देशों का पालन करने और वस्तुओं को खोजने के लिए उच्चतम सफलता दर हासिल की, भले ही इसे केवल एक कैमरा व्यू देखने की अनुमति दी गई थी और इसके पास डेप्थ सेंसर या पूर्व-निर्मित मानचित्रों तक पहुंच नहीं थी। इसने इनडोर कमरों, बाहरी क्षेत्रों और यहाँ तक कि पूरी तरह से अलग दृश्य शैलियों वाले गेम वर्ल्ड में भी अच्छा प्रदर्शन किया। शायद सबसे प्रभावशाली बात यह है कि शोधकर्ताओं ने एक ही सॉफ्टवेयर का परीक्षण चार बहुत ही अलग भौतिक रोबोटों पर किया: एक ह्युमनॉइड रोबट, एक चार पैरों वाला रोबोट, एक उड़ने वाला ड्रोन और एक पहिये वाला वाहन। कोड की एक भी पंक्ति बदले बिना या मॉडल को पुन: प्रशिक्षित किए बिना, सिस्टम ने इन चारों प्रकार की मशीनों को वास्तविक दुनिया के कार्यों, जैसे कि किसी व्यक्ति का पीछा करने या किसी विशिष्ट वस्तु को खोजने में सफलतापूर्वक निर्देशित किया।
यह दृष्टिकोण पुराने विचार को चुनौती देता है कि रोबोटों को हर नए कार्य या शरीर के प्रकार के लिए एक अद्वितीय मस्तिष्क की आवश्यकता होती है। एक एकीकृत पद्धति का उपयोग करके जहाँ रोबोट अपने लक्ष्यों की ओर इशारा करता है और फिर एक छोटा रास्ता बनाता है, शोधकर्ताओं ने दिखाया है कि एक एकल, संक्षिप्त प्रणाली विविध नेविगेशन कार्यों को संभाल सकती है। यह प्रणाली जादू या जटिल, छिपी हुई गणनाओं पर निर्भर नहीं है; यह बस दुनिया को देखना, एक कमांड को समझना और आगे बढ़ने का रास्ता दिखाना सीखती है। हालाँकि यह कार्य मुख्य रूप से सिमुलेशन और नियंत्रित वास्तविक दुनिया के वातावरण में परीक्षण किया गया था, लेकिन विभिन्न रोबोटों और सेटिंग्स में इस कौशल को स्थानांतरित करने की क्षमता यह सुझाव देती है कि भविष्य में रोबोटों को व्यापक पुन: प्रोग्रामिंग की आवश्यकता के बिना नई जगहों पर तैनात किया जा सकता है और उन्हें नए कार्य दिए जा सकते हैं। लाइटनेव-0 की सफलता यह संकेत देती है कि अधिक सक्षम और अनुकूलन योग्य रोबोटों का मार्ग बड़े, अधिक विशिष्ट मशीनें बनाने में नहीं, बल्कि उन्हें उसी सरलता और लचीलेपन के साथ सोचने और इशारा करने में सिखाने में है, जिसका उपयोग मनुष्य प्रतिदिन करते हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।