← नवीनतम पेपर
💻 computer science

LightNav-0: Eliciting VLM Spatial Intelligence for Generalist Embodied Navigation

LightNav-0 एक कॉम्पैक्ट, जनरलइस्ट एम्बोडीड नेविगेशन मॉडल है जो प्रीट्रेन्ड विजन-लैंग्वेज मॉडल्स की स्थानिक बुद्धिमत्ता को रोबोट कंट्रोल के साथ उभारने और संरेखित करने के लिए एक यूनिफाइड टोकन इंटरफेस का लाभ उठाता है, जिससे बिना किसी टास्क-विशिष्ट प्रेडिक्शन हेड के विविध कार्यों, वातावरणों और एम्बॉडिमेंट्स में अत्याधुनिक प्रदर्शन और ज़ीरो-शॉट जनरलाइजेशन प्राप्त होता है।

मूल लेखक: Shaoan Wang, Aocheng Luo, Fei Huang, Jingyi Xu, Xiaoyang Wang, Yueyu Wang, Qianli Ma, Fan Yang, Ran Mei, Jia Wei, Jiangpeng Hu, Xuhao Liu, Hongming Chen, Yuanbin Shao, Yiyang Lin, Ziliang Li, Liang Pa
प्रकाशित 2026-09-01
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Shaoan Wang, Aocheng Luo, Fei Huang, Jingyi Xu, Xiaoyang Wang, Yueyu Wang, Qianli Ma, Fan Yang, Ran Mei, Jia Wei, Jiangpeng Hu, Xuhao Liu, Hongming Chen, Yuanbin Shao, Yiyang Lin, Ziliang Li, Liang Pan, Xinhang Liu, Yuntao Ma, Tingxiang Fan

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

रोबोट लंबे समय से मनुष्यों की तरह सहजता से दुनिया में घूमने के लिए संघर्ष करते रहे हैं। जहाँ एक व्यक्ति एक कमरे में प्रवेश कर सकता है, एक नीली कुर्सी देख सकता है, और बोले गए निर्देश को सुनते हुए एक मेज के चारों ओर रास्ता बना सकता है, वहीं एक रोबोट अक्सर केवल पिक्सेल और ध्वनियों का एक अराजक ढेर देखता है। इस अंतर को पाटने के लिए, वैज्ञानिकों ने वर्षों तक विशेष प्रणालियाँ बनाने में बिताए हैं जो देखने, सोचने और चलने को अलग-अलग कार्यों के रूप में देखती हैं। सॉफ्टवेयर का एक हिस्सा वस्तुओं को पहचान सकता है, दूसरा नक्शा बना सकता है, और तीसरा यह तय कर सकता है कि किस दिशा में मुड़ना है। यह दृष्टिकोण नियंत्रित वातावरण में तो अच्छा काम करता है लेकिन अक्सर तब विफल हो जाता है जब रोबोट किसी नए कमरे, किसी अलग प्रकार की मशीन, या किसी जटिल निर्देश का सामना करता है। चुनौती एक ऐसे एकल मस्तिष्क को बनाने की रही है जो एक दृश्य को समझ सके, इस बारे में तर्क कर सके कि कहाँ जाना है, और वहाँ पहुँचने के लिए शरीर को नियंत्रित कर सके, वह भी एक साथ।

शोधकर्ताओं की एक टीम ने अब 'लाइटनेव-0' (LightNav-0) नामक एक नई प्रणाली पेश की है जो इस समस्या को हल करने का प्रयास करती है, और यह रोबोट को इंसानों की तरह सोचना सिखाती है: एक तस्वीर देखकर, जहाँ उसे जाना है वहाँ इशारा करके, और फिर आगे बढ़कर। हर कार्य के लिए अलग-अलग उपकरण बनाने के बजाय, शोधकर्ताओं ने एक बड़े, पूर्व-प्रशिक्षित कंप्यूटर मॉडल का उपयोग किया जो पहले से ही भाषा और छवियों को समझता है और उसे नेविगेशन (रास्ता खोजने) के लिए सिखाया। इस मॉडल को हर नए रोबोट या हर नए कमरे के लिए पुन: प्रोग्राम करने की आवश्यकता नहीं है। यह बस जो देखता है उसे देखता है, एक निर्देश सुनता है, और एक पथ तय करता है। परिणाम एक संक्षिप्त प्रणाली है जो निर्देशों का पालन कर सकती है, विशिष्ट वस्तुओं को खोज सकती है, और यहाँ तक कि चलते हुए लक्ष्यों का पीछा भी कर सकती है, और यह सब पहियों वाली गाड़ियों से लेकर चार पैरों वाले रोबोटों तक, विभिन्न प्रकार की मशीनों पर बिना किसी विशेष समायोजन के काम करती है।

इस प्रणाली का मूल आधार रोबोट के विचारों को कार्यों में बदलने का एक चतुर तरीका है। कल्पना कीजिए कि एक रोबोट स्क्रीन देख रहा है जिसमें एक गलियारा दिखाई दे रहा है। जब वह "पत्थर की इमारत के पास स्थित नीले रंग के फूड मेनू साइन की ओर चलो" जैसा आदेश सुनता है, तो वह तुरंत अपने पहिए घुमाना शुरू नहीं करता। पहले, वह अपने आंतरिक तर्क का उपयोग करके स्क्रीन पर दो विशिष्ट स्थानों की ओर इशारा करता है। एक बिंदु एक सुरक्षित स्थान को दर्शाता है जहाँ आगे बढ़ना है, जैसे कि फर्श का एक खुला हिस्सा, और दूसरा बिंदु वास्तविक लक्ष्य, यानी नीले साइन की पहचान करता है। यह इशारा करना रोबोट के मस्तिष्क और उसके शरीर के बीच एक स्पष्ट, साझा भाषा के रूप में कार्य करता है। एक बार ये बिंदु स्थापित हो जाने के बाद, रोबोट उस स्थान तक पहुँचने के लिए दस कदमों का एक छोटा रास्ता अनुमानित करता है। फिर वह इस पथ का पालन करता है, नए दृश्य को देखता है, और इस प्रक्रिया को दोहराता है। यात्रा को इन छोटे, तर्कपूर्ण चरणों में विभाजित करके, रोबोट बिना खोए या भ्रमित हुए जटिल वातावरण को संभाल सकता है।

रोबोट को यह कौशल सिखाने के लिए, शोधकर्ताओं ने उसे केवल कुछ उदाहरण नहीं दिखाए। उन्होंने 2,000 से अधिक विभिन्न दृश्यों और 4,000 घंटों से अधिक के नेविगेशन डेटा वाले एक विशाल प्रशिक्षण पुस्तकालय का निर्माण किया। इस पुस्तकालय में वस्तुओं को खोजने, लोगों का पीछा करने और इनडोर एवं आउटडोर दोनों स्थानों में चलने के निर्देश शामिल थे। प्रशिक्षण प्रक्रिया चरणों में हुई। पहले, मॉडल को स्थानिक संबंधों को समझने और छवियों में वस्तुओं और स्थानों पर सटीक रूप से इशारा करने के लिए सिखाया गया। फिर, इसे इस इशारा करने की क्षमता को वास्तविक गति कमांड के साथ जोड़ने के लिए सिखाया गया। अंत में, सिस्टम को परीक्षण और त्रुटि (trial and error) की एक प्रक्रिया के माध्यम से परिष्कृत किया गया, जहाँ इसने अपनी गलतियों को सुधारना और समय के साथ अपने पथ नियोजन (path planning) को बेहतर बनाना सीखा। इस कठोर प्रशिक्षण ने मॉडल को सामान्यीकरण (generalize) करने में सक्षम बनाया, जिसका अर्थ है कि वह प्रशिक्षण डेटा से सीखी गई बातों को पूरी तरह से नई स्थितियों में लागू कर सकता था।

इस कार्य के परिणाम महत्वपूर्ण हैं क्योंकि वे दिखाते हैं कि एक एकल, अपेक्षाकृत छोटा कंप्यूटर मॉडल उन बहुत बड़े, अधिक जटिल सिस्टम से बेहतर प्रदर्शन कर सकता है जो कई अलग-अलग विशिष्ट भागों पर निर्भर करते हैं। दस अलग-अलग सिमुलेशन वातावरणों में परीक्षणों के दौरान, इस नई प्रणाली ने निर्देशों का पालन करने और वस्तुओं को खोजने के लिए उच्चतम सफलता दर हासिल की, भले ही इसे केवल एक कैमरा व्यू देखने की अनुमति दी गई थी और इसके पास डेप्थ सेंसर या पूर्व-निर्मित मानचित्रों तक पहुंच नहीं थी। इसने इनडोर कमरों, बाहरी क्षेत्रों और यहाँ तक कि पूरी तरह से अलग दृश्य शैलियों वाले गेम वर्ल्ड में भी अच्छा प्रदर्शन किया। शायद सबसे प्रभावशाली बात यह है कि शोधकर्ताओं ने एक ही सॉफ्टवेयर का परीक्षण चार बहुत ही अलग भौतिक रोबोटों पर किया: एक ह्युमनॉइड रोबट, एक चार पैरों वाला रोबोट, एक उड़ने वाला ड्रोन और एक पहिये वाला वाहन। कोड की एक भी पंक्ति बदले बिना या मॉडल को पुन: प्रशिक्षित किए बिना, सिस्टम ने इन चारों प्रकार की मशीनों को वास्तविक दुनिया के कार्यों, जैसे कि किसी व्यक्ति का पीछा करने या किसी विशिष्ट वस्तु को खोजने में सफलतापूर्वक निर्देशित किया।

यह दृष्टिकोण पुराने विचार को चुनौती देता है कि रोबोटों को हर नए कार्य या शरीर के प्रकार के लिए एक अद्वितीय मस्तिष्क की आवश्यकता होती है। एक एकीकृत पद्धति का उपयोग करके जहाँ रोबोट अपने लक्ष्यों की ओर इशारा करता है और फिर एक छोटा रास्ता बनाता है, शोधकर्ताओं ने दिखाया है कि एक एकल, संक्षिप्त प्रणाली विविध नेविगेशन कार्यों को संभाल सकती है। यह प्रणाली जादू या जटिल, छिपी हुई गणनाओं पर निर्भर नहीं है; यह बस दुनिया को देखना, एक कमांड को समझना और आगे बढ़ने का रास्ता दिखाना सीखती है। हालाँकि यह कार्य मुख्य रूप से सिमुलेशन और नियंत्रित वास्तविक दुनिया के वातावरण में परीक्षण किया गया था, लेकिन विभिन्न रोबोटों और सेटिंग्स में इस कौशल को स्थानांतरित करने की क्षमता यह सुझाव देती है कि भविष्य में रोबोटों को व्यापक पुन: प्रोग्रामिंग की आवश्यकता के बिना नई जगहों पर तैनात किया जा सकता है और उन्हें नए कार्य दिए जा सकते हैं। लाइटनेव-0 की सफलता यह संकेत देती है कि अधिक सक्षम और अनुकूलन योग्य रोबोटों का मार्ग बड़े, अधिक विशिष्ट मशीनें बनाने में नहीं, बल्कि उन्हें उसी सरलता और लचीलेपन के साथ सोचने और इशारा करने में सिखाने में है, जिसका उपयोग मनुष्य प्रतिदिन करते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →