Robostral Navigate
Robustral Navigate एक 8B विजन-लैंग्वेज मॉडल है जो 2.4 मिलियन सिम्युलेटेड ट्रेजेक्टरीज वाले एक स्केलेबल ट्रेनिंग रेसिपी, प्रीफिक्स-कैशिंग एफिशिएंसी और इमेज-स्पेस वेपॉइंट प्रेडिक्शन का लाभ उठाकर विविध रोबोट एम्बॉडीमेंट्स में स्टेट-ऑफ-द-आर्ट मोनोकुलर नेविगेशन प्राप्त करता है, जिससे डेप्थ सेंसर या प्री-बिल्ट मैप्स की आवश्यकता समाप्त हो जाती है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक रोबोट को टूर गाइड बनना सिखा रहे हैं। रोबोटिक्स की दुनिया में, इसे "एम्बोडीड नेविगेशन" (embodied navigation) कहा जाता है—एक मशीन की वह क्षमता जिससे वह "किचन में जाओ" जैसे बोले गए निर्देश को समझ सके और बिना दीवारों से टकराए वास्तव में वहां तक चल सके। लंबे समय तक, सबसे अच्छे टूर गाइड उच्च श्रेणी के अंतरिक्ष यात्रियों की तरह थे: उन्हें अपना काम करने के लिए महंगे, भारी उपकरणों की आवश्यकता होती थी। वे विशेष 3D चश्मे (डेप्थ सेंसर) पहनते थे, एक सुरक्षा टीम की तरह कई कैमरों का उपयोग करते थे, या पूरी इमारत के पहले से बने मानचित्रों पर निर्भर रहते थे। हालांकि ये रोबोट कुशल थे, लेकिन वे महंगे, नाजुक और एक साधारण डिलीवरी ड्रोन या छोटे वेयरहाउस व्हील पर फिट होने में कठिन थे। वैज्ञानिक एक बड़ा सवाल पूछ रहे थे: क्या हम एक ऐसा रोबोट बना सकते हैं जो उतना ही स्मार्ट हो लेकिन सबसे सरल, सबसे आम उपलब्ध उपकरण का उपयोग करता हो? इसका उत्तर एक एकल, मानक कैमरे में निहित है—वही जो आज लगभग हर फोन और रोबोट में पाया जाता है—और एक पर्याप्त शक्तिशाली मस्तिष्क में जो बाकी चीजों को समझने में सक्षम हो।
यह शोध पत्र रोबोस्ट्रल नेविगेट (Robostral Navigate) पेश करता है, जो केवल उस एकल, मानक कैमरे का उपयोग करके नेविगेशन की पहेली को हल करने के लिए डिज़ाइन किया गया एक नए प्रकार का रोबोट मस्तिष्क है। इसे एक ऐसे रोबोट के रूप में सोचें जिसे 3D मैप या लेजर स्कैनर की आवश्यकता नहीं है; इसके बजाय, यह केवल एक तस्वीर देखकर यात्रा के अगले कदम की ओर "इशारा" करना सीखता है। शोधकर्ताओं ने एक 8-बिलियन-पैरामीटर वाला "विज़न-लैंग्वेज मॉडल" (एक सुपर-स्मार्ट AI जो पढ़ और देख सकता है) बनाया और इसे एक वीडियो गेम जैसी सिमुलेशन में लाखों उदाहरण दिखाकर नेविगेट करना सिखाया। मीटरों में कितनी दूरी तय करनी है, इसकी जटिल गणितीय गणना करने के बजाय, मॉडल बस स्क्रीन पर इशारा करता है कि वह आगे कहाँ जाना चाहता है। यदि गंतव्य किसी कोने के पीछे छिपा हुआ है, तो यह एक निश्चित मात्रा में आगे बढ़ने की बैकअप योजना पर स्विच कर जाता है।
टीम ने पाया कि यह सरल दृष्टिकोण अविश्वसनीय रूप से शक्तिशाली है। 350,000 विभिन्न दृश्यों में 2.4 मिलियन सिम्युलेटेड यात्राओं पर इस मॉडल को प्रशिक्षित करके, उन्होंने एक ऐसी प्रणाली बनाई जो न केवल सस्ती और बनाने में आसान है, बल्कि कई फैंसी सेंसर वाले रोबोटों से अधिक स्मार्ट भी है। मानक परीक्षणों पर, रोबोस्ट्राल नेविगेट ने रास्ता खोजने में 77.4% सफलता दर हासिल की, जिसने पिछले सर्वश्रेष्ठ सिंगल-कैमरा रोबोटों को बड़े अंतर से पीछे छोड़ दिया और यहाँ तक कि कुछ उन रोबोटों को भी मात दी जो डेप्थ सेंसर या कई कैमरों का उपयोग करते थे। इसका असली रहस्य केवल इशारा करना नहीं था; यह एक नई ट्रेनिंग ट्रिक थी जिसने सीखने की प्रक्रिया को 22 गुना तेज़ बना दिया और एक रीइन्फोर्समेंट लर्निंग चरण था जिसने रोबोट को यह सिखाया कि रास्ता भटक जाने पर खुद को कैसे संभालना है। परिणाम स्वरूप, एक ऐसा रोबोट प्राप्त हुआ जो बिना दोबारा सिखाए एक पहिएदार कार्ट से लेकर चलने वाली मशीन या उड़ने वाले ड्रोन तक जा सकता है, जो यह सिद्ध करता है कि एक वास्तव में सामान्य-उद्देश्य वाले रोबोट को बनाने के लिए आपको मिलियन-डॉलर के सेंसर सूट की आवश्यकता नहीं है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।