ABot-N0: Technical Report on the VLA Foundation Model for Versatile Embodied Navigation
यह शोध पत्र ABot-N0 को प्रस्तुत करता है, जो एक पदानुक्रमित "ब्रेन-एक्शन" (मस्तिष्क-क्रिया) आर्किटेक्चर वाला एक एकीकृत विजन-लैंग्वेज-एक्शन फाउंडेशन मॉडल है और जिसे 16.9 मिलियन प्रक्षेप पथों (ट्रैजेक्टरीज) के विशाल डेटासेट पर प्रशिक्षित किया गया है, जो पांच विविध एम्बोडीड नेविगेशन कार्यों में अत्याधुनिक प्रदर्शन प्राप्त करता है और गतिशील वास्तविक दुनिया के वातावरण में मजबूत लॉन्ग-होरिजन मिशनों को सक्षम बनाता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक रोबोट को एक आदर्श मानव साथी बनना सिखाने की कोशिश कर रहे हैं। अतीत में, रोबोटिक्स शोधकर्ताओं ने "विशेषज्ञ" (specialists) बनाए थे: एक रोबोट जो केवल एक विशिष्ट निर्देशांक (coordinate) तक चल सकता था, दूसरा जो केवल एक लाल कप ढूंढ सकता था, और तीसरा जो केवल एक व्यक्ति का पीछा कर सकता था। यदि आप चाहते कि रोबोट ये तीनों काम करे, तो आपको उसका मस्तिष्क बदलना पड़ता या एक साथ तीन अलग-अलग प्रोग्राम चलाने पड़ते। यह एक ऐसी कार की तरह था जो केवल हाईवे पर चल सकती है, एक अलग कार जो ऑफ-रोडिंग के लिए है, और तीसरी जो केवल पार्किंग के लिए है।
ABot-N0 अलीबाबा का इस समस्या का समाधान है। इसे रोबोटिक ब्रेन्स का "स्विस आर्मी नाइफ" समझें। यह एक एकल, एकीकृत मॉडल है जो घूमने-फिरने से संबंधित सब कुछ कर सकता है, चाहे वह किसी विशिष्ट कॉफी शॉप को खोजना हो या भीड़भाड़ वाले पार्क में एक दोस्त का पीछा करना हो, और वह भी जटिल मानवीय भाषा को समझते हुए।
यहाँ बताया गया है कि यह कैसे काम करता है, सरल उपमाओं का उपयोग करते हुए:
1. "ग्रैंड यूनिफिकेशन": एक मस्तिष्क, पाँच महाशक्तियाँ
पाँच अलग-अलग रोबोटों के बजाय, ABot-N0 एक ही रोबोट है जो पाँच मुख्य कौशलों में महारत रखता है:
- पॉइंट-गोल (Point-Goal): "उन GPS निर्देशांकों पर जाओ।" (एक टैक्सी ड्राइवर की तरह जो मानचित्र का पालन करता है)।
- ऑब्जेक्ट-गोल (Object-Goal): "एक कुर्सी ढूँढो।" (एक जासूस की तरह जो कमरे की तलाशी लेता है)।
- इंस्ट्रक्शन-फॉलोइंग (Instruction-Following): "किचन में जाओ, बाएं मुड़ो, और फ्रिज के पास रुक जाओ।" (एक रेसिपी का पालन करने की तरह)।
- POI-गोल (POI-Goal): "स्टारबक्स के प्रवेश द्वार पर जाओ।" (किसी विशिष्ट इमारत के सामने के दरवाजे को खोजने की तरह)।
- पर्सन-फॉलोइंग (Person-Following): "उस व्यक्ति का पीछा करो जिसने लाल जैकेट पहनी है।" (एक वफादार कुत्ते की तरह जो टहलने पर चलता है)।
2. आर्किटेक्चर: "मस्तिष्क" और "एक्शन एक्सपर्ट"
यह पेपर एक "ब्रेन-एक्शन" आर्किटेक्चर का वर्णन करता है। एक मानव पायलट की कल्पना करें जो विमान उड़ा रहा है:
- संज्ञानात्मक मस्तिष्क (द पायलट): यह एक बड़ा लैंग्वेज मॉडल (जैसे एक सुपर-स्मार्ट AI चैटबॉट) है। यह देखता है कि रोबोट क्या देख रहा है, इंसान के निर्देशों को पढ़ता है, और यह समझता है कि क्या किया जाना चाहिए। यह तर्क देता है: "व्यक्ति तेज़ चल रहा है, इसलिए मुझे गति बढ़ानी होगी," या "वह एक कॉफी शॉप जैसा दिखता है, लेकिन दरवाजा बंद है, इसलिए मुझे प्रतीक्षा करनी चाहिए।"
- एक्शन एक्सपर्ट (को-पायलट/इंजन): यह हिस्सा सोचता नहीं है; यह चलता है। यह पायलट की योजना को लेता है और उसे सुचारू, सटीक शारीरिक गतिविधियों में अनुवादित करता है। यह फ्लो मैचिंग (Flow Matching) नामक तकनीक का उपयोग करता है, जो एक मास्टर डांसर की तरह है जो हजारों वीडियो से सीखता है। केवल एक रास्ता अनुमान लगाने के बजाय, यह समझता है कि कुर्सी के चारों ओर जाने के कई तरीके (बाएं, दाएं, या बीच से निकलना) हैं और सबसे सुचारू रास्ता चुनता है।
3. डेटा इंजन: रोबोट के लिए "जिम"
इतना स्मार्ट बनने के लिए, रोबोट ने केवल कुछ घंटों के अभ्यास से नहीं सीखा। शोधकर्ताओं ने एक विशाल डेटा इंजन बनाया।
- दृश्य (The Scenes): उन्होंने 7,802 अलग-अलग 3D वातावरणों के साथ एक आभासी दुनिया बनाई। एक लाइब्रेरी की कल्पना करें जिसमें आपके द्वारा सोचे गए हर प्रकार के घर, ऑफिस, मॉल, पार्क और शहर के चौराहे हाई-डेफिनिशन में डिजिटल रूप में मौजूद हैं।
- प्रशिक्षण (The Training): उन्होंने रोबोट को 16.9 मिलियन विशेषज्ञ प्रक्षेप पथ (expert trajectories) खिलाए। यह रोबोट को इन जगहों से पूरी तरह से चलने वाले मनुष्यों के लाखों घंटों के वीडियो दिखाने जैसा है।
- तर्क (The Reasoning): उन्होंने इसे 5 मिलियन "सोचने वाले" नमूने (thinking samples) भी दिए। यह एक शिक्षक की तरह है जो रोबोट के पास बैठकर उसे समझा रहा है कि उन्होंने एक निश्चित मोड़ क्यों लिया। "मैंने यहाँ बाएँ मुड़ा क्योंकि दायां रास्ता निर्माण कार्य द्वारा अवरुद्ध था।" यह रोबटेज को केवल गति नहीं, बल्कि गति के पीछे का तर्क भी सिखाता है।
4. "एजेंटिक नेविगेशन सिस्टम": वास्तविक दुनिया का प्रबंधक
एक रोबोट पर स्मार्ट मस्तिष्क लगाना अच्छा है, लेकिन वास्तविक जीवन अव्यवस्थित है। लोग अपना मन बदल लेते हैं, दरवाजे बंद हो जाते हैं, और भीड़ आ जाती है।
इसे संभालने के लिए, उन्होंने एक एजेंटिक सिस्टम (एक "एजेंट" एक स्मार्ट सहायक होता है) बनाया।
- प्लानर (The Planner): यह एक प्रोजेक्ट मैनेजर है। यदि आप कहते हैं, "मेरे लिए एक कोक लाओ," तो प्लानर इसे विभाजित करता है:
- निकटतम स्टोर कहाँ है? (स्मृति का उपयोग करता है)।
- वहाँ चलो। (पॉइंट-गोल)।
- वेंडिंग मशीन ढूँढो। (ऑब्जेक्ट-गोल)।
- जांचें कि क्या इसमें कोक है। (VQA - विजुअल क्वेश्चन अनस्विरिंग)।
- स्मृति (The Memory): रोबोट के पास "टोपो-मेमोरी" (Topo-Memory) है। यह केवल एक स्थिर मानचित्र नहीं है; यह एक जीवित स्मृति है। यदि आज एक गलियारा एक बॉक्स द्वारा अवरुद्ध है, तो रोबोट अगली बार के लिए इसे याद रखेगा। यह मानचित्र को एक नोटबुक की तरह मानता है जिसमें वह लिख सकता है और अपडेट कर सकता है।
- स्व-सुधार (The Self-Correction): यदि रोबोट एक स्नैक रैक से कोक लेने की कोशिश करता है और विफल हो जाता है, तो "सेल्फ-रिफ्लेक्टर" कहता है, "रुको, यह काम नहीं किया। चलिए वेंडिंग मशीन को आजमाते हैं।" यह केवल क्रैश नहीं होता; यह सोचता है, अनुकूलित होता है और फिर से प्रयास करता है।
5. परिणाम: एक रोबोट जो वास्तव में काम करता है
टीम ने वास्तविक दुनिया में एक यूनिट्री गो2 क्वाड्रुपेड रोबोट (एक चार पैरों वाला रोबोट कुत्ता) पर इसका परीक्षण किया।
- परीक्षण: उन्होंने इसे लंबी, जटिल मिशनों पर भेजा, जैसे कि एक घर से चलकर, एक व्यस्त सड़क पार करके, एक मॉल में प्रवेश करके, एक विशिष्ट दुकान को ढूँढकर, और एक विशिष्ट कुर्सी पर बैठकर।
- परिणाम: ABot-N0 ने केवल सफलता ही नहीं प्राप्त की; इसने रिकॉर्ड तोड़ दिए। यह पिछले किसी भी रोबोट की तुलना में अधिक सटीक, सुरक्षित और सामाजिक नियमों (जैसे घास पर न चलना या लोगों से न टकराना) का पालन करने में बेहतर था।
सारांश
ABot-N0 एक बड़ी उपलब्धि है क्योंकि इसने रोबोट नेविगेशन को अलग-अलग पहेलियों के संग्रह के रूप में देखना बंद कर दिया। इसके बजाय, इसने एक विशाल, एकीकृत मस्तिष्क बनाया जो अनुभवों के एक विशाल पुस्तकालय से सीखता है, मनुष्य की तरह तर्क करता है, एक डांसर की तरह चलता है, और एक स्मार्ट सहायक की तरह अनुकूलित होता है। यह उस रोबोट के बीच का अंतर है जो केवल फर्श पर खींची गई रेखा का अनुसरण कर सकता है और उस रोबोट के बीच का अंतर है जो आपका वास्तविक यात्रा साथी बन सकता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।