← नवीनतम पेपर
🤖 AI

ABot-N0: Technical Report on the VLA Foundation Model for Versatile Embodied Navigation

यह शोध पत्र ABot-N0 को प्रस्तुत करता है, जो एक पदानुक्रमित "ब्रेन-एक्शन" (मस्तिष्क-क्रिया) आर्किटेक्चर वाला एक एकीकृत विजन-लैंग्वेज-एक्शन फाउंडेशन मॉडल है और जिसे 16.9 मिलियन प्रक्षेप पथों (ट्रैजेक्टरीज) के विशाल डेटासेट पर प्रशिक्षित किया गया है, जो पांच विविध एम्बोडीड नेविगेशन कार्यों में अत्याधुनिक प्रदर्शन प्राप्त करता है और गतिशील वास्तविक दुनिया के वातावरण में मजबूत लॉन्ग-होरिजन मिशनों को सक्षम बनाता है।

मूल लेखक: Zedong Chu, Shichao Xie, Xiaolong Wu, Yanfen Shen, Minghua Luo, Zhengbo Wang, Fei Liu, Xiaoxu Leng, Junjun Hu, Mingyang Yin, Jia Lu, Yingnan Guo, Kai Yang, Jiawei Han, Xu Chen, Yanqing Zhu, Yuxiang Zh
प्रकाशित 2026-02-13
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Zedong Chu, Shichao Xie, Xiaolong Wu, Yanfen Shen, Minghua Luo, Zhengbo Wang, Fei Liu, Xiaoxu Leng, Junjun Hu, Mingyang Yin, Jia Lu, Yingnan Guo, Kai Yang, Jiawei Han, Xu Chen, Yanqing Zhu, Yuxiang Zhao, Xin Liu, Yirong Yang, Ye He, Jiahang Wang, Yang Cai, Tianlin Zhang, Li Gao, Liu Liu, Mingchao Sun, Fan Jiang, Chiyu Wang, Zhicheng Liu, Hongyu Pan, Honglin Han, Zhining Gu, Kuan Yang, Jianfang Zhang, Di Jing, Zihao Guan, Wei Guo, Guoqing Liu, Di Yang, Xiangpo Yang, Menglin Yang, Hongguang Xing, Weiguo Li, Mu Xu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को एक आदर्श मानव साथी बनना सिखाने की कोशिश कर रहे हैं। अतीत में, रोबोटिक्स शोधकर्ताओं ने "विशेषज्ञ" (specialists) बनाए थे: एक रोबोट जो केवल एक विशिष्ट निर्देशांक (coordinate) तक चल सकता था, दूसरा जो केवल एक लाल कप ढूंढ सकता था, और तीसरा जो केवल एक व्यक्ति का पीछा कर सकता था। यदि आप चाहते कि रोबोट ये तीनों काम करे, तो आपको उसका मस्तिष्क बदलना पड़ता या एक साथ तीन अलग-अलग प्रोग्राम चलाने पड़ते। यह एक ऐसी कार की तरह था जो केवल हाईवे पर चल सकती है, एक अलग कार जो ऑफ-रोडिंग के लिए है, और तीसरी जो केवल पार्किंग के लिए है।

ABot-N0 अलीबाबा का इस समस्या का समाधान है। इसे रोबोटिक ब्रेन्स का "स्विस आर्मी नाइफ" समझें। यह एक एकल, एकीकृत मॉडल है जो घूमने-फिरने से संबंधित सब कुछ कर सकता है, चाहे वह किसी विशिष्ट कॉफी शॉप को खोजना हो या भीड़भाड़ वाले पार्क में एक दोस्त का पीछा करना हो, और वह भी जटिल मानवीय भाषा को समझते हुए।

यहाँ बताया गया है कि यह कैसे काम करता है, सरल उपमाओं का उपयोग करते हुए:

1. "ग्रैंड यूनिफिकेशन": एक मस्तिष्क, पाँच महाशक्तियाँ

पाँच अलग-अलग रोबोटों के बजाय, ABot-N0 एक ही रोबोट है जो पाँच मुख्य कौशलों में महारत रखता है:

  • पॉइंट-गोल (Point-Goal): "उन GPS निर्देशांकों पर जाओ।" (एक टैक्सी ड्राइवर की तरह जो मानचित्र का पालन करता है)।
  • ऑब्जेक्ट-गोल (Object-Goal): "एक कुर्सी ढूँढो।" (एक जासूस की तरह जो कमरे की तलाशी लेता है)।
  • इंस्ट्रक्शन-फॉलोइंग (Instruction-Following): "किचन में जाओ, बाएं मुड़ो, और फ्रिज के पास रुक जाओ।" (एक रेसिपी का पालन करने की तरह)।
  • POI-गोल (POI-Goal): "स्टारबक्स के प्रवेश द्वार पर जाओ।" (किसी विशिष्ट इमारत के सामने के दरवाजे को खोजने की तरह)।
  • पर्सन-फॉलोइंग (Person-Following): "उस व्यक्ति का पीछा करो जिसने लाल जैकेट पहनी है।" (एक वफादार कुत्ते की तरह जो टहलने पर चलता है)।

2. आर्किटेक्चर: "मस्तिष्क" और "एक्शन एक्सपर्ट"

यह पेपर एक "ब्रेन-एक्शन" आर्किटेक्चर का वर्णन करता है। एक मानव पायलट की कल्पना करें जो विमान उड़ा रहा है:

  • संज्ञानात्मक मस्तिष्क (द पायलट): यह एक बड़ा लैंग्वेज मॉडल (जैसे एक सुपर-स्मार्ट AI चैटबॉट) है। यह देखता है कि रोबोट क्या देख रहा है, इंसान के निर्देशों को पढ़ता है, और यह समझता है कि क्या किया जाना चाहिए। यह तर्क देता है: "व्यक्ति तेज़ चल रहा है, इसलिए मुझे गति बढ़ानी होगी," या "वह एक कॉफी शॉप जैसा दिखता है, लेकिन दरवाजा बंद है, इसलिए मुझे प्रतीक्षा करनी चाहिए।"
  • एक्शन एक्सपर्ट (को-पायलट/इंजन): यह हिस्सा सोचता नहीं है; यह चलता है। यह पायलट की योजना को लेता है और उसे सुचारू, सटीक शारीरिक गतिविधियों में अनुवादित करता है। यह फ्लो मैचिंग (Flow Matching) नामक तकनीक का उपयोग करता है, जो एक मास्टर डांसर की तरह है जो हजारों वीडियो से सीखता है। केवल एक रास्ता अनुमान लगाने के बजाय, यह समझता है कि कुर्सी के चारों ओर जाने के कई तरीके (बाएं, दाएं, या बीच से निकलना) हैं और सबसे सुचारू रास्ता चुनता है।

3. डेटा इंजन: रोबोट के लिए "जिम"

इतना स्मार्ट बनने के लिए, रोबोट ने केवल कुछ घंटों के अभ्यास से नहीं सीखा। शोधकर्ताओं ने एक विशाल डेटा इंजन बनाया।

  • दृश्य (The Scenes): उन्होंने 7,802 अलग-अलग 3D वातावरणों के साथ एक आभासी दुनिया बनाई। एक लाइब्रेरी की कल्पना करें जिसमें आपके द्वारा सोचे गए हर प्रकार के घर, ऑफिस, मॉल, पार्क और शहर के चौराहे हाई-डेफिनिशन में डिजिटल रूप में मौजूद हैं।
  • प्रशिक्षण (The Training): उन्होंने रोबोट को 16.9 मिलियन विशेषज्ञ प्रक्षेप पथ (expert trajectories) खिलाए। यह रोबोट को इन जगहों से पूरी तरह से चलने वाले मनुष्यों के लाखों घंटों के वीडियो दिखाने जैसा है।
  • तर्क (The Reasoning): उन्होंने इसे 5 मिलियन "सोचने वाले" नमूने (thinking samples) भी दिए। यह एक शिक्षक की तरह है जो रोबोट के पास बैठकर उसे समझा रहा है कि उन्होंने एक निश्चित मोड़ क्यों लिया। "मैंने यहाँ बाएँ मुड़ा क्योंकि दायां रास्ता निर्माण कार्य द्वारा अवरुद्ध था।" यह रोबटेज को केवल गति नहीं, बल्कि गति के पीछे का तर्क भी सिखाता है।

4. "एजेंटिक नेविगेशन सिस्टम": वास्तविक दुनिया का प्रबंधक

एक रोबोट पर स्मार्ट मस्तिष्क लगाना अच्छा है, लेकिन वास्तविक जीवन अव्यवस्थित है। लोग अपना मन बदल लेते हैं, दरवाजे बंद हो जाते हैं, और भीड़ आ जाती है।
इसे संभालने के लिए, उन्होंने एक एजेंटिक सिस्टम (एक "एजेंट" एक स्मार्ट सहायक होता है) बनाया।

  • प्लानर (The Planner): यह एक प्रोजेक्ट मैनेजर है। यदि आप कहते हैं, "मेरे लिए एक कोक लाओ," तो प्लानर इसे विभाजित करता है:
    1. निकटतम स्टोर कहाँ है? (स्मृति का उपयोग करता है)।
    2. वहाँ चलो। (पॉइंट-गोल)।
    3. वेंडिंग मशीन ढूँढो। (ऑब्जेक्ट-गोल)।
    4. जांचें कि क्या इसमें कोक है। (VQA - विजुअल क्वेश्चन अनस्विरिंग)।
  • स्मृति (The Memory): रोबोट के पास "टोपो-मेमोरी" (Topo-Memory) है। यह केवल एक स्थिर मानचित्र नहीं है; यह एक जीवित स्मृति है। यदि आज एक गलियारा एक बॉक्स द्वारा अवरुद्ध है, तो रोबोट अगली बार के लिए इसे याद रखेगा। यह मानचित्र को एक नोटबुक की तरह मानता है जिसमें वह लिख सकता है और अपडेट कर सकता है।
  • स्व-सुधार (The Self-Correction): यदि रोबोट एक स्नैक रैक से कोक लेने की कोशिश करता है और विफल हो जाता है, तो "सेल्फ-रिफ्लेक्टर" कहता है, "रुको, यह काम नहीं किया। चलिए वेंडिंग मशीन को आजमाते हैं।" यह केवल क्रैश नहीं होता; यह सोचता है, अनुकूलित होता है और फिर से प्रयास करता है।

5. परिणाम: एक रोबोट जो वास्तव में काम करता है

टीम ने वास्तविक दुनिया में एक यूनिट्री गो2 क्वाड्रुपेड रोबोट (एक चार पैरों वाला रोबोट कुत्ता) पर इसका परीक्षण किया।

  • परीक्षण: उन्होंने इसे लंबी, जटिल मिशनों पर भेजा, जैसे कि एक घर से चलकर, एक व्यस्त सड़क पार करके, एक मॉल में प्रवेश करके, एक विशिष्ट दुकान को ढूँढकर, और एक विशिष्ट कुर्सी पर बैठकर।
  • परिणाम: ABot-N0 ने केवल सफलता ही नहीं प्राप्त की; इसने रिकॉर्ड तोड़ दिए। यह पिछले किसी भी रोबोट की तुलना में अधिक सटीक, सुरक्षित और सामाजिक नियमों (जैसे घास पर न चलना या लोगों से न टकराना) का पालन करने में बेहतर था।

सारांश

ABot-N0 एक बड़ी उपलब्धि है क्योंकि इसने रोबोट नेविगेशन को अलग-अलग पहेलियों के संग्रह के रूप में देखना बंद कर दिया। इसके बजाय, इसने एक विशाल, एकीकृत मस्तिष्क बनाया जो अनुभवों के एक विशाल पुस्तकालय से सीखता है, मनुष्य की तरह तर्क करता है, एक डांसर की तरह चलता है, और एक स्मार्ट सहायक की तरह अनुकूलित होता है। यह उस रोबोट के बीच का अंतर है जो केवल फर्श पर खींची गई रेखा का अनुसरण कर सकता है और उस रोबोट के बीच का अंतर है जो आपका वास्तविक यात्रा साथी बन सकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →