← नवीनतम पेपर
💬 NLP

MiMo-Embodied: X-Embodied Foundation Model Technical Report

यह शोधपत्र MiMo-Embodied को प्रस्तुत करता है, जो पहला ओपन-सोर्स क्रॉस-एम्बोडेड फाउंडेशन मॉडल है जो मल्टी-स्टेज लर्निंग, क्यूरेटेड डेटा और CoT/RL फाइन-ट्यूनिंग का लाभ उठाकर स्वायत्त ड्राइविंग (autonomous driving) और एम्बोडेड एआई (embodied AI) दोनों में अत्याधुनिक प्रदर्शन प्राप्त करता है ताकि इन दोनों डोमेन के बीच मजबूत सकारात्मक स्थानांतरण (positive transfer) को प्रदर्शित किया जा सके।

मूल लेखक: Xiaoshuai Hao, Lei Zhou, Zhijian Huang, Zhiwen Hou, Yingbo Tang, Lingfeng Zhang, Guang Li, Zheng Lu, Shuhuai Ren, Xianhui Meng, Yuchen Zhang, Jing Wu, Jinghui Lu, Chenxu Dang, Jiayi Guan, Jianhua Wu
प्रकाशित 2026-04-29
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Xiaoshuai Hao, Lei Zhou, Zhijian Huang, Zhiwen Hou, Yingbo Tang, Lingfeng Zhang, Guang Li, Zheng Lu, Shuhuai Ren, Xianhui Meng, Yuchen Zhang, Jing Wu, Jinghui Lu, Chenxu Dang, Jiayi Guan, Jianhua Wu, Zhiyi Hou, Hanbing Li, Shumeng Xia, Mingliang Zhou, Yinan Zheng, Zihao Yue, Shuhao Gu, Hao Tian, Yuannan Shen, Jianwei Cui, Wen Zhang, Shaoqing Xu, Bing Wang, Haiyang Sun, Zeyu Zhu, Yuncheng Jiang, Zibin Guo, Chuhong Gong, Chaofan Zhang, Wenbo Ding, Kun Ma, Guang Chen, Rui Cai, Diyun Xiang, Heng Qu, Fuli Luo, Hangjun Ye, Long Chen

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक कक्षा में दो बहुत अलग छात्र हैं।

  • छात्र A एक रोबोट बटलर (Robot Butler) है। वे एक अस्त-व्यस्त रसोई में नेविगेट करने, यह समझने में कि कप का कौन सा हिस्सा पकड़ा जा सकता है, और बिना सिलवटों के शर्ट को फोल्ड करने की योजना बनाने में माहिर हैं। वे "एम्बोडीड एआई" (Embodied AI - कमरे में वस्तुओं के साथ बातचीत करना) के विशेषज्ञ हैं।
  • छात्र B एक सेल्फ-ड्राइविंग कार है। वे सड़क पर नज़र रखने, यह अनुमान लगाने में माहिर हैं कि क्या कोई पैदल यात्री सड़क पार करने के लिए अचानक कदम रखेगा, और यह तय करने में कि व्यस्त चौराहे पर ब्रेक लगाना है या बाएं मुड़ना है। वे "ऑटोनॉमस ड्राइविंग" (Autonomous Driving) के विशेषज्ञ हैं।

आमतौर पर, इन छात्रों को अलग-अलग पढ़ाया जाता है। रोबोट बटलर को गाड़ी चलाना नहीं आता, और सेल्फ-ड्राइविंग कार को चम्मच उठाना नहीं आता।

प्रवेश होता है MiMo-Embodied में।

यह पेपर एक नए "सुपर स्टूडेंट" को पेश करता है जिसे Xiaomi द्वारा बनाया गया है। यह पहला ओपन-सोर्स मॉडल है जिसने सफलतापूर्वक रोबोट बटलर और सेल्फ-ड्राइविंग कार दोनों के दिमाग को एक ही पैकेज में सफलतापूर्वक मिला दिया है। इसे एक स्विस आर्मी नाइफ (Swiss Army Knife) की तरह समझें जो वाइन की बोतल खोलने के लिए भी उतना ही अच्छा है जितना कि हाईवे पर नेविगेट करने के लिए।

इन्होंने इस सुपर स्टूडेंट को कैसे बनाया?

शोधकर्ताओं ने उन्हें बस आपस में मिला नहीं दिया; उन्होंने एक चार-चरणीय प्रशिक्षण रेसिपी का उपयोग किया ताकि यह सुनिश्चित हो सके कि छात्र बिना भ्रमित हुए सब कुछ सीख ले:

  1. चरण 1: "रूम" क्लास: सबसे पहले, उन्होंने मॉडल को कमरों, वस्तुओं और घर के अंदर कैसे घूमना है, इसके बारे में सब कुछ सिखाया। उन्होंने रोबोट द्वारा चीजें उठाने और 3D स्पेस में चीजों की स्थिति समझने के डेटा का उपयोग किया।
  2. चरण 2: "रोड" क्लास: इसके बाद, उन्होंने उसी छात्र को एक ड्राइविंग सिम्युलेटर में रखा। उन्होंने उन्हें ट्रैफिक लाइट, अन्य कारों और यह अनुमान लगाने के बारे में सिखाया कि आगे चल रहे ट्रक के साथ क्या हो सकता है।
  3. चरण 3: "सोच कर बोलना" (Think Aloud) क्लास: यह असली 'सीक्रेट सॉस' है। केवल उत्तर देने के बजाय, मॉडल को ज़ोर से सोचने (Chain-of-Thought) के लिए सिखाया गया। "बाएं मुड़ें" कहने से पहले, यह कहना सीखता है, "मैं एक लाल बत्ती देख रहा हूँ, इसलिए मुझे रुकना चाहिए। मैं एक कार को मुड़ते हुए देख रहा हूँ, इसलिए मुझे प्रतीक्षा करनी चाहिए।" यह मॉडल को यह समझने में मदद करता है कि वह कोई निर्णय क्यों ले रहा है।
  4. चरण 4: "कोच" क्लास: अंत में, उन्होंने एक सुदृढीकरण शिक्षण (Reinforcement Learning) तकनीक का उपयोग किया (एक कोच की तरह जो अच्छे खेल के लिए अंक देता है और खराब प्रदर्शन के लिए दंड देता है)। इसने मॉडल को अतिरिक्त सटीक बनाने के लिए फाइन-ट्यून किया, यह सुनिश्चित करते हुए कि यह केवल अनुमान न लगाए, बल्कि सबसे सुरक्षित और तार्किक कदम की गणना करे।

यह सुपर स्टूडेंट क्या कर सकता है?

पेपर ने MiMo-Embodied का 29 अलग-अलग चुनौतियों (benchmarks) पर परीक्षण किया और पाया कि यह लगभग उन सभी में सर्वश्रेष्ठ था, जिसने विशेष रोबोटों और विशेष कारों, साथ ही बड़े व्यावसायिक एआई मॉडलों को भी पीछे छोड़ दिया।

"रोबोट बटलर" की दुनिया में (Embodied AI):

  • अफोर्डेंस प्रेडिक्शन (Affordance Prediction): यदि आप इसे कुर्सी की तस्वीर दिखाते हैं, तो यह केवल "कुर्सी" नहीं देखता। यह देखता है "कुछ ऐसा जिस पर बैठा जा सके" और "कुछ ऐसा जिसे हाथ से पकड़ा जा सके।" यह जानता है कि किसी वस्तु को उठाने के लिए उसे कहाँ छूना है।
  • टास्क प्लानिंग (Task Planning): यदि आप कहते हैं, "मुझे भूख लगी है, मेरे लिए कुछ स्नैक्स लाओ," तो यह इसे तोड़ सकता है: रसोई में जाओ -> फ्रिज खोलो -> सेब ढूँढो -> इसे यहाँ लाओ।
  • स्थानिक समझ (Spatial Understanding): यह जानता है कि "खिड़की" दूर है, "मेज" पास है, और "बिल्ली" कुर्सी के नीचे है। यह चीजों से टकराए बिना कमरे में नेविगेट कर सकता है।

"सेल्फ-ड्राइविंग कार" की दुनिया में (Autonomous Driving):

  • पर्यावरण धारणा (Environmental Perception): यह एक अराजक सड़क के दृश्य को देख सकता है और तुरंत एक लाल ट्रैफिक लाइट, फुटपाथ से उतरते हुए एक पैदल यात्री और किनारे पर खड़ी एक ट्रक को पहचान सकता है।
  • स्थिति का अनुमान (Status Prediction): यह अनुमान लगा सकता है कि अन्य ड्राइवर क्या सोच रहे हैं। "वह कार धीमी हो रही है; शायद वह मुड़ना चाहती है।" "वह पैदल यात्री प्रतीक्षा कर रहा है; वह सड़क पार करने वाला है।"
  • ड्राइविंग प्लानिंग (Driving Planning): यह केवल ड्राइव नहीं करता; यह सुरक्षित रूप से ड्राइव करता है। यह एक सहज लेन परिवर्तन या एक सौम्य स्टॉप की योजना बना सकता है, और एक मानव ड्राइवर की तरह अपने तर्क को समझा सकता है।

बड़ी खोज: "क्रॉस-ट्रेनिंग" काम करती है

इस पेपर का सबसे रोमांचक हिस्सा यह खोज है कि एक कौशल को सीखने से दूसरे कौशल में मदद मिलती है।

आमतौर पर, लोगों ने सोचा था कि ड्राइविंग डेटा पर प्रशिक्षित मॉडल यह भूल जाएगा कि कप कैसे उठाया जाता है, और रोबोट के लिए प्रशिक्षित मॉडल ड्राइविंग करना भूल जाएगा। लेकिन MiMo-Embodied ने साबित किया कि ये कौशल वास्तव में एक-दूसरे को मजबूत करते हैं।

  • यह सीखना कि कार कहाँ जाएगी, इसका अनुमान लगाने से मॉडल को यह समझने में मदद मिलती है कि कमरे में वस्तुएं कैसे चलती हैं।
  • यह समझना कि हैंडल को कैसे पकड़ना है, मॉडल को स्टीयरिंग व्हील की भौतिक सीमाओं को समझने में मदद करता है।

निष्कर्ष

MiMo-Embodied एक "फाउंडेशन मॉडल" है जो भौतिक मशीनों के लिए एक सार्वभौमिक मस्तिष्क के रूप में कार्य करता है। चाहे वह मशीन एक रोबोट वैक्यूम हो, एक ह्यूमनॉइड रोबट हो, या एक सेल्फ-ड्राइविंग कार हो, यह एकल मॉडल दुनिया को समझ सकता है, अपनी क्रियाओं की योजना बना सकता है और उन्हें सुरक्षित रूप से निष्पादित कर सकता है।

पेपर का दावा है कि यह एक बड़ा कदम है क्योंकि यह "इनडोर रोबोट्स" और "आउटडोर कारों" के बीच की दीवार को तोड़ता है, यह दिखाते हुए कि एक एकल, एकीकृत एआई पूरी भौतिक दुनिया की जटिलता को संभाल सकता है। उन्होंने इसका कोड और मॉडल भी किसी के भी उपयोग और अध्ययन के लिए उपलब्ध करा दिया है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →