← नवीनतम पेपर
💻 computer science

RoboMIND 2.0: A Multimodal, Bimanual Mobile Manipulation Dataset for Generalizable Embodied Intelligence

यह शोध पत्र RoboMIND 2.0 को प्रस्तुत करता है, जो स्पर्श संबंधी डेटा (tactile data) और डिजिटल ट्विन्स से समृद्ध 310K वास्तविक दुनिया के द्विपक्षीय (bimanual) और मोबाइल मैनिपुलेशन प्रक्षेपवक्रों (trajectories) का एक बड़े पैमाने का मल्टीमॉडल डेटासेट है, साथ ही इसमें MIND-2 पदानुक्रमित प्रणाली (hierarchical system) भी शामिल है जो विविध रोबोटिक स्वरूपों (embodiments) में सामान्यीकरण योग्य एम्बोडीड इंटेलिजेंस प्राप्त करने के लिए ऑफलाइन सुदृढीकरण शिक्षण (offline reinforcement learning) का लाभ उठाती है।

मूल लेखक: Chengkai Hou, Kun Wu, Jiaming Liu, Zhengping Che, Di Wu, Fei Liao, Guangrun Li, Jingyang He, Qiuxuan Feng, Zhao Jin, Chenyang Gu, Zhuoyang Liu, Nuowei Han, Xiangju Mi, Yaoxu Lv, Yankai Fu, Gaole Dai
प्रकाशित 2026-03-02
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Chengkai Hou, Kun Wu, Jiaming Liu, Zhengping Che, Di Wu, Fei Liao, Guangrun Li, Jingyang He, Qiuxuan Feng, Zhao Jin, Chenyang Gu, Zhuoyang Liu, Nuowei Han, Xiangju Mi, Yaoxu Lv, Yankai Fu, Gaole Dai, Langzhe Gu, Tao Li, Yuheng Zhang, Yixue Zhang, Xinhua Wang, Shichao Fan, Meng Li, Zhen Zhao, Ning Liu, Zhiyuan Xu, Pei Ren, Junjie Ji, Haonan Liu, Kuan Cheng, Shanghang Zhang, Jian Tang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को एक साथ मास्टर शेफ, हैंडीमैन और ग्रोसरी शॉपर बनना सिखाना चाहते हैं। अतीत में, आपको रोबोट को एक विशिष्ट रेसिपी सिखानी पड़ती, फिर दूसरी, फिर तीसरी, जैसे किसी कुत्ते को बैठना, रुकना और फिर लुढ़कना सिखाना। यह धीमा, महंगा था, और यदि आप रोबोट को कुछ थोड़ा अलग करने के लिए कहते, तो वह भ्रमित हो जाता था।

RoboMIND 2.0 रोबोट लर्निंग के लिए "इंटरनेट" की तरह है। यह वीडियो और डेटा का एक विशाल पुस्तकालय है जो रोबोट को विभिन्न प्रकार के काम करते हुए दिखाता है, ताकि वे खुद देखकर और समझकर सीख सकें।

यहाँ एक ब्रेकडाउन दिया गया है कि यह पेपर क्या विशेष बनाता है, कुछ रोज़मर्रा के उदाहरणों का उपयोग करते हुए:

1. रोबोटों के लिए "जिम" (डेटासेट)

डेटासेट को एक विशाल, हाई-टेक जिम के रूप में सोचें जहाँ रोबोट प्रशिक्षण के लिए जाते हैं।

  • पैमाना (Scale): उन्होंने रोबोटिक गतिविधियों के 3,10,000 घंटे एकत्र किए। यह एक रोबोट को 24/7 से अधिक 35 वर्षों तक काम करते हुए देखने जैसा है।
  • विविधता (Variety): केवल एक प्रकार के रोबोट के बजाय, उन्होंने छह अलग-अलग "शरीर" (एम्बॉडिमेंट्स) का उपयोग किया। कुछ मेज पर मानव भुजाओं की तरह हैं, कुछ पहियों पर हैं (जैसे भुजाओं वाला रूमबा), और कुछ पूर्ण ह्यूमनॉइड हैं। यह एक बास्केटबॉल खिलाड़ी, एक तैराक और एक जिम्नास्ट को एक ही जिम में प्रशिक्षित करने जैसा है ताकि वे किसी भी स्थिति में कैसे हिलना है, यह सीख सकें।
  • "महसूस करने" का कारक (The "Feel" Factor): अधिकांश रोबोट डेटा में केवल आँखें (कैमरे) होती हैं। इस डेटासेट में स्पर्श सेंसर (टैक्टाइल डेटा) शामिल हैं। कल्पना कीजिए कि आप एक कच्चा अंडा उठाने की कोशिश कर रहे हैं। यदि आपके पास केवल आँखें हैं, तो आप शायद उसे बहुत ज़ोर से दबा देंगे। यदि आपके पास "महसूस करने की शक्ति" है, तो आप जानते हैं कि उसे कितनी ज़ोर से दबाना है। यह डेटासेट रोबोट को सिखाता है कि वे जो पकड़े हुए हैं उसे कैसे महसूस करें।

2. "मस्तिष्क" और "हाथ" (MIND-2 सिस्टम)

शोधकर्ताओं ने केवल डेटा एकत्र नहीं किया; उन्होंने एक नया तरीका बनाया जिससे रोबोट इस डेटा का उपयोग कर सकें, जिसे MIND-2 कहा जाता है। उन्होंने रोबोट के दिमाग को दो भागों में विभाजित किया, जैसे एक सीईओ (CEO) और एक कुशल कर्मचारी:

  • धीमी प्रणाली (सीईओ / मस्तिष्क): यह हिस्सा एक प्रोजेक्ट मैनेजर की तरह है। यह एक बड़े, डरावने कार्य (जैसे "पूखी रसोई साफ करें") को देखता है और इसे छोटे, प्रबंधनीय चरणों में तोड़ देता है ("कप उठाएं," "इसे सिंक में रखें," "काउंटर पोंछें")। यह लक्ष्य को समझने के लिए विज़न-लैंग्वेज मॉडल (VLM) का उपयोग करता है।
  • तेज़ प्रणाली (कर्मचारी / हाथ): यह हिस्सा मांसपेशी है। एक बार जब सीईओ कहता है "कप उठाओ," तो तेज़ प्रणाली (एक VLA मॉडल) तुरंत तय करती है कि उंगलियों को कैसे हिलाना है, कितना बल लगाना है, और नमक के डिब्बे को कैसे टकराने से बचना है। यह ठीक क्या करना है, यह जानने के लिए विशाल डेटासेट का उपयोग करती है।

यह क्यों मायने रखता है: पहले, रोबोट एक ही बड़ी छलांग में पूरा काम करने की कोशिश करते थे और अक्सर विफल हो जाते थे। अब, वे पहले योजना बनाते हैं, फिर कार्य करते हैं। यह एक इंसान द्वारा रैंडमली अंदाज़ा लगाकर रूबिक क्यूब हल करने के बजाय, एक ऐसे इंसान के बीच का अंतर है जो रणनीति जानता है और चरण-दर-चरण समाधान करता है।

3. "डिजिटल ट्विन" (सिमुलेशन)

वास्तविक रोबोट डेटा एकत्र करना महंगा और धीमा है। रोबोट टूट जाते हैं, बैटरी खत्म हो जाती है, और इंसान थक जाते हैं।

  • उपमा: एक पायलट के लिए फ्लाइट सिम्युलेटर की कल्पना करें। वे सिम्युलेटर में एक विमान को हज़ार बार क्रैश कर सकते हैं बिना किसी को नुकसान पहुँचाए।
  • नवाचार: RoboMIND 2.0 ने उनके वास्तविक दुनिया के रोबोटों और कमरों की एक सटीक डिजिटल प्रति (डिजिटल ट्विन) बनाई। उन्होंने कंप्यूटर में 20,000 और "नकली" प्रशिक्षण वीडियो उत्पन्न किए।
  • परिणाम: उन्होंने पाया कि वास्तविक प्रशिक्षण को इस "सिम्युलेटेड" प्रशिक्षण के साथ मिलाने से रोबोट वास्तविक दुनिया में और भी बेहतर हो गए। यह एक संगीतकार के लिए घर पर डिजिटल कीबोर्ड पर अभ्यास करने जैसा है, इससे पहले कि वह मंच पर असली पियानो बजाए।

4. "जनरलिस्ट" लक्ष्य

इस पेपर का अंतिम लक्ष्य सामान्यीकरण (Generalization) है।

  • पुराना तरीका: एक विशिष्ट लाल दरवाज़ा खोलने के लिए रोबोट को प्रशिक्षित करें। यदि आप उसे नीला दरवाज़ा देते हैं, तो वह विफल हो जाता है।
  • नया तरीका: क्योंकि RoboMIND 2.0 के पास 1,139 अलग-अलग वस्तुओं और 759 अलग-अलग कार्यों का डेटा है, रोबोट "दरवाज़ा खोलने" की अवधारणा को सीख जाता है। अब, यदि आप उसे नीला दरवाज़ा, भारी दरवाज़ा, या स्लाइडिंग दरवाज़ा देते हैं, तो वह इसे समझ लेता है क्योंकि उसने इतने सारे बदलाव देखे हैं।

सारांश

RoboMIND 2.0 रोबोटों के लिए एक विशाल, उच्च-गुणवत्ता वाली "पाठ्यपुस्तक" है जिसमें शामिल है:

  1. 3,10,000+ घंटों के वास्तविक दुनिया के रोबोट वीडियो।
  2. स्पर्श सेंसर ताकि रोबोट महसूस कर सकें कि वे क्या पकड़ रहे हैं।
  3. छह अलग-अलग रोबोट शरीर ताकि वे किसी भी आकार के अनुकूल होना सीख सकें।
  4. एक दो-भाग वाला मस्तिष्क तंत्र (पहले योजना बनाएं फिर कार्य करें) लंबी, जटिल कार्यों को संभालने के लिए।
  5. एक सटीक सिमुलेशन सुरक्षित और सस्ते में अभ्यास करने के लिए।

रोबोटों को अनुभवों का यह विशाल पुस्तकालय देकर, शोधकर्ता हमें उस दिन के करीब ले जा रहे हैं जब रोबोट एक बिखरे हुए घर में चल सकते हैं, समझ सकते हैं कि क्या करने की आवश्यकता है, और वास्तव में इसे कर सकते हैं बिना किसी इंसान के हर कदम पर उनका हाथ थामे रखे।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →