← नवीनतम पेपर
💻 computer science

RoboCOIN: An Open-Sourced Bimanual Robotic Data Collection for Integrated Manipulation

यह शोध पत्र RoboCOIN को प्रस्तुत करता है, जो 16 वातावरणों में 15 विविध रोबोटिक प्लेटफॉर्म से एकत्र किए गए 1,80,,000 से अधिक द्विपक्षीय हेरफेर (bimanual manipulation) प्रदर्शनों का एक बड़े पैमाने का, ओपन-सोर्स डेटासेट है, जिसमें मल्टी-एम्बॉडिमेंट हेरफेर अनुसंधान को आगे बढ़ाने के लिए एक पदानुक्रमित क्षमता पिरामिड (hierarchical capability pyramid) और CoRobot प्रोसेसिंग पाइपलाइन शामिल है।

मूल लेखक: Shihan Wu, Xuecheng Liu, Shaoxuan Xie, Pengwei Wang, Xinghang Li, Bowen Yang, Zhe Li, Kai Zhu, Hongyu Wu, Yiheng Liu, Zhaoye Long, Runtian Xu, Yue Wang, Chong Liu, Dihan Wang, Ziqiang Ni, Xiang Yang
प्रकाशित 2026-04-15
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Shihan Wu, Xuecheng Liu, Shaoxuan Xie, Pengwei Wang, Xinghang Li, Bowen Yang, Zhe Li, Kai Zhu, Hongyu Wu, Yiheng Liu, Zhaoye Long, Runtian Xu, Yue Wang, Chong Liu, Dihan Wang, Ziqiang Ni, Xiang Yang, You Liu, Ruoxuan Feng, Lei Zhang, Denghang Huang, Chenghao Jin, Anlan Yin, Xinlong Wang, Zhenguo Sun, Junkai Zhao, Mengfei Du, Mingyu Cao, Xiansheng Chen, Hongyang Cheng, Xiaojie Zhang, Yankai Fu, Ning Chen, Cheng Chi, Sixiang Chen, Huaihai Lyu, Xiaoshuai Hao, Yequan Wang, Bo Lei, Dong Liu, Xi Yang, Yance Jiao, Tengfei Pan, Yunyan Zhang, Songjing Wang, Ziqian Zhang, Xu Liu, Ji Zhang, Caowei Meng, Zhizheng Zhang, Jiyang Gao, Song Wang, Xiaokun Leng, Zhiqiang Xie, Zhenzhen Zhou, Peng Huang, Wu Yang, Yandong Guo, Yichao Zhu, Suibing Zheng, Hao Cheng, Xinmin Ding, Yang Yue, Huanqian Wang, Chi Chen, Jingrui Pang, YuXi Qian, Haoran Geng, Lianli Gao, Haiyuan Li, Bin Fang, Gao Huang, Yaodong Yang, Hao Dong, He Wang, Hang Zhao, Yadong Mu, Di Hu, Hao Zhao, Tiejun Huang, Shanghang Zhang, Yonghua Lin, Zhongyuan Wang, Guocai Yao

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को एक जटिल भोजन बनाना सिखाने की कोशिश कर रहे हैं, जैसे कि तीन-कोर्स वाला डिनर। यदि आप केवल रोबोट को एक हाथ से सब्जियां काटना सिखाते हैं, तो उसे संघर्ष करना पड़ेगा जब उसे एक हाथ से बर्तन पकड़ने और दूसरे हाथ से चलाने की आवश्यकता होगी। यह बाइमैनुअल मैनिपुलेशन (दो हाथों का उपयोग करना) की चुनौती है।

लंबे समय तक, रोबोट ऐसे छात्रों की तरह रहे हैं जिनके पास केवल एक ही पाठ्यपुस्तक है: वे एक विशिष्ट रोबोटिक हाथ पर सीखते हैं, और जब आप उन्हें एक अलग रोबोट के साथ एक नए किचन में रखते हैं, तो वे भ्रमित हो जाते हैं।

RoboCOIN ज्ञान का एक विशाल नया "लाइब्रेरी" (पुस्तकालय) है जिसे इसे ठीक करने के लिए डिज़ाइन किया गया है। यहाँ इस पेपर का एक सरल विवरण दिया गया, रोजमर्रा के उपमाओं (analogies) का उपयोग करते हुए:

1. समस्या: बहुत सारे अलग-अलग "हाथ"

रोबोट की दुनिया को ऐसे सोचें जैसे कि 15 अलग-अलग प्रकार के हाथों वाली दुनिया। कुछ इंसानी हाथों जैसे दिखते हैं, कुछ सिर्फ दो धातु के पंजे हैं, और कुछ आधे मानव रूपी हैं।

  • समस्या: पहले, यदि आपने "पंजों A" वाले रोबोट को शर्ट फोल्ड करना सिखाया, तो वह "पंजों B" को यह नहीं सिखा सकता था। डेटा अच्छी तरह से ट्रांसफर नहीं हो पाता था क्योंकि हार्डवेयर बहुत अलग था।
  • समाधान: शोधकर्ताओं ने RoboCOIN नामक एक डेटासेट बनाया जिसमें 15 अलग-अलग प्रकार के रोबोटों से 1,80,000 प्रदर्शन (demonstrations) शामिल हैं। यह 15 अलग-अलग शेफ (एक इंसान, एक मशीन, पंजों वाला एक रोबोट, आदि) को इकट्ठा करने और उन सभी को एक ही 421 अलग-अलग रेसिपी पकाते हुए रिकॉर्ड करने जैसा है। यह AI को सिखाता है कि "तौलिया मोड़ना" वही अवधारणा है, चाहे आप इसे उंगलियों से करें या धातु के ग्रिपर्स से।

2. गुप्त नुस्खा (The Secret Sauce): "क्षमता पिरामिड" (Capability Pyramid)

अधिकांश रोबोट डेटा केवल एक कच्चा वीडियो फीड होता है: रोबोट का हाथ बाएं गया, फिर दाएं गया, फिर पकड़ा। यह बिना सबटाइटल या स्क्रिप्ट के फिल्म देखने जैसा है। आप देखते हैं कि क्या हुआ, लेकिन आप नहीं जानते कि क्यों हुआ।

RoboCOIN एक Hierarchical Capability Pyramid जोड़ता है, जो फिल्म में डायरेक्टर के कमेंट्री जोड़ने जैसा है। यह हर कार्य को तीन स्तरों में तोड़ देता है:

  • स्तर 1 (बड़ी तस्वीर): "लक्ष्य आड़ू (peach) को टोकरी में रखना है।" (यह रोबोट को कहानी समझने में मदद करता है)।
  • स्तर 2 (अध्याय): "पहले, आड़ू को पकड़ें। दूसरा, इसे उठाएं। तीसरा, इसे टोकरी के ऊपर ले जाएं।" (यह कहानी को दृश्यों में तोड़ता है)।
  • स्तर 3 (फ्रेम): "हाथ को धीरे से नीचे ले जाएं, फिर ग्रिपर को बंद करें।" (यह हर एक सेकंड के लिए सटीक स्क्रिप्ट है)।

रोबोट को तीनों स्तरों पर सिखाकर, यह न केवल यह सीखता है कि कैसे हिलना है, बल्कि यह भी कि कार्य के बारे में कैसे सोचना है।

3. गुणवत्ता नियंत्रण: "ट्रैफिक पुलिस" (RTML)

जब इंसान रोबोट के लिए डेटा रिकॉर्ड करते हैं, तो वे गलतियाँ करते हैं। कभी-कभी वे बहुत तेज़ चलते हैं, कभी-कभी वे वस्तु गिरा देते हैं, या कभी-कभी वे अजीब या झटकेदार तरीके से चलते हैं। यदि आप रोबोट को खराब डेटा के साथ सिखाते हैं, तो रोबोट बुरी आदतें सीख लेता है।

टीम ने RTML (रोबोट ट्रेजेक्टरी मार्कअप लैंग्वेज) नामक एक टूल बनाया है। इसे रोबोटिक गतिविधियों के लिए एक सख्त ट्रैफिक पुलिस या स्पेल-चेकर के रूप में समझें।

  • यह हर रिकॉर्डिंग को स्वचालित रूप से स्कैन करता है।
  • यदि किसी इंसान ने अपना हाथ बहुत तेज़ी से हिलाया (सुरक्षा नियमों का उल्लंघन किया), तो ट्रैफिक पुलिस उसे फ्लैग कर देती है।
  • यदि रोब सहित वस्तु गिरा दी, तो ट्रैफिक पुलिस उसे "निम्न गुणवत्ता" के रूप में चिह्नित करती है।
  • परिणाम: उन्होंने लगभग 35% खराब डेटा को फ़िल्टर कर दिया। इसका मतलब है कि रोबोट "ए-लिस्ट" प्रदर्शनों से सीख रहे हैं, न कि उनकी गलतियों (bloopers) से।

4. "यूनिवर्सल ट्रांसलेटर" (CoRobot)

बेहतरीन डेटा होने के बावजूद, इसका उपयोग करना कठिन है क्योंकि प्रत्येक रोबोट एक अलग "भाषा" बोलता है (अलग सॉफ्टवेयर, अलग कैमरे, अलग मोटर्स)।

  • टीम ने CoRobot बनाया, जो एक यूनिवर्सल ट्रांसलेटर के रूप में कार्य करता है।
  • हर रोबोट के लिए अलग मैनुअल की आवश्यकता के बजाय, आप बस pip install robocoin (एक सरल कंप्यूटर कमांड) टाइप करते हैं, और CoRobot डेटा को अनुवादित करता है ताकि कोई भी रोबोट इसे समझ सके। यह एक यूनिवर्सल रिमोट कंट्रोल होने जैसा है जो दुनिया के हर टीवी ब्रांड पर काम करता है।

5. परिणाम: रोबोट हो रहे हैं स्मार्ट

जब उन्होंने इस नई लाइब्रेरी का परीक्षण उन रोबोटों पर किया जिन्हें उन्होंने पहले कभी नहीं देखा था:

  • सिमुलेशन: जो रोबोट पहले जटिल कार्यों (जैसे ब्लॉक को स्टैक करना या कटोरा पास करना) में विफल रहे थे, उनके सफलता दर में 75% से 200% तक की वृद्धि देखी गई।
  • वास्तविक दुनिया: यहाँ तक कि जब रोशनी बदल गई या वस्तुएं अलग दिखने लगीं, तब भी RoboCOIN पर प्रशिक्षित रोबोट बहुत अधिक मजबूत (robust) थे। वे एक "नए" कटोरे से भ्रमित नहीं हुए; वे कटोरे की अवधारणा को जानते थे।

सारांश उपमा (Summary Analogy)

कल्पमान कीजिए कि आप टेनिस सीखना चाहते हैं।

  • पुराना तरीका: आप क्ले कोर्ट पर एक प्रो खिलाड़ी को देखते हैं। आप घास पर खेलने की कोशिश करते हैं, और आप विफल हो जाते हैं क्योंकि गेंद अलग तरह से उछलती है।
  • RoboCOIN तरीका: आप 15 अलग-अलग प्रोफेशनल्स को देखते हैं (कुछ क्ले पर, कुछ घास पर, कुछ हार्ड कोर्ट पर) जो 400 अलग-अलग तरह के शॉट्स खेलते हैं। साथ ही, आपके पास एक कोच (पिरामिड) है जो यह समझाता है कि वे रैकेट क्यों घुमाते हैं, और एक वीडियो एडिटर (RTML) है जो गलतियों को काट देता है।
  • परिणाम: अब आप किसी भी कोर्ट पर, किसी भी रैकेट के साथ, एक प्रो की तरह खेल सकते हैं।

संक्षेप में: RoboCOIN एक विशाल, उच्च-गुणवत्ता वाली, मल्टी-रोबोट लाइब्रेरी है जो रोबोटों को दो हाथों का एक साथ उपयोग करना, कार्यों को गहराई से समझना और नई स्थितियों के अनुकूल होना सिखाती है, जिससे वे वास्तविक दुनिया में बहुत अधिक सक्षम बन जाते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →