← नवीनतम पेपर
💻 computer science

RIO: Flexible Real-Time Robot I/O for Cross-Embodiment Robot Learning

यह शोध पत्र RIO को प्रस्तुत करता है, जो एक ओपन-सोर्स पायथन फ्रेमवर्क है जिसे विविध हार्डवेयर प्लेटफॉर्म्स पर नियंत्रण और डेटा हैंडलिंग के लिए लचीले, हल्के घटकों को प्रदान करके खंडित रोबोट इंफ्रास्ट्रक्चर की बाधाओं को दूर करने के लिए डिज़ाइन किया गया है, जिससे अत्याधुनिक विजन-लैंग्वेज-एक्शन मॉडल्स का कुशल क्रॉस-एम्बोडिमेंट प्रशिक्षण और परिनियोजन सक्षम हो सके।

मूल लेखक: Pablo Ortega-Kral, Eliot Xing, Arthur Bucker, Vernon Luk, Junseo Kim, Owen Kwon, Angchen Xie, Nikhil Sobanbabu, Yifu Yuan, Megan Lee, Deepam Ameria, Bhaswanth Ayapilla, Jaycie Bussell, Guanya Shi, Jon
प्रकाशित 2026-05-13
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Pablo Ortega-Kral, Eliot Xing, Arthur Bucker, Vernon Luk, Junseo Kim, Owen Kwon, Angchen Xie, Nikhil Sobanbabu, Yifu Yuan, Megan Lee, Deepam Ameria, Bhaswanth Ayapilla, Jaycie Bussell, Guanya Shi, Jonathan Francis, Jean Oh

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को घर के काम करना सिखाने की कोशिश कर रहे हैं, जैसे कि शर्ट मोड़ना या एक कटोरा रगड़कर साफ करना। रोबोटिक्स की दुनिया में, यह वर्तमान में दुनिया की हर अलग भाषा बोलने के लिए एक बच्चे को सिखाने जैसा है, लेकिन एक पेच के साथ: हर बार जब आप एक अलग रोबोट (एक अलग "शरीर" या "एम्बॉडमेंट") पर स्विच करते हैं, तो आपको उससे बात करना पूरी तरह से फिर से सीखना पड़ता है।

यदि आपके पास एक कंपनी का रोबोट आर्म है और दूसरी कंपनी का कैमरा है, तो उन्हें एक साथ चलाने वाला कोड अक्सर कस्टम निर्देशों का एक उलझा हुआ जाल होता है। यदि आप एक अलग रोबोट आर्म पर स्विच करना चाहते हैं, तो आप केवल उस हिस्से को बदल नहीं सकते; आपको अक्सर रोबोट के पूरे "दिमाग" को शून्य से फिर से लिखना पड़ता है। यह वैज्ञानिकों के बीच प्रगति साझा करने को अविश्वसनीय रूप से कठिन और धीमा बना देता है।

RIO (Robot I/O) से मिलिए।

RIO को एक यूनिवर्सल ट्रांसलेटर और रोबोटों के लिए एक मॉड्यूलर "प्लग-एंड-प्ले" सिस्टम के रूप में समझें। यह एक हल्का सॉफ्टवेयर टूलकिट है जो शोधकर्ताओं को हर बार कोड फिर से लिखे बिना विभिन्न रोबोट भागों को आपस में मिलाने और जोड़ने की अनुमति देता है।

यह कैसे काम करता है, इसके कुछ सरल उदाहरण यहाँ दिए गए हैं:

1. "लेगो" दृष्टिकोण (लचीलापन)

कल्पना कीजिए कि आपके पास लेगो ब्रिक्स का एक डिब्बा है। कुछ रोबोट आर्म हैं, कुछ ग्रिपर्स (हाथ) हैं, कुछ कैमरे हैं, और कुछ टेलीऑपरेशन कंट्रोलर (वे चीजें जिनका उपयोग मनुष्य रोबोट को चलाने के लिए करते हैं) हैं।

  • RIO के बिना: आपको ईंटों को बहुत मजबूत, स्थायी गोंद से जोड़ना पड़ता है। यदि आप आर्म बदलना चाहते हैं, तो आपको पूरी चीज़ को तोड़ना होगा और शुरुआत से शुरू करना होगा।
  • RIO के साथ: ईंटों में मानक कनेक्टर होते हैं। आप केवल एक कॉन्फ़िगरेशन फ़ाइल बदलकर एक "फ्रंका आर्म" को "रोबोटिक ग्रिपर" या एक "वीआर हेडसेट" को "ह्यूमनॉइड रोबोट" से जोड़ सकते हैं। मुख्य तर्क (वह "दिमाग" जो रोबोट को क्या करना है यह बताता है) बिल्कुल वैसा ही रहता है; केवल "शरीर" बदलता है।

2. "यूनिवर्सल पावर स्ट्रिप" (मिडलवेयर)

रोबोटों को एक-दूसरे से बिजली की गति से बात करने की आवश्यकता होती है। आमतौर पर, विभिन्न भाग अलग-अलग "भाषाएं" (प्रोटोकॉल) बोलते हैं।

  • RIO का समाधान: यह एक स्मार्ट पावर स्ट्रिप या यूनिवर्सल अडैप्टर की तरह कार्य करता है। यह रोबोट के हार्डवेयर और सॉफ्टवेयर के बीच स्थित होता है। चाहे आप हाई-स्पीड शेयर्ड मेमोरी कनेक्शन का उपयोग कर रहे हों (जैसे कि एक ही कमरे में सीधे फुसफुसाकर बात करना) या नेटवर्क कनेक्शन का (जैसे इंटरनेट के माध्यम से बात करना), RIO स्वचालित रूप से अनुवाद को संभालता है। इसका मतलब है कि आप रोबोट के कोड को बदले बिना संचार पद्धति को बदल सकते हैं।

3. "टेलीऑपरेशन" रिमोट कंट्रोल

रोबोट को सिखाने के लिए, मनुष्य अक्सर "टेलीऑपरेट" करते हैं—जिसका अर्थ है कि वे एक कंट्रोलर पहनते हैं और अपने हाथों से रोबोट को चलाते हैं।

  • RIO इन विविध कंट्रोलर्स का समर्थन करता है: साधारण कीबोर्ड और गेमपैड से लेकर हाई-टेक वीआर हेडसेट (जैसे एप्पल विज़न प्रो) और विशेष रोबिक आर्म्स तक, जो मानव गतिविधियों की नकल करते हैं।
  • पेपर दिखाता है कि आप कंट्रोलर और रोबोट बॉडी को बदलकर एक ही सॉफ्टवेयर का उपयोग एक सिंगल रोबोट आर्म, दो हाथों वाले रोबोट, या यहाँ तक कि चलने वाले पूर्ण आकार के ह्यूमनॉइड रोबोट को नियंत्रित करने के लिए कर सकते हैं।

4. "स्मार्ट डिलीवरी ड्राइवर" (पॉलिसी इन्फरेंस)

एक बार जब रोबोट को प्रशिक्षित कर लिया जाता है, तो उसे निर्णय लेने (जैसे "कप उठाना") और चलने की आवश्यकता होती है। इसे "इन्फरेंस" कहा जाता है।

  • RIO को तेज़ होने के लिए डिज़ाइन किया गया है। यह "सोचने" (AI मॉडल चलाने) को "करने" (मोटरों को कमांड भेजने) से अलग करता है।
  • पेपर RIO की तुलना LeRobot नामक एक अन्य लोकप्रिय सिस्टम से करता है। उन्होंने पाया कि RIO कैमरे से रोबोट के हाथ तक कमांड पहुँचाने में बहुत तेज़ है।
    • LeRobot: लगभग 581 मिलीसेकंड लेता है (रोबोट की गति में एक लंबा समय)।
    • RIO: केवल 130 मिलीसेकंड लेता है।
    • उपमा: यदि LeRobot डाक द्वारा पत्र भेजने जैसा है, तो RIO टेक्स्ट मैसेज भेजने जैसा है। गतिशील कार्यों के लिए, जैसे कि टॉर्टिला पलटना या गेंद फेंकना, यह गति महत्वपूर्ण है क्योंकि इसमें एक सेकंड की भी देरी विफलता का कारण बन सकती है।

उन्होंने वास्तव में क्या किया?

लेखकों ने केवल एक टूल नहीं बनाया; उन्होंने इसे वास्तविक दुनिया में परखा। उन्होंने घरेलू कार्यों (शर्ट मोड़ना, कटोरे रगड़ना, बक्से उठाना) को करने के लिए मनुष्यों द्वारा रोबोट को नियंत्रित करके डेटा एकत्र करने के लिए RIO का उपयोग किया।

  • इस डेटा पर उन्नत AI मॉडल (जैसे π0.5 और GR00T) को प्रशिक्षित किया।
  • इन प्रशिक्षित मॉडलों को तीन बहुत अलग प्रकार के रोबोटों पर तैनात किया:
    1. सिंगल-आर्म रोबोट (जैसे एक मानक फैक्ट्री आर्म)।
    2. बाइमैनुअल रोबोट (दो हाथों वाले रोबोट)।
    3. ह्यूमनॉइड (रोबोट जो इंसानों की तरह दिखते और चलते हैं)।

उन्होंने सफलतापूर्वक इन रोबोटों को कपड़े फोल्ड करने, वस्तुएं उठाने और यहाँ तक कि चलने के लिए प्रशिक्षित किया, जिससे यह साबित हुआ कि एक ही सॉफ्टवेयर स्टैक पूरी तरह से अलग हार्डवेयर को चला सकता है।

निष्कर्ष

पेपर का तर्क है कि रोबोट लर्निंग में सबसे बड़ी बाधा केवल अधिक डेटा या बेहतर AI मॉडल होना नहीं है; बल्कि इंफ्रास्ट्रक्चर है। वैज्ञानिक वर्तमान में हर नए रोबोट के लिए कस्टम "वायरिंग" बनाने में बहुत अधिक समय बर्बाद कर रहे हैं।

RIO एक मुफ्त, ओपन-सोर्स टूल है जो एक ही बार में "वायरिंग" प्रदान करता है। यह रोबोटिक्स समुदाय को पहिये का पुन: आविष्कार करने के बजाय, रोबोट को अधिक जटिल और उपयोगी चीजें सिखाने पर ध्यान केंद्रित करने की अनुमति देता है, चाहे वह रोबोट कैसा भी दिखता हो।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →