RIO: Flexible Real-Time Robot I/O for Cross-Embodiment Robot Learning
यह शोध पत्र RIO को प्रस्तुत करता है, जो एक ओपन-सोर्स पायथन फ्रेमवर्क है जिसे विविध हार्डवेयर प्लेटफॉर्म्स पर नियंत्रण और डेटा हैंडलिंग के लिए लचीले, हल्के घटकों को प्रदान करके खंडित रोबोट इंफ्रास्ट्रक्चर की बाधाओं को दूर करने के लिए डिज़ाइन किया गया है, जिससे अत्याधुनिक विजन-लैंग्वेज-एक्शन मॉडल्स का कुशल क्रॉस-एम्बोडिमेंट प्रशिक्षण और परिनियोजन सक्षम हो सके।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक रोबोट को घर के काम करना सिखाने की कोशिश कर रहे हैं, जैसे कि शर्ट मोड़ना या एक कटोरा रगड़कर साफ करना। रोबोटिक्स की दुनिया में, यह वर्तमान में दुनिया की हर अलग भाषा बोलने के लिए एक बच्चे को सिखाने जैसा है, लेकिन एक पेच के साथ: हर बार जब आप एक अलग रोबोट (एक अलग "शरीर" या "एम्बॉडमेंट") पर स्विच करते हैं, तो आपको उससे बात करना पूरी तरह से फिर से सीखना पड़ता है।
यदि आपके पास एक कंपनी का रोबोट आर्म है और दूसरी कंपनी का कैमरा है, तो उन्हें एक साथ चलाने वाला कोड अक्सर कस्टम निर्देशों का एक उलझा हुआ जाल होता है। यदि आप एक अलग रोबोट आर्म पर स्विच करना चाहते हैं, तो आप केवल उस हिस्से को बदल नहीं सकते; आपको अक्सर रोबोट के पूरे "दिमाग" को शून्य से फिर से लिखना पड़ता है। यह वैज्ञानिकों के बीच प्रगति साझा करने को अविश्वसनीय रूप से कठिन और धीमा बना देता है।
RIO (Robot I/O) से मिलिए।
RIO को एक यूनिवर्सल ट्रांसलेटर और रोबोटों के लिए एक मॉड्यूलर "प्लग-एंड-प्ले" सिस्टम के रूप में समझें। यह एक हल्का सॉफ्टवेयर टूलकिट है जो शोधकर्ताओं को हर बार कोड फिर से लिखे बिना विभिन्न रोबोट भागों को आपस में मिलाने और जोड़ने की अनुमति देता है।
यह कैसे काम करता है, इसके कुछ सरल उदाहरण यहाँ दिए गए हैं:
1. "लेगो" दृष्टिकोण (लचीलापन)
कल्पना कीजिए कि आपके पास लेगो ब्रिक्स का एक डिब्बा है। कुछ रोबोट आर्म हैं, कुछ ग्रिपर्स (हाथ) हैं, कुछ कैमरे हैं, और कुछ टेलीऑपरेशन कंट्रोलर (वे चीजें जिनका उपयोग मनुष्य रोबोट को चलाने के लिए करते हैं) हैं।
- RIO के बिना: आपको ईंटों को बहुत मजबूत, स्थायी गोंद से जोड़ना पड़ता है। यदि आप आर्म बदलना चाहते हैं, तो आपको पूरी चीज़ को तोड़ना होगा और शुरुआत से शुरू करना होगा।
- RIO के साथ: ईंटों में मानक कनेक्टर होते हैं। आप केवल एक कॉन्फ़िगरेशन फ़ाइल बदलकर एक "फ्रंका आर्म" को "रोबोटिक ग्रिपर" या एक "वीआर हेडसेट" को "ह्यूमनॉइड रोबोट" से जोड़ सकते हैं। मुख्य तर्क (वह "दिमाग" जो रोबोट को क्या करना है यह बताता है) बिल्कुल वैसा ही रहता है; केवल "शरीर" बदलता है।
2. "यूनिवर्सल पावर स्ट्रिप" (मिडलवेयर)
रोबोटों को एक-दूसरे से बिजली की गति से बात करने की आवश्यकता होती है। आमतौर पर, विभिन्न भाग अलग-अलग "भाषाएं" (प्रोटोकॉल) बोलते हैं।
- RIO का समाधान: यह एक स्मार्ट पावर स्ट्रिप या यूनिवर्सल अडैप्टर की तरह कार्य करता है। यह रोबोट के हार्डवेयर और सॉफ्टवेयर के बीच स्थित होता है। चाहे आप हाई-स्पीड शेयर्ड मेमोरी कनेक्शन का उपयोग कर रहे हों (जैसे कि एक ही कमरे में सीधे फुसफुसाकर बात करना) या नेटवर्क कनेक्शन का (जैसे इंटरनेट के माध्यम से बात करना), RIO स्वचालित रूप से अनुवाद को संभालता है। इसका मतलब है कि आप रोबोट के कोड को बदले बिना संचार पद्धति को बदल सकते हैं।
3. "टेलीऑपरेशन" रिमोट कंट्रोल
रोबोट को सिखाने के लिए, मनुष्य अक्सर "टेलीऑपरेट" करते हैं—जिसका अर्थ है कि वे एक कंट्रोलर पहनते हैं और अपने हाथों से रोबोट को चलाते हैं।
- RIO इन विविध कंट्रोलर्स का समर्थन करता है: साधारण कीबोर्ड और गेमपैड से लेकर हाई-टेक वीआर हेडसेट (जैसे एप्पल विज़न प्रो) और विशेष रोबिक आर्म्स तक, जो मानव गतिविधियों की नकल करते हैं।
- पेपर दिखाता है कि आप कंट्रोलर और रोबोट बॉडी को बदलकर एक ही सॉफ्टवेयर का उपयोग एक सिंगल रोबोट आर्म, दो हाथों वाले रोबोट, या यहाँ तक कि चलने वाले पूर्ण आकार के ह्यूमनॉइड रोबोट को नियंत्रित करने के लिए कर सकते हैं।
4. "स्मार्ट डिलीवरी ड्राइवर" (पॉलिसी इन्फरेंस)
एक बार जब रोबोट को प्रशिक्षित कर लिया जाता है, तो उसे निर्णय लेने (जैसे "कप उठाना") और चलने की आवश्यकता होती है। इसे "इन्फरेंस" कहा जाता है।
- RIO को तेज़ होने के लिए डिज़ाइन किया गया है। यह "सोचने" (AI मॉडल चलाने) को "करने" (मोटरों को कमांड भेजने) से अलग करता है।
- पेपर RIO की तुलना LeRobot नामक एक अन्य लोकप्रिय सिस्टम से करता है। उन्होंने पाया कि RIO कैमरे से रोबोट के हाथ तक कमांड पहुँचाने में बहुत तेज़ है।
- LeRobot: लगभग 581 मिलीसेकंड लेता है (रोबोट की गति में एक लंबा समय)।
- RIO: केवल 130 मिलीसेकंड लेता है।
- उपमा: यदि LeRobot डाक द्वारा पत्र भेजने जैसा है, तो RIO टेक्स्ट मैसेज भेजने जैसा है। गतिशील कार्यों के लिए, जैसे कि टॉर्टिला पलटना या गेंद फेंकना, यह गति महत्वपूर्ण है क्योंकि इसमें एक सेकंड की भी देरी विफलता का कारण बन सकती है।
उन्होंने वास्तव में क्या किया?
लेखकों ने केवल एक टूल नहीं बनाया; उन्होंने इसे वास्तविक दुनिया में परखा। उन्होंने घरेलू कार्यों (शर्ट मोड़ना, कटोरे रगड़ना, बक्से उठाना) को करने के लिए मनुष्यों द्वारा रोबोट को नियंत्रित करके डेटा एकत्र करने के लिए RIO का उपयोग किया।
- इस डेटा पर उन्नत AI मॉडल (जैसे π0.5 और GR00T) को प्रशिक्षित किया।
- इन प्रशिक्षित मॉडलों को तीन बहुत अलग प्रकार के रोबोटों पर तैनात किया:
- सिंगल-आर्म रोबोट (जैसे एक मानक फैक्ट्री आर्म)।
- बाइमैनुअल रोबोट (दो हाथों वाले रोबोट)।
- ह्यूमनॉइड (रोबोट जो इंसानों की तरह दिखते और चलते हैं)।
उन्होंने सफलतापूर्वक इन रोबोटों को कपड़े फोल्ड करने, वस्तुएं उठाने और यहाँ तक कि चलने के लिए प्रशिक्षित किया, जिससे यह साबित हुआ कि एक ही सॉफ्टवेयर स्टैक पूरी तरह से अलग हार्डवेयर को चला सकता है।
निष्कर्ष
पेपर का तर्क है कि रोबोट लर्निंग में सबसे बड़ी बाधा केवल अधिक डेटा या बेहतर AI मॉडल होना नहीं है; बल्कि इंफ्रास्ट्रक्चर है। वैज्ञानिक वर्तमान में हर नए रोबोट के लिए कस्टम "वायरिंग" बनाने में बहुत अधिक समय बर्बाद कर रहे हैं।
RIO एक मुफ्त, ओपन-सोर्स टूल है जो एक ही बार में "वायरिंग" प्रदान करता है। यह रोबोटिक्स समुदाय को पहिये का पुन: आविष्कार करने के बजाय, रोबोट को अधिक जटिल और उपयोगी चीजें सिखाने पर ध्यान केंद्रित करने की अनुमति देता है, चाहे वह रोबोट कैसा भी दिखता हो।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।