Humanoid Everyday: A Comprehensive Robotic Dataset for Open-World Humanoid Manipulation
यह शोध पत्र "ह्यूमनॉइड एवरीडे" (Humanoid Everyday) को प्रस्तुत करता है, जो कि 260 कार्यों में 10,000 से अधिक मल्टीमॉडल प्रक्षेपवक्रों (multimodal trajectories) वाला एक बड़े पैमाने का, विविध डेटासेट है जिसे ओपन-वर्ल्ड ह्यूमनॉइड मैनिपुलेशन अनुसंधान को आगे बढ़ाने के लिए डिज़ाइन किया गया है, जिसके साथ पॉलिसी लर्निंग विधियों का विश्लेषण और एक मानकीकृत क्लाउड-आधारित मूल्यांकन प्लेटफॉर्म भी दिया गया है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक रोबोट को एक मददगार रूममेट बनना सिखाने की कोशिश कर रहे हैं। आप चाहते हैं कि वह घर में घूमे, एक कप उठाए, तौलिया मोड़े, और यहाँ तक कि आपको एक औज़ार थमा दे। लेकिन अभी, अधिकांश रोबोट ट्रेनिंग डेटा एक ऐसी लाइब्रेरी की तरह है जो केवल एक मेज पर बैठे एक सिंगल रोबोटिक आर्म (हाथ) के हिलने-डुलने के बारे में किताबें भरी हुई है। यह उस हाथ के लिए तो बेहतरीन है, लेकिन यह पूरे रोबोट को चलना, संतुलन बनाना और एक साथ दो हाथों का उपयोग करना नहीं सिखाता।
शोधकर्ताओं ने इस समस्या का एक विशाल नया समाधान पेश किया है। इसे "Humanoid Everyday" कहा जाता है। इसे "रोबोट के दैनिक जीवन का विश्वकोश (Encyclopedia)" समझें।
यहाँ एक सरल विवरण दिया गया है कि शोधकर्ताओं ने क्या बनाया और यह क्यों महत्वपूर्ण है:
1. डेटासेट: एक "रोबोट रियलिटी शो"
शोधकर्ताओं ने वीडियो और सेंसर डेटा का एक विशाल संग्रह बनाया जिसे Humanoid Everyday कहा जाता है।
- कलाकार: उन्होंने दो उन्नत ह्यूमनॉइड रोबोटों (Unitree G1 और H1) का उपयोग किया जो इंसानों की तरह दिखते और चलते हैं, और उनके पास कुशल हाथ हैं जो स्पर्श को महसूस कर सकते हैं।
- कथानक: केवल एक बॉक्स को बिंदु A से बिंदु B तक ले जाने के बजाय, उन्होंने 260 अलग-अलग "दृश्य" या कार्य रिकॉर्ड किए। ये एक डंपलिंग खिलौने उठाने जैसी सरल चीजों से लेकर दरवाजे के हैंडल को पकड़कर चलते हुए चलने या तौलिया मोड़ने जैसे जटिल कार्यों तक विस्तृत हैं।
- विविधता: ये कार्य सात श्रेणियों में आते हैं, जिनमें शामिल हैं:
- बुनियादी घरेलू काम (चीजों को उठाना)।
- कोमल चीजों के साथ काम करना (जैसे कपड़ा या तौलिया)।
- औजारों का उपयोग करना (जैसे इरेज़र)।
- टीम वर्क (इंसान को वस्तु थमाना)।
- चलना और काम करना (कार्य करते समय इधर-उधर घूमना)।
- पैमाना: उन्होंने 10,000 से अधिक वीडियो क्लिप (ट्रैजेक्टरीज) और 3 मिलियन से अधिक फ्रेम का डेटा रिकॉर्ड किया। प्रत्येक क्लिप में वीडियो, डेप्थ (3D दूरी), लेजर स्कैन (LiDAR), और यहाँ तक कि रोबोट के हाथों को क्या "महसूस" होता है (टैक्टाइल डेटा) भी शामिल है।
2. सीक्रेट सॉस: एक "सुपर-फास्ट कैमरा क्रू"
डेटा एकत्र करना कठिन है क्योंकि रोबोट तेजी से चलते हैं, और यदि कैमरा थोड़ा भी लैग (देरी) करता है, तो डेटा बेकार हो जाता है।
- समस्या: आधिकारिक रोबोट सॉफ्टवेयर एक धीमी, सिंगल-लेन सड़क की तरह था जहाँ डेटा ट्रैफिक में फंस जाता था।
- समाधान: टीम ने एक नया "टेलीऑपरेशन" सिस्टम (एक तरीका जिससे इंसान दूर से रोबोट को नियंत्रित कर सके) बनाया। उन्होंने डेटा संग्रह को एक हाई-स्पीड रिले रेस की तरह माना। एक व्यक्ति द्वारा सब कुछ करने के बजाय, उन्होंने काम को अलग-अलग "प्रोसेस" (जैसे अलग-अलग धावक) में विभाजित किया जो एक साथ चलते हैं।
- परिणाम: उन्होंने देरी (लैग) को 500 मिलीसेकंड से घटाकर केवल 2 मिलीसेकंड कर दिया। यह एक घोंघे की गति से स्प्रिंट (तेज दौड़) तक जाने जैसा है, जिससे सहज, उच्च-गुणवत्ता वाली गतिविधियाँ कैप्चर करना संभव हुआ जो वास्तव में एक इंसान के करने जैसी लगती हैं।
3. क्लाउड "टेस्ट ट्रैक"
रोबोट अनुसंधान में सबसे बड़े सिरदर्द में से एक यह है कि हर वैज्ञानिक के पास $100,000 का ह्यूमनॉइड रोबोट नहीं होता।
- नवाचार: टीम ने एक क्लाउड-आधारित मूल्यांकन प्लेटफॉर्म बनाया।
- यह कैसे काम करता है: कल्पना कीजिए कि एक रिमोट कंट्रोल ट्रैक है। दुनिया भर के शोधकर्ता अपना रोबोट "दिमाग" (AI पॉलिसी) क्लाउड पर अपलोड कर सकते हैं। क्लाउड फिर रोबोट की आँखें (कैमरा फीड) शोधकर्ता के कंप्यूटर तक भेजता है। शोधकर्ता का कंप्यूटर तय करता है कि क्या करना है और कमांड वापस लैब में मौजूद भौतिक रोबोट को भेज देता है।
- लाभ: यह एक समान अवसर (fair playing field) बनाता है। हर कोई अपने रोबोट को बिल्कुल एक ही वास्तविक दुनिया के कार्यों पर, बिल्कुल एक ही कमरे में, और बिल्कुल एक ही रोबोट के साथ टेस्ट कर सकता है। अब यह अनुमान लगाने की जरूरत नहीं है कि आपका रोबोट बेहतर है क्योंकि उसके पास अलग कैमरा या अलग मेज है।
4. वास्तविकता की जाँच: रोबोट क्या (और क्या नहीं) कर सकते हैं
शोधकर्ताओं ने केवल डेटा एकत्र नहीं किया; उन्होंने इसका परीक्षण भी किया। उन्होंने कई प्रसिद्ध AI मॉडल (जो वर्तमान में रोबोटिक्स में उपयोग किए जाने वाले "दिमाग" हैं) को लिया और उन्हें ये नए कार्य सिखाने की कोशिश की।
- अच्छी खबर: मॉडल कुछ चीजों में बेहतर हो गए, खासकर जब उन्होंने पहले से ही बहुत सारा समान डेटा देखा हो (प्री-ट्रेनिंग)। सबसे अच्छा प्रदर्शन करने वाला मॉडल GR00T N1.5 था, जो लगभग 51% परीक्षणों में सफल रहा।
- बुरी खबर: रोबोट अभी भी सबसे कठिन चीजों के लिए संघर्ष करते हैं।
- "फूलदान में गुलाब" की समस्या: एक कार्य में जहाँ रोबोट को एक पतले गुलाब के डंठल को छोटे फूलदान के छेद में डालने के लिए चलना था, लगभग सभी मॉडल विफल रहे (0% सफलता दर)।
- क्यों? रोबोट बड़े आंदोलनों में अच्छे हैं लेकिन नाजुक कार्यों के लिए आवश्यक सूक्ष्म, सटीक समायोजन (precise adjustments) में बहुत खराब हैं। वे भी भ्रमित हो जाते हैं जब उन्हें एक साथ चलने और अपने हाथों को चलाने के लिए कहा जाता है।
सारांश
Humanoid Everyday एक रोबोट के दैनिक जीवन का एक विशाल, उच्च-गुणवत्ता वाला पुस्तकालय है, जिसे एक सुपर-फास्ट सिस्टम के माध्यम से एकत्र किया गया है जो हर विवरण को कैप्चर करता है। इसके साथ एक "क्लाउड टेस्ट ट्रैक" भी आता है ताकि कोई भी अपने रोबोट दिमाग को वास्तविक हार्डवेयर पर टेस्ट कर सके।
यह पेपर दिखाता है कि हालांकि हम प्रगति कर रहे हैं, वर्तमान रोबोट "दिमाग" अभी भी चलने सीखने वाले बच्चों की तरह हैं: वे सरल चीजें कर सकते हैं, लेकिन जब उन्हें एक साथ चलने और सूक्ष्म मोटर कौशल (जैसे सुई में धागा पिरोना) दिखाने के लिए कहा जाता है, तो वे लड़खड़ा जाते हैं। यह डेटासेट उन्हें बड़ा होने में मदद करने के लिए आवश्यक प्रशिक्षण मैदान है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।