Open-AoE: An Open Egocentric Manipulation Dataset and Toolchain for Embodied Learning
Open-AoE एक खुला, समुदाय-संचालित डेटासेट और टूलचेन है जो 2,000 घंटों के संरचित हेरफेर (manipulation) डेटा के साथ-साथ विभिन्न रोबोट लर्निंग मॉडल्स को प्रोसेस करने, रिटारगेटिंग करने और प्रशिक्षित करने के लिए एक व्यापक पाइपलाइन प्रदान करके, स्केलेबल स्मार्टफोन-आधारित एर्गोसेंट्रिक (egocentric) वीडियो कैप्चर और एम्बॉडीड एआई (embodied AI) प्रशिक्षण के बीच के अंतर को पाटता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
एक रोबोट को सैंडविच बनाना, टपकते नल को ठीक करना या शर्ट की तह लगाना सिखाने की कल्पना कीजिए। आप उसे केवल पाठ्यपुस्तकों का पुस्तकालय नहीं खिला सकते; उसे यह देखने और महसूस करने की आवश्यकता है कि इंसान ये चीजें कैसे करते हैं। यह एम्बोडीड इंटेलिजेंस (embodied intelligence) की दुनिया है, जहाँ कंप्यूटर भौतिक दुनिया के साथ बातचीत करके सीखते हैं, बिल्कुल वैसे ही जैसे हम करते हैं। लेकिन इसमें एक पेंच है: रोबोट दुनिया को हमारे देखने के तरीके से अलग देखते हैं। यदि आप शेल्फ पर लगे कैमरे से वीडियो रिकॉर्ड करते हैं (एक "थर्ड-पर्सन" दृश्य), तो रोबोट पूरे कमरे को देखता है लेकिन उंगलियों की सूक्ष्म हलचल को मिस कर देता है। यदि आप रोबोट की अपनी आँखों से ("एगोसेंट्रिक" दृश्य) रिकॉर्ड करते हैं, तो उसे सही परिप्रेक्ष्य मिलता है, लेकिन इसे सिखाने के लिए पर्याप्त उच्च-गुणवत्ता वाला डेटा प्राप्त करना अविश्वसनीय रूप से कठिन और महंगा है। आमतौर पर, आपको लोगों के सिर पर बंधे विशेष, महंगे कैमरों की आवश्यकता होती है, या आपको कंप्यूटर को यह बताने के लिए वीडियो के हर एक सेकंड को मैन्युअल रूप से लेबल करना पड़ता है कि क्या हो रहा है। इन "मानव-आंखों" वाले वीडियो के विशाल, आसानी से उपयोग होने वाले पुस्तकालय के बिना, रोबोट दैनिक जीवन की सूक्ष्म बारीकियों को सीखने में संघर्ष करते हैं।
यहीं पर Open-AoE नामक एक नया प्रोजेक्ट कदम रखता है, जो रोबोट को सिखाने के लिए एक विशाल, ओपन-सोर्स टूलकिट के रूप में कार्य करता है। इसके पीछे के शोधकर्ताओं ने महसूस किया कि हर किसी की जेब में पहले से ही एक आदर्श कैमरा मौजूद है: एक स्मार्टफोन। इसलिए, उन्होंने एक ऐसी प्रणाली बनाई जो हजारों साधारण लोगों को डेटा कलेक्टर में बदल देती है। उन्होंने एक ऐप बनाया जो लोगों द्वारा अपने फोन का उपयोग करके रोजमर्रा के काम करने—जैसे कॉफी डालना या कीबोर्ड पर टाइप करना—के वीडियो रिकॉर्ड करता है। लेकिन वे केवल रिकॉर्डिंग तक ही नहीं रुके; उन्होंने क्लाउड में एक विशाल, स्वचालित फैक्ट्री बनाई जो उन कच्चे, अव्यवस्थित वीडियो को लेता है और उन्हें सुपर-संगठित, रोबोट-तैयार पाठों में बदल देता है।
टीम ने इन वीडियो के आश्चर्यजनक 2,000 घंटे एकत्र किए, जिन्हें 500 अलग-अलग लोगों द्वारा 400 से अधिक विभिन्न प्रकार के स्मार्टफोन्स का उपयोग करके एकत्र किया गया था। यह बहुत सारा समय है! वीडियो में 400 से अधिक विभिन्न दृश्य (किचन से लेकर ऑफिस तक) और 8,000+ विभिन्न कार्य शामिल हैं। जो बात इसे खास बनाती है वह केवल इसकी मात्रा नहीं है, बल्कि वह "जादू" है जिसे सिस्टम फुटेज में जोड़ता है। उन्नत AI का उपयोग करके, सिस्टम स्वचालित रूप से यह पता लगाता है कि हाथ ठीक कहाँ हिल रहे हैं (उंगलियों के 21 जोड़ों तक), कैमरा कहाँ घूम रहा है, और वीडियो को क्रिया के छोटे, सार्थक टुकड़ों में तोड़ देता है। यह यहाँ तक कि यह भी लिख देता है कि क्या हो रहा है उसके लिए टेक्स्ट विवरण लिखता है।
इसे इस तरह से सोचें: पहले, यदि आप एक रोबोट को सिखाना चाहते थे, तो आपको एक फिल्म क्रू को काम पर रखना पड़ता था, महंगे उपकरण खरीदने पड़ते थे, और फुटेज को संपादित करने में वर्षों लग जाते थे। Open-AoE ऐसा है जैसे सबको एक स्मार्टफोन थमा देना, कहना "अपना दिन फिल्माओ," और फिर एक जादुई रोबोट संपादक के रूप में उन फिल्मों को तुरंत एक रोबोट के सीखने के लिए एक आदर्श पाठ्यपुस्तक में बदल देना। पेपर यह दिखाता है कि यह दृष्टिकोण काम करता है, जो एक समृद्ध, विविध डेटासेट प्रदान करता है जो रोबोट को न केवल यह समझने में मदद करता है कि क्या करना है, बल्कि यह भी कि उन्हें करने के लिए अपने हाथों और आंखों को कैसे हिलाना है।
शोधकर्ताओं ने उपकरणों का एक सेट (एक "टूलचेन") भी बनाया है जो वैज्ञानिकों को इस डेटा का उपयोग करके शानदार चीजें करने की अनुमति देता है। वे हाथों की 3D गति को देख सकते हैं, मानव गतिविधियों को विभिन्न रोबोट शरीरों में "रिटारगेट" (retarget) कर सकते हैं (जैसे मानव हाथ को रोबोट हाथ में बदलना), और विभिन्न प्रकार के AI मॉडल को प्रशिक्षित कर सकते हैं। उन्होंने पाया कि इस विविध, स्मार्टफोन-आधारित डेटा का उपयोग करके, वे रोबोट के लिए वास्तविक दुनिया से सीखने हेतु एक बहुत मजबूत आधार बना सकते हैं, जिसके लिए लाखों डॉलर के उपकरणों की आवश्यकता नहीं है। यह रोबोट को हमारे दैनिक कार्यों में वास्तव में मदद करने के योग्य बनाने की दिशा में एक बड़ा कदम है, क्योंकि अब उनके पास अध्ययन करने के लिए मानवीय अनुभवों का एक विशाल, खुला पुस्तकालय है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।