← नवीनतम पेपर
💻 computer science

Open-AoE: An Open Egocentric Manipulation Dataset and Toolchain for Embodied Learning

Open-AoE एक खुला, समुदाय-संचालित डेटासेट और टूलचेन है जो 2,000 घंटों के संरचित हेरफेर (manipulation) डेटा के साथ-साथ विभिन्न रोबोट लर्निंग मॉडल्स को प्रोसेस करने, रिटारगेटिंग करने और प्रशिक्षित करने के लिए एक व्यापक पाइपलाइन प्रदान करके, स्केलेबल स्मार्टफोन-आधारित एर्गोसेंट्रिक (egocentric) वीडियो कैप्चर और एम्बॉडीड एआई (embodied AI) प्रशिक्षण के बीच के अंतर को पाटता है।

मूल लेखक: Zishuo Li, Bowen Yang, Changtao Miao, Kai Zhu, Hao Chen, Qingze Guan, Zhengxing Wu, Wanke Zhan, Yang Sun, Zhiyi Huang, Zitong Shan, Zhenchao Jin, Jiadong Hong, Taowen Wang, Yushi Feng, You Liu, Yibo W
प्रकाशित 2026-07-21
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Zishuo Li, Bowen Yang, Changtao Miao, Kai Zhu, Hao Chen, Qingze Guan, Zhengxing Wu, Wanke Zhan, Yang Sun, Zhiyi Huang, Zitong Shan, Zhenchao Jin, Jiadong Hong, Taowen Wang, Yushi Feng, You Liu, Yibo Wang, Yifan Yang, Zhaowen Zhou, Man Luo, Hao Cheng, Bo Zhang, Jianshu Li, Jiansheng Cai, Guocai Yao, Jize Zhang, Chenhao Lin, Renjing Xu, Lequan Yu, Chao Shen, Chunhua Shen, Zhe Li

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

एक रोबोट को सैंडविच बनाना, टपकते नल को ठीक करना या शर्ट की तह लगाना सिखाने की कल्पना कीजिए। आप उसे केवल पाठ्यपुस्तकों का पुस्तकालय नहीं खिला सकते; उसे यह देखने और महसूस करने की आवश्यकता है कि इंसान ये चीजें कैसे करते हैं। यह एम्बोडीड इंटेलिजेंस (embodied intelligence) की दुनिया है, जहाँ कंप्यूटर भौतिक दुनिया के साथ बातचीत करके सीखते हैं, बिल्कुल वैसे ही जैसे हम करते हैं। लेकिन इसमें एक पेंच है: रोबोट दुनिया को हमारे देखने के तरीके से अलग देखते हैं। यदि आप शेल्फ पर लगे कैमरे से वीडियो रिकॉर्ड करते हैं (एक "थर्ड-पर्सन" दृश्य), तो रोबोट पूरे कमरे को देखता है लेकिन उंगलियों की सूक्ष्म हलचल को मिस कर देता है। यदि आप रोबोट की अपनी आँखों से ("एगोसेंट्रिक" दृश्य) रिकॉर्ड करते हैं, तो उसे सही परिप्रेक्ष्य मिलता है, लेकिन इसे सिखाने के लिए पर्याप्त उच्च-गुणवत्ता वाला डेटा प्राप्त करना अविश्वसनीय रूप से कठिन और महंगा है। आमतौर पर, आपको लोगों के सिर पर बंधे विशेष, महंगे कैमरों की आवश्यकता होती है, या आपको कंप्यूटर को यह बताने के लिए वीडियो के हर एक सेकंड को मैन्युअल रूप से लेबल करना पड़ता है कि क्या हो रहा है। इन "मानव-आंखों" वाले वीडियो के विशाल, आसानी से उपयोग होने वाले पुस्तकालय के बिना, रोबोट दैनिक जीवन की सूक्ष्म बारीकियों को सीखने में संघर्ष करते हैं।

यहीं पर Open-AoE नामक एक नया प्रोजेक्ट कदम रखता है, जो रोबोट को सिखाने के लिए एक विशाल, ओपन-सोर्स टूलकिट के रूप में कार्य करता है। इसके पीछे के शोधकर्ताओं ने महसूस किया कि हर किसी की जेब में पहले से ही एक आदर्श कैमरा मौजूद है: एक स्मार्टफोन। इसलिए, उन्होंने एक ऐसी प्रणाली बनाई जो हजारों साधारण लोगों को डेटा कलेक्टर में बदल देती है। उन्होंने एक ऐप बनाया जो लोगों द्वारा अपने फोन का उपयोग करके रोजमर्रा के काम करने—जैसे कॉफी डालना या कीबोर्ड पर टाइप करना—के वीडियो रिकॉर्ड करता है। लेकिन वे केवल रिकॉर्डिंग तक ही नहीं रुके; उन्होंने क्लाउड में एक विशाल, स्वचालित फैक्ट्री बनाई जो उन कच्चे, अव्यवस्थित वीडियो को लेता है और उन्हें सुपर-संगठित, रोबोट-तैयार पाठों में बदल देता है।

टीम ने इन वीडियो के आश्चर्यजनक 2,000 घंटे एकत्र किए, जिन्हें 500 अलग-अलग लोगों द्वारा 400 से अधिक विभिन्न प्रकार के स्मार्टफोन्स का उपयोग करके एकत्र किया गया था। यह बहुत सारा समय है! वीडियो में 400 से अधिक विभिन्न दृश्य (किचन से लेकर ऑफिस तक) और 8,000+ विभिन्न कार्य शामिल हैं। जो बात इसे खास बनाती है वह केवल इसकी मात्रा नहीं है, बल्कि वह "जादू" है जिसे सिस्टम फुटेज में जोड़ता है। उन्नत AI का उपयोग करके, सिस्टम स्वचालित रूप से यह पता लगाता है कि हाथ ठीक कहाँ हिल रहे हैं (उंगलियों के 21 जोड़ों तक), कैमरा कहाँ घूम रहा है, और वीडियो को क्रिया के छोटे, सार्थक टुकड़ों में तोड़ देता है। यह यहाँ तक कि यह भी लिख देता है कि क्या हो रहा है उसके लिए टेक्स्ट विवरण लिखता है।

इसे इस तरह से सोचें: पहले, यदि आप एक रोबोट को सिखाना चाहते थे, तो आपको एक फिल्म क्रू को काम पर रखना पड़ता था, महंगे उपकरण खरीदने पड़ते थे, और फुटेज को संपादित करने में वर्षों लग जाते थे। Open-AoE ऐसा है जैसे सबको एक स्मार्टफोन थमा देना, कहना "अपना दिन फिल्माओ," और फिर एक जादुई रोबोट संपादक के रूप में उन फिल्मों को तुरंत एक रोबोट के सीखने के लिए एक आदर्श पाठ्यपुस्तक में बदल देना। पेपर यह दिखाता है कि यह दृष्टिकोण काम करता है, जो एक समृद्ध, विविध डेटासेट प्रदान करता है जो रोबोट को न केवल यह समझने में मदद करता है कि क्या करना है, बल्कि यह भी कि उन्हें करने के लिए अपने हाथों और आंखों को कैसे हिलाना है।

शोधकर्ताओं ने उपकरणों का एक सेट (एक "टूलचेन") भी बनाया है जो वैज्ञानिकों को इस डेटा का उपयोग करके शानदार चीजें करने की अनुमति देता है। वे हाथों की 3D गति को देख सकते हैं, मानव गतिविधियों को विभिन्न रोबोट शरीरों में "रिटारगेट" (retarget) कर सकते हैं (जैसे मानव हाथ को रोबोट हाथ में बदलना), और विभिन्न प्रकार के AI मॉडल को प्रशिक्षित कर सकते हैं। उन्होंने पाया कि इस विविध, स्मार्टफोन-आधारित डेटा का उपयोग करके, वे रोबोट के लिए वास्तविक दुनिया से सीखने हेतु एक बहुत मजबूत आधार बना सकते हैं, जिसके लिए लाखों डॉलर के उपकरणों की आवश्यकता नहीं है। यह रोबोट को हमारे दैनिक कार्यों में वास्तव में मदद करने के योग्य बनाने की दिशा में एक बड़ा कदम है, क्योंकि अब उनके पास अध्ययन करने के लिए मानवीय अनुभवों का एक विशाल, खुला पुस्तकालय है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →