← नवीनतम पेपर
💻 computer science

AnyWorld: Factorized Egocentric World Models for Cross-Embodiment Generalization

यह शोधपत्र AnyWorld को प्रस्तुत करता है, जो एक फैक्टराइज्ड वर्ल्ड मॉडलिंग फ्रेमवर्क है जो एक्शन, कैमरा और एम्बॉडिमेंट कारकों को अलग करके एकल मानव इगोसेंट्रिक वीडियो से विविध, क्रॉस-एम्बॉडिममेंट रोबोट अनुभवों को संश्लेषित करता है, जिससे नियंत्रित डेटा जनरेशन सक्षम होता है जो सिम्युलेटेड और वास्तविक ह्यूमनॉइड रोबोट दोनों पर मैनिपुलेशन पॉलिसियों में महत्वपूर्ण सुधार करता है।

मूल लेखक: Cheng Chen, Jerry Bai, Jiacheng Wei, Boyu Chen, Xiaoji Zheng, Fan Wu, Minghao Yang, Tianrun Chen, Ruibo Li, Xiaoyu Yue, Xiaoyang Guo, Yixiao Ge, Guosheng Lin, Fayao Liu

प्रकाशित 2026-09-02
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Cheng Chen, Jerry Bai, Jiacheng Wei, Boyu Chen, Xiaoji Zheng, Fan Wu, Minghao Yang, Tianrun Chen, Ruibo Li, Xiaoyu Yue, Xiaoyang Guo, Yixiao Ge, Guosheng Lin, Fayao Liu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

रोबोट अब केवल सीधी रेखाओं में चलने से कहीं अधिक करना सीख रहे हैं; वे अपने आस-पास की दुनिया को नियंत्रित करना, वस्तुओं को उठाना, दरवाजे खोलना और पुर्जों को जोड़ना सीख रहे हैं। इन कौशलों को सीखने के लिए, एक रोबोट को अनुभव की आवश्यकता होती है। उसे हजारों उदाहरण देखने होंगे कि कैसे एक हाथ कप की ओर बढ़ता है, कैसे एक ग्रिपर स्पंज को दबाता है, और कैसे एक उपकरण मेज पर फिसलता है। लंबे समय तक, यह अनुभव प्राप्त करने का एकमात्र तरीका यह था कि एक रोबोट को स्वयं उस कार्य को बार-बार करना पड़े। यह धीमा, महंगा और इस बात से सीमित है कि एक लैब कितने रोबोट बनाने का खर्च उठा सकती है और बिना टूटे उन्हें कितने घंटे चलाया जा सकता है।

एक आशाजनक विकल्प एक अप्रत्याशित स्रोत से उभरा है: मानव वीडियो। हर दिन, लोग खाना बनाते, सफाई करते और चीजें बनाते हुए खुद को रिकॉर्ड करते हैं। ये वीडियो समृद्ध, भौतिक अंतःक्रियाओं से भरे होते हैं जिनसे रोबोट सीख सकते हैं। हालाँकि, एक बड़ी समस्या है। इंसान के खाना बनाने के वीडियो में एक मानव हाथ, एक मानव शरीर और एक मानव दृष्टिकोण दिखाई देता है। एक रोबोट के पास मानव शरीर नहीं होता है, और वह मानव सिर से दुनिया को नहीं देखता है। यदि कोई रोबोट सीधे मानव वीडियो की नकल करने की कोशिश करता है, तो वह विफल हो सकता है क्योंकि इंसान की बांह लंबी है, रोबोट का कैमरा अलग जगह पर है, या रोबोट का ग्रिपर अलग तरह से काम करता है। वैज्ञानिकों के लिए चुनौती यह पता लगाने की है कि मानव वीडियो में जो कुछ भी हो रहा है उसकी उपयोगी "कहानी" को कैसे लिया जाए और उसे इस तरह से दोबारा बताया जाए जो रोबोट के लिए समझ में आए।

शोधकर्ताओं की एक टीम ने इस समस्या को हल करने के लिए 'एनीवर्ल्ड' (AnyWorld) नामक एक नया सिस्टम विकसित किया है। वीडियो को हुबहू कॉपी करने के बजाय, यह सिस्टम वीडियो को तीन अलग-अलग सामग्रियों में तोड़ देता है: की जा रही क्रिया (action), कैमरे की गति, और वह शरीर और दृश्य जो कार्य कर रहे हैं। क्रिया को क्रिया (action) के रूप में, कैमरा मूवमेंट को शॉट के निर्देशन (direction) के रूप में, और शरीर एवं दृश्य को अभिनेताओं और सेट के रूप में समझें। इन तत्वों को अलग करके, शोधकर्ता एक मानव द्वारा कार्य करने के एकल वीडियो को ले सकते हैं और उन सामग्रियों को पुनर्संयोजित करके एक बिल्कुल नया वीडियो बना सकते हैं। इस नए वीडियो में, "अभिनेता" एक रोबोट है, "सेट" रोबोट का वातावरण है, और "कैमरा" रोबोट की आँख है, लेकिन क्रिया का "स्क्रिप्ट" वही रहता है।

शोधकर्ताओं ने अपने सिस्टम को मानव वीडियो के एक विशाल संग्रह का उपयोग करके प्रशिक्षित किया जहाँ लोग वस्तुओं के साथ अंतःक्रिया कर रहे थे। उन्होंने मॉडल को कार्य की गति और उसे करने वाले विशिष्ट शरीर के बीच अंतर समझना सिखाया। एक बार जब मॉडल यह सीख गया, तो उन्होंने इसे एक मानव वीडियो देकर और उससे उसी कार्य को करने वाले रोबोट का संस्करण बनाने के लिए कहकर इसका परीक्षण किया। उन्हें किसी ऐसे वीडियो की आवश्यकता नहीं थी जिसमें मानव और रोबोट एक ही कार्य को साथ-साथ करते हुए दिखाया गया हो। सिस्टम ने बस मानव की गतिविधियों और कैमरे के पथ को लिया, और फिर उसमें एक रोबोट शरीर और एक रोबोट दृश्य को बदल दिया। परिणाम एक ऐसा वीडियो था जो एक रोबोट द्वारा कार्य करने जैसा दिखता था, जिसमें उस विशिष्ट मशीन के सही परिप्रेक्ष्य और भौतिक बाधाओं के साथ पूरा किया गया था।

टीम ने शरीर, कैमरा एंगल और दृश्य को बदलने की इस क्षमता का परीक्षण किया। उन्होंने दिखाया कि सिस्टम एक मानव वीडियो ले सकता है और 'रोबोकासा GR1' (RoboCasa GR1) नामक रोबोट द्वारा किए गए कार्य का एक संस्करण और 'आयरन' (IRON) नामक एक अन्य रोबोट द्वारा किए गए कार्य का एक अन्य संस्करण उत्पन्न कर सकता है। उन्होंने यह भी दिखाया कि वे रोबोट और कार्य को समान रख सकते हैं, लेकिन कैमरा एंगल को बदल सकते हैं, जिससे एक अलग दृष्टिकोण से दृश्य प्राप्त होता है। महत्वपूर्ण रूप से, सिस्टम ने अंतःक्रिया के तर्क को सुरक्षित रखा। यदि मूल वीडियो में एक मानव ने एक कप उठाया और उसे शेल्फ पर रखा, तो जनरेट किए गए रोबट वीडियो में रोबोट वही क्रमबद्ध गतिविधियाँ करता है, बस अपने स्वयं के शरीर के आकार और कैमरा स्थिति के अनुकूल होकर।

यह साबित करने के लिए कि ये जनरेट किए गए वीडियो वास्तव में उपयोगी थे, शोधकर्ताओं ने उन्हें वास्तविक रोबोटों को प्रशिक्षित करने के लिए उपयोग किया। उन्होंने एक मानक रोबोट लर्निंग सिस्टम लिया और उसे एनीवर्ल्ड द्वारा बनाए गए वीडियो का उपयोग करके अतिरिक्त प्रशिक्षण दिया। उन्होंने इसे एक रोबोटिक आर्म के सिमुलेशन पर और एक वास्तविक, भौतिक ह्यूमनाइड रोबोट पर परीक्षण किया। सिमुलेशन में, जनरेट किए गए डेटा पर प्रशिक्षण के बाद रोबोट की सफलता दर में काफी सुधार हुआ। वास्तविक रोबोट पर, सुधार और भी नाटकीय था। एक रोबोट जो केवल 20 प्रतिशत प्रयासों में सफलतापूर्वक केला पकड़ने में सक्षम था, मानव-से-रोबोट वीडियो पर प्रशिक्षित होने के बाद 55 प्रतिशत सफलता दर तक पहुँच गया। इसने दिखाया कि सिस्टम केवल सुंदर चित्र नहीं बना रहा था; यह वैध प्रशिक्षण डेटा बना रहा था जिसने रोबोट को बेहतर ढंग से सीखने में मदद की।

शोधकर्ताओं ने यह भी जांचा कि यह वास्तव में क्यों काम कर रहा था। वे जानना चाहते थे कि क्या केवल रोबोट को यह बताना पर्याप्त है कि क्या क्रिया करनी है, या क्या दृश्य को देखना भी आवश्यक है। उन्होंने एक परीक्षण चलाया जहाँ उन्होंने रोबोट को सही क्रिया कमांड दिए लेकिन मूल, अपरिवर्तित रोबोट वीडियो से विजुअल ट्रेनिंग डेटा को रखा। यह दृष्टिकोण रोबोट को विशिष्ट निर्देशों का पालन करना, जैसे कि दाएं केले के बजाय बाएं केले को चुनना, सिखाने में विफल रहा। हालाँकि, जब उन्होंने पूर्ण प्रणाली का उपयोग करके नया दृश्य और सही क्रिया दोनों को जनरेट किया, तो रोबलेट ने निर्देशों का विश्वसनीय रूप से पालन करना सीख लिया। इससे सिद्ध हुआ कि विजुअल रीकंपोजिशन (दृश्य पुनर्संरचना) आवश्यक था। रोबोट को क्रिया को लागू करने के लिए समझने हेतु अपने स्वयं के परिप्रेक्ष्य से दुनिया को देखने की आवश्यकता थी।

अध्ययन बताता है कि अंतःक्रियाओं को अलग-अलग कारकों में तोड़ने की यह विधि एक एकल मानव अनुभव को कई बार पुन: उपयोग करने की अनुमति देती है। एक मानव वीडियो जो कभी मानव शरीर और मानव कैमरे तक सीमित था, कई अलग-अलग प्रकार के रोबोटों के लिए, कई अलग-अलग वातावरणों में, प्रशिक्षण डेटा का स्रोत बन सकता है। शोधकर्ताओं ने उल्लेख किया कि जबकि सिस्टम शक्तिशाली है, इसकी सीमाएँ भी हैं। यह अभी तक स्पर्श की भावना या किसी नरम वस्तु को दबाने के लिए आवश्यक सटीक बल को कैप्चर नहीं कर सकता है, क्योंकि इनके लिए भौतिक सेंसरों की आवश्यकता होती है जो वीडियो जनरेशन प्रदान नहीं करता है। इसके अतिरिक्त, सिस्टम को मानव गतिविधियों को स्पष्ट रूप से ट्रैक करने की आवश्यकता होती है; यदि वीडियो बहुत अधिक हिल रहा है या व्यक्ति किसी वस्तु के पीछे छिपा हुआ है, तो सिस्टम संघर्ष करता है।

इन सीमाओं के बावजूद, यह कार्य रोबोट लर्निंग के लिए एक नया मार्ग प्रदान करता है। यह सुझाव देता है कि इंटरनेट पर मौजूद मानव वीडियो का विशाल पुस्तकालय, जिसका उपयोग निकायों और दृष्टिकोणों के अंतर के कारण रोबोटों के लिए कठिन रहा है, अब उपयोग किया जा सकता है। क्रिया को अभिनेता से अलग करने के तरीके को समझकर, वैज्ञानिक मानव अनुभवों को रोबोट अनुभवों में बदल सकते हैं, जिसके लिए प्रत्येक कार्य को प्रत्येक रोबोट के साथ रिकॉर्ड करने की आवश्यकता नहीं है। यह रोबोटों को जटिल कौशल बहुत तेज़ी से सीखने की अनुमति दे सकता है, जिससे मानव दैनिक जीवन के प्रचुर डेटा को उनकी अपनी क्षमताओं के आधार के रूप में उपयोग किया जा सके।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →