World Action Models are Zero-shot Policies
यह शोधपत्र DreamZero को प्रस्तुत करता है, जो एक वर्ल्ड एक्शन मॉडल (World Action Model) है जो भविष्य की अवस्थाओं और क्रियाओं की भविष्यवाणी करने के लिए एक प्रीट्रेंड वीडियो डिफ्यूजन बैकबोन का लाभ उठाता है, जिससे वास्तविक समय में क्लोज्ड-लूप नियंत्रण, विजन-लैंग्वेज-एक्शन मॉडल्स की तुलना में अनदेखे कार्यों और वातावरणों के प्रति बेहतर सामान्यीकरण, और न्यूनतम डेटा के साथ प्रभावी क्रॉस-एम्बॉडिमेंट ट्रांसफर सक्षम होता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक रोबोट को घर के काम करना सिखाने की कोशिश कर रहे हैं।
पुराना तरीका (VLA मॉडल):
वर्तमान रोबोट दिमागों (जिन्हें विजन-लैंग्वेज-एक्शन मॉडल कहा जाता है) को एक बहुत ही बुद्धिमान लाइब्रेरियन की तरह समझें जिसने अब तक लिखे गए हर निर्देश मैनुअल को पढ़ा है। यदि आप कहते हैं, "लाल कप को नीली मेज पर ले जाओ," तो लाइब्रेरियन जानता है कि उन शब्दों का क्या अर्थ है। वह कप और मेज को ढूंढ सकता है।
लेकिन समस्या यह है: लाइब्रेरियन ने वास्तव में पहले कभी कप को हिलाया नहीं है। उन्होंने केवल हिलने के लिए शब्दों को जाना है। यदि आप उनसे "जूते के फीते को खोलें" या "एक शर्ट को एक विशिष्ट तरीके से मोड़ें" जैसा कुछ करने को कहते हैं, तो वे ठिठक जाते हैं। वे जानते हैं कि जूता क्या है, लेकिन उनके पास इस बात की कोई 'मानसिक फिल्म' नहीं है कि जब आप फीतों को खींचते हैं तो वे कैसे चलते हैं। वे भाषा समझने में बेहतरीन हैं, लेकिन भौतिकी (physics) और गति (motion) को समझने में बहुत खराब हैं।
नया तरीका (DreamZero / "वर्ल्ड एक्शन मॉडल"):
NVIDIA के शोधकर्ताओं ने एक नया प्रकार का रोबोट दिमाग बनाया है जिसे DreamZero कहा जाता है। केवल एक लाइब्रेरियन होने के बजाय, DreamZero एक हॉलीवुड डायरेक्टर की तरह है जो एक स्टंट डबल भी है।
यह कैसे काम करता है, इस सरल उपमा का उपयोग करते हुए:
1. "मानसिक फिल्म" वाली ट्रिक (The "Mental Movie" Trick)
जब आप DreamZero को बताते हैं, "संतरे को कद्दू में डाल दो," तो वह केवल संतरे और कद्दू को नहीं ढूंढता। वह पहले भविष्य की एक छोटी फिल्म की कल्पना करता है।
वह खुद से कहता है: "ठीक है, मैं संतरा देख रहा हूँ। मैं कद्दू देख रहा हूँ। अब, मुझे अपने दिमाग में एक छोटी फिल्म चलानी चाहिए जिसमें मेरा हाथ संतरे को पकड़ता है, उसे उठाता है, और उसे कद्दू में डाल देता है।"
एक बार जब उसने अपने दिमाग में इस भविष्य की "फिल्म" को बना लिया, तो वह उस वीडियो को देखता है और कहता है, "ठीक है, इस फिल्म को सच करने के लिए, मेरे हाथ को इस तरह से हिलना होगा।"
यही जादू है। भविष्य के वीडियो को देखकर (कि दुनिया अगली चीज़ क्या होगी) यह अनुमान लगाने से, रोबोट स्वचालित रूप से सीख जाता है कि उस वीडियो को हकीकत बनाने के लिए उसे कैसे हिलना है। वह दुनिया को विकसित होते हुए देखकर भौतिकी (physics) सीखता है, ठीक वैसे ही जैसे हम सीखते हैं कि चीजें कैसे गिरती हैं या लुढ़कती हैं।
2. "अराजकता" से सीखना, न कि "दोहराव" से (Learning from "Chaos" instead of "Repetition")
पारंपरिक रोबोट उन छात्रों की तरह होते हैं जो केवल एक ही गणित के सवाल को 1,000 बार करके सीखते हैं। यदि आप नंबरों को थोड़ा सा भी बदल दें, तो वे भ्रमित हो जाते हैं।
DreamZero अलग है। इसे 500 घंटों के अराजक (chaotic), वास्तविक दुनिया के वीडियो पर प्रशिक्षित किया गया था। इसने रसोई, कार्यालयों और दुकानों में रोबोटों (और मनुष्यों) को हजारों अलग-अलग, अव्यवस्थित, गैर-दोहराव वाले कार्य करते हुए देखा।
- उपमा: कल्पना कीजिए कि ड्राइविंग सीखना।
- पुराना रोबोट: एक बंद ट्रैक पर ठीक एक ही रास्ते पर 1,000 बार गाड़ी चलाता है। यदि आप एक नया कोन (cone) रख देते हैं, तो वह टकरा जाता है।
- DreamZero: वह व्यस्त शहर के बीच से गाड़ी चलाता है, ट्रैफिक, बारिश, पैदल चलने वालों और अजीब सड़क संकेतों का सामना करता है। वह केवल एक रूट को रटने के बजाय सड़क के नियमों (भौतिकी) को सीखता है।
क्योंकि इसने इस "अराजकता" से सीखा है, यह एक ऐसे नए कमरे में जा सकता है जिसे इसने पहले कभी नहीं देखा, और फिर भी किसी अजीब वस्तु को उठाने का तरीका ढूंढ सकता है।
3. "जादुई दर्पण" (क्रॉस-एम्बॉडमेंट / The "Magic Mirror")
DreamZero की सबसे शानदार चीजों में से एक यह है कि यह दूसरों को देखते हुए सीख सकता है, भले ही वे दिखने में पूरी तरह से अलग हों।
- परिदृश्य: आपके पास दो हाथों वाला एक रोबोट (AgiBot) है। आप चाहते हैं कि वह एक नया करतब सीखे।
- पुराना तरीका: आपको एक इंसान की आवश्यकता होती है जो रोबंड के हाथों को पकड़कर घंटों तक उसे शारीरिक रूप से गति के माध्यम से निर्देशित करे।
- DreamZero का तरीका: आपको बस एक मानव द्वारा कार्य करने का 12 मिनट का वीडियो दिखाना है।
- उपमा: यह एक जिम्नास्ट द्वारा बैकफ्लिप करने के वीडियो को देखने जैसा है। भले ही आपके पास पैर हैं और जिम्नास्ट के पास एक अलग शरीर है, आप फ्लिप की भौतिकी को समझ सकते हैं। DreamZero उस वीडियो को देखता है, बैकफ्लिप की "फिल्म" को समझता है, और फिर यह पता लगाता है कि उसका अपना शरीर इसे कैसे कर सकता है।
- पेपर दिखाता है कि केवल 30 मिनट के "खेल" (play) डेटा के साथ, DreamZero पूरी तरह से अलग रोबोट बॉडी में स्विच कर सकता है और फिर भी पूरी तरह से काम कर सकता है।
4. गति की समस्या (द "फ्लैश" अपग्रेड / The "Speed Problem")
एक बड़ी समस्या थी: DreamZero एक 14-बिलियन-पैरामीटर वाला मॉडल है जो वीडियो जेनरेट करता है। आमतौर पर, वीडियो जेनरेट करना धीमा होता है (जैसे एक फिल्म रेंडर करना)। रोबोटों को तेजी से हिलने की आवश्यकता होती है (7 बार प्रति सेकंड)।
टीम ने DreamZero-Flash नामक एक "टर्बो मोड" बनाया है।
- उपमा: कल्पना कीजिए कि आप एक पेंटिंग बना रहे हैं। आमतौर पर, आप पहले पूरा दृश्य, फिर पूरा आकाश, फिर पूरी जमीन पेंट करते हैं। इसमें बहुत समय लगता है।
- समाधान: DreamZero-Flash यह समझ जाता है कि रोबोट की गति के लिए, उसे भविष्य की एकदम हाई-डेफिनिशन फिल्म की आवश्यकता नहीं है। उसे बस यह जानने के लिए एक रफ स्केच (rough sketch) की आवश्यकता है कि आगे कहाँ हिलना है। यह वीडियो के लिए "हाई-डेफिनिशन" चरणों को छोड़ देता है और क्रिया (action) पर ध्यान केंद्रित करता है, जिससे यह 38 गुना तेज़ हो जाता है। अब, यह रियल-टाइम में सोच और चल सकता है।
सारांश
DreamZero एक ऐसा रोबोट दिमाग है जो भविष्य की कल्पना करके सीखता है।
- निर्देशों को रटने के बजाय, यह क्या होने वाला है इसकी फिल्में सिम्युलेट करता है।
- क्योंकि यह भौतिकी की "फिल्म" को समझता है, यह बिना पुन: प्रशिक्षण के नए कार्यों और नए वातावरणों को संभाल सकता है।
- यह मनुष्यों या अन्य रोबोटों के वीडियो से सीख सकता है, जिससे घंटों के शारीरिक प्रशिक्षण की आवश्यकता समाप्त हो जाती है।
- यह वास्तविक समय में वास्तविक रोबोट को नियंत्रित करने के लिए पर्याप्त तेज़ है।
यह एक ऐसे रोबोट के बीच का अंतर है जो "दरवाजा खोलने" की शब्दकोश परिभाषा जानता है, और एक ऐसे रोबोट के बीच का अंतर है जो दरवाजे को खुलते हुए देख सकता है (visualize) और जानता है कि उसे वास्तव में करने के लिए हैंडल को कितनी जोर से धक्का देना है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।