← नवीनतम पेपर
🤖 machine learning

World Action Models are Zero-shot Policies

यह शोधपत्र DreamZero को प्रस्तुत करता है, जो एक वर्ल्ड एक्शन मॉडल (World Action Model) है जो भविष्य की अवस्थाओं और क्रियाओं की भविष्यवाणी करने के लिए एक प्रीट्रेंड वीडियो डिफ्यूजन बैकबोन का लाभ उठाता है, जिससे वास्तविक समय में क्लोज्ड-लूप नियंत्रण, विजन-लैंग्वेज-एक्शन मॉडल्स की तुलना में अनदेखे कार्यों और वातावरणों के प्रति बेहतर सामान्यीकरण, और न्यूनतम डेटा के साथ प्रभावी क्रॉस-एम्बॉडिमेंट ट्रांसफर सक्षम होता है।

मूल लेखक: Seonghyeon Ye, Yunhao Ge, Kaiyuan Zheng, Shenyuan Gao, Sihyun Yu, George Kurian, Suneel Indupuru, You Liang Tan, Chuning Zhu, Jiannan Xiang, Ayaan Malik, Kyungmin Lee, William Liang, Nadun Ranawaka, J
प्रकाशित 2026-02-19
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Seonghyeon Ye, Yunhao Ge, Kaiyuan Zheng, Shenyuan Gao, Sihyun Yu, George Kurian, Suneel Indupuru, You Liang Tan, Chuning Zhu, Jiannan Xiang, Ayaan Malik, Kyungmin Lee, William Liang, Nadun Ranawaka, Jiasheng Gu, Yinzhen Xu, Guanzhi Wang, Fengyuan Hu, Avnish Narayan, Johan Bjorck, Jing Wang, Gwanghyun Kim, Dantong Niu, Ruijie Zheng, Yuqi Xie, Jimmy Wu, Qi Wang, Ryan Julian, Danfei Xu, Yilun Du, Yevgen Chebotar, Scott Reed, Jan Kautz, Yuke Zhu, Linxi "Jim" Fan, Joel Jang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को घर के काम करना सिखाने की कोशिश कर रहे हैं।

पुराना तरीका (VLA मॉडल):
वर्तमान रोबोट दिमागों (जिन्हें विजन-लैंग्वेज-एक्शन मॉडल कहा जाता है) को एक बहुत ही बुद्धिमान लाइब्रेरियन की तरह समझें जिसने अब तक लिखे गए हर निर्देश मैनुअल को पढ़ा है। यदि आप कहते हैं, "लाल कप को नीली मेज पर ले जाओ," तो लाइब्रेरियन जानता है कि उन शब्दों का क्या अर्थ है। वह कप और मेज को ढूंढ सकता है।

लेकिन समस्या यह है: लाइब्रेरियन ने वास्तव में पहले कभी कप को हिलाया नहीं है। उन्होंने केवल हिलने के लिए शब्दों को जाना है। यदि आप उनसे "जूते के फीते को खोलें" या "एक शर्ट को एक विशिष्ट तरीके से मोड़ें" जैसा कुछ करने को कहते हैं, तो वे ठिठक जाते हैं। वे जानते हैं कि जूता क्या है, लेकिन उनके पास इस बात की कोई 'मानसिक फिल्म' नहीं है कि जब आप फीतों को खींचते हैं तो वे कैसे चलते हैं। वे भाषा समझने में बेहतरीन हैं, लेकिन भौतिकी (physics) और गति (motion) को समझने में बहुत खराब हैं।

नया तरीका (DreamZero / "वर्ल्ड एक्शन मॉडल"):
NVIDIA के शोधकर्ताओं ने एक नया प्रकार का रोबोट दिमाग बनाया है जिसे DreamZero कहा जाता है। केवल एक लाइब्रेरियन होने के बजाय, DreamZero एक हॉलीवुड डायरेक्टर की तरह है जो एक स्टंट डबल भी है।

यह कैसे काम करता है, इस सरल उपमा का उपयोग करते हुए:

1. "मानसिक फिल्म" वाली ट्रिक (The "Mental Movie" Trick)

जब आप DreamZero को बताते हैं, "संतरे को कद्दू में डाल दो," तो वह केवल संतरे और कद्दू को नहीं ढूंढता। वह पहले भविष्य की एक छोटी फिल्म की कल्पना करता है।

वह खुद से कहता है: "ठीक है, मैं संतरा देख रहा हूँ। मैं कद्दू देख रहा हूँ। अब, मुझे अपने दिमाग में एक छोटी फिल्म चलानी चाहिए जिसमें मेरा हाथ संतरे को पकड़ता है, उसे उठाता है, और उसे कद्दू में डाल देता है।"

एक बार जब उसने अपने दिमाग में इस भविष्य की "फिल्म" को बना लिया, तो वह उस वीडियो को देखता है और कहता है, "ठीक है, इस फिल्म को सच करने के लिए, मेरे हाथ को इस तरह से हिलना होगा।"

यही जादू है। भविष्य के वीडियो को देखकर (कि दुनिया अगली चीज़ क्या होगी) यह अनुमान लगाने से, रोबोट स्वचालित रूप से सीख जाता है कि उस वीडियो को हकीकत बनाने के लिए उसे कैसे हिलना है। वह दुनिया को विकसित होते हुए देखकर भौतिकी (physics) सीखता है, ठीक वैसे ही जैसे हम सीखते हैं कि चीजें कैसे गिरती हैं या लुढ़कती हैं।

2. "अराजकता" से सीखना, न कि "दोहराव" से (Learning from "Chaos" instead of "Repetition")

पारंपरिक रोबोट उन छात्रों की तरह होते हैं जो केवल एक ही गणित के सवाल को 1,000 बार करके सीखते हैं। यदि आप नंबरों को थोड़ा सा भी बदल दें, तो वे भ्रमित हो जाते हैं।

DreamZero अलग है। इसे 500 घंटों के अराजक (chaotic), वास्तविक दुनिया के वीडियो पर प्रशिक्षित किया गया था। इसने रसोई, कार्यालयों और दुकानों में रोबोटों (और मनुष्यों) को हजारों अलग-अलग, अव्यवस्थित, गैर-दोहराव वाले कार्य करते हुए देखा।

  • उपमा: कल्पना कीजिए कि ड्राइविंग सीखना।
    • पुराना रोबोट: एक बंद ट्रैक पर ठीक एक ही रास्ते पर 1,000 बार गाड़ी चलाता है। यदि आप एक नया कोन (cone) रख देते हैं, तो वह टकरा जाता है।
    • DreamZero: वह व्यस्त शहर के बीच से गाड़ी चलाता है, ट्रैफिक, बारिश, पैदल चलने वालों और अजीब सड़क संकेतों का सामना करता है। वह केवल एक रूट को रटने के बजाय सड़क के नियमों (भौतिकी) को सीखता है।

क्योंकि इसने इस "अराजकता" से सीखा है, यह एक ऐसे नए कमरे में जा सकता है जिसे इसने पहले कभी नहीं देखा, और फिर भी किसी अजीब वस्तु को उठाने का तरीका ढूंढ सकता है।

3. "जादुई दर्पण" (क्रॉस-एम्बॉडमेंट / The "Magic Mirror")

DreamZero की सबसे शानदार चीजों में से एक यह है कि यह दूसरों को देखते हुए सीख सकता है, भले ही वे दिखने में पूरी तरह से अलग हों।

  • परिदृश्य: आपके पास दो हाथों वाला एक रोबोट (AgiBot) है। आप चाहते हैं कि वह एक नया करतब सीखे।
  • पुराना तरीका: आपको एक इंसान की आवश्यकता होती है जो रोबंड के हाथों को पकड़कर घंटों तक उसे शारीरिक रूप से गति के माध्यम से निर्देशित करे।
  • DreamZero का तरीका: आपको बस एक मानव द्वारा कार्य करने का 12 मिनट का वीडियो दिखाना है।
    • उपमा: यह एक जिम्नास्ट द्वारा बैकफ्लिप करने के वीडियो को देखने जैसा है। भले ही आपके पास पैर हैं और जिम्नास्ट के पास एक अलग शरीर है, आप फ्लिप की भौतिकी को समझ सकते हैं। DreamZero उस वीडियो को देखता है, बैकफ्लिप की "फिल्म" को समझता है, और फिर यह पता लगाता है कि उसका अपना शरीर इसे कैसे कर सकता है।
    • पेपर दिखाता है कि केवल 30 मिनट के "खेल" (play) डेटा के साथ, DreamZero पूरी तरह से अलग रोबोट बॉडी में स्विच कर सकता है और फिर भी पूरी तरह से काम कर सकता है।

4. गति की समस्या (द "फ्लैश" अपग्रेड / The "Speed Problem")

एक बड़ी समस्या थी: DreamZero एक 14-बिलियन-पैरामीटर वाला मॉडल है जो वीडियो जेनरेट करता है। आमतौर पर, वीडियो जेनरेट करना धीमा होता है (जैसे एक फिल्म रेंडर करना)। रोबोटों को तेजी से हिलने की आवश्यकता होती है (7 बार प्रति सेकंड)।

टीम ने DreamZero-Flash नामक एक "टर्बो मोड" बनाया है।

  • उपमा: कल्पना कीजिए कि आप एक पेंटिंग बना रहे हैं। आमतौर पर, आप पहले पूरा दृश्य, फिर पूरा आकाश, फिर पूरी जमीन पेंट करते हैं। इसमें बहुत समय लगता है।
  • समाधान: DreamZero-Flash यह समझ जाता है कि रोबोट की गति के लिए, उसे भविष्य की एकदम हाई-डेफिनिशन फिल्म की आवश्यकता नहीं है। उसे बस यह जानने के लिए एक रफ स्केच (rough sketch) की आवश्यकता है कि आगे कहाँ हिलना है। यह वीडियो के लिए "हाई-डेफिनिशन" चरणों को छोड़ देता है और क्रिया (action) पर ध्यान केंद्रित करता है, जिससे यह 38 गुना तेज़ हो जाता है। अब, यह रियल-टाइम में सोच और चल सकता है।

सारांश

DreamZero एक ऐसा रोबोट दिमाग है जो भविष्य की कल्पना करके सीखता है।

  • निर्देशों को रटने के बजाय, यह क्या होने वाला है इसकी फिल्में सिम्युलेट करता है।
  • क्योंकि यह भौतिकी की "फिल्म" को समझता है, यह बिना पुन: प्रशिक्षण के नए कार्यों और नए वातावरणों को संभाल सकता है।
  • यह मनुष्यों या अन्य रोबोटों के वीडियो से सीख सकता है, जिससे घंटों के शारीरिक प्रशिक्षण की आवश्यकता समाप्त हो जाती है।
  • यह वास्तविक समय में वास्तविक रोबोट को नियंत्रित करने के लिए पर्याप्त तेज़ है।

यह एक ऐसे रोबोट के बीच का अंतर है जो "दरवाजा खोलने" की शब्दकोश परिभाषा जानता है, और एक ऐसे रोबोट के बीच का अंतर है जो दरवाजे को खुलते हुए देख सकता है (visualize) और जानता है कि उसे वास्तव में करने के लिए हैंडल को कितनी जोर से धक्का देना है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →