← नवीनतम पेपर
🤖 AI

World Simulation with Video Foundation Models for Physical AI

यह शोध पत्र Cosmos-Predict2.5 और Cosmos-Transfer2.5 को प्रस्तुत करता है, जो वर्ल्ड फाउंडेशन मॉडल्स का एक एकीकृत परिवार है जो फिजिकल एआई, रोबोटिक्स और एम्बोडीड इंटेलिजेंस को आगे बढ़ाने के लिए हाई-फिडेलिटी, इंस्ट्रक्शन-अलाइन्ड वीडियो जनरेशन और वर्ल्ड ट्रांसलेशन प्रदान करने हेतु फ्लो-आधारित आर्किटेक्चर और रिइन्फोर्समेंट लर्निंग का लाभ उठाते हैं।

मूल लेखक: NVIDIA, :, Arslan Ali, Junjie Bai, Maciej Bala, Yogesh Balaji, Aaron Blakeman, Tiffany Cai, Jiaxin Cao, Tianshi Cao, Elizabeth Cha, Yu-Wei Chao, Prithvijit Chattopadhyay, Mike Chen, Yongxin Chen, Yu C
प्रकाशित 2026-02-26
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: NVIDIA, :, Arslan Ali, Junjie Bai, Maciej Bala, Yogesh Balaji, Aaron Blakeman, Tiffany Cai, Jiaxin Cao, Tianshi Cao, Elizabeth Cha, Yu-Wei Chao, Prithvijit Chattopadhyay, Mike Chen, Yongxin Chen, Yu Chen, Shuai Cheng, Yin Cui, Jenna Diamond, Yifan Ding, Jiaojiao Fan, Linxi Fan, Liang Feng, Francesco Ferroni, Sanja Fidler, Xiao Fu, Ruiyuan Gao, Yunhao Ge, Jinwei Gu, Aryaman Gupta, Siddharth Gururani, Imad El Hanafi, Ali Hassani, Zekun Hao, Jacob Huffman, Joel Jang, Pooya Jannaty, Jan Kautz, Grace Lam, Xuan Li, Zhaoshuo Li, Maosheng Liao, Chen-Hsuan Lin, Tsung-Yi Lin, Yen-Chen Lin, Huan Ling, Ming-Yu Liu, Xian Liu, Yifan Lu, Alice Luo, Qianli Ma, Hanzi Mao, Kaichun Mo, Seungjun Nah, Yashraj Narang, Abhijeet Panaskar, Lindsey Pavao, Trung Pham, Morteza Ramezanali, Fitsum Reda, Scott Reed, Xuanchi Ren, Haonan Shao, Yue Shen, Stella Shi, Shuran Song, Bartosz Stefaniak, Shangkun Sun, Shitao Tang, Sameena Tasmeen, Lyne Tchapmi, Wei-Cheng Tseng, Jibin Varghese, Andrew Z. Wang, Hao Wang, Haoxiang Wang, Heng Wang, Ting-Chun Wang, Fangyin Wei, Jiashu Xu, Dinghao Yang, Xiaodong Yang, Haotian Ye, Seonghyeon Ye, Xiaohui Zeng, Jing Zhang, Qinsheng Zhang, Kaiwen Zheng, Andrew Zhu, Yuke Zhu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को सैंडविच बनाना, कार चलाना या किसी व्यस्त शहर में चलना सिखाने की कोशिश कर रहे हैं। यदि आप रोबोट को ये चीजें वास्तविक दुनिया में करके सीखने देते हैं, तो वह टोस्टर तोड़ सकता है, कार दुर्घटनाग्रस्त कर सकता है, या अपने ही पैरों से टकराकर गिर सकता है। यह महंगा, खतरनाक और बहुत धीमा है।

यह पेपर NVIDIA के Cosmos-Predict2.5 को पेश करता है, जो भौतिक दुनिया के लिए एक नए प्रकार का "डिजिटल ट्विन" (digital twin) है। इसे केवल एक वीडियो जनरेटर के रूप में न देखें, बल्कि इसे शुद्ध कल्पना पर चलने वाले एक अति-यथार्थवादी (hyper-realistic) वीडियो गेम इंजन के रूप में समझें।

यह कैसे काम करता है और यह क्यों महत्वपूर्ण है, इसका विवरण सरल उपमाओं (analogies) का उपयोग करते हुए यहाँ दिया गया है:

1. मूल विचार: "ड्रीम मशीन" (The Dream Machine)

पिछले AI मॉडल उन छात्रों की तरह थे जिन्होंने ड्राइविंग के बारे में केवल एक पाठ्यपुस्तक पढ़ी थी लेकिन कभी कार में नहीं बैठे थे। वे ट्रैफिक लाइट के बारे में बात तो कर सकते थे, लेकिन वे यह अनुमान नहीं लगा सकते थे कि यदि सड़क पर एक गेंद लुढ़क कर आ जाए तो क्या होगा।

Cosmos-Predict2.5 उस छात्र की तरह है जिसने 20 करोड़ घंटों के वास्तविक वीडियो देखे हैं। इसने हर प्रकार का मौसम, रोबोटिक हाथ की हर तरह की हरकत और हर तरह की कार दुर्घटना देखी है। इसने दुनिया के काम करने के "भौतिक विज्ञान" (physics) को सीख लिया है। अब, आप इससे पूछ सकते हैं: "मुझे दिखाओ कि क्या होता है यदि एक रोबोट बारिश वाले किचन में एक फिसलन भरे सेब को उठाने की कोशिश करता है," और यह उस सटीक परिदृश्य का वीडियो बना देगा, जिसमें वास्तविक प्रतिबिंब (reflections), छीटें और गुरुत्वाकर्षण भी शामिल होंगे।

2. सफलता का रहस्य: इसने कैसे सीखा

टीम ने केवल कंप्यूटर में रैंडम वीडियो नहीं डाले। उन्होंने एक विशाल, स्वचालित फ़िल्टर फैक्ट्री बनाई:

  • फ़िल्टर: एक छलनी की कल्पना करें जो केवल सबसे अच्छे और दिलचस्प क्लिप्स को पकड़ती है। उन्होंने धुंधले वीडियो, कार्टून और ऐसी चीजें जो नकली दिखती थीं, उन्हें बाहर निकाल दिया। उन्होंने केवल "अच्छी चीजों" (जैसे असली वस्तुओं को हिलाते हुए असली रोबोट) को रखा।
  • शिक्षक (Cosmos-Reason1): उन्होंने एक स्मार्ट "शिक्षक" AI जोड़ा जो टेक्स्ट प्रॉम्प्ट्स को पढ़ता है। यदि आप कहते हैं "रोबोट कप गिरा देता है," तो शिक्षक यह सुनिश्चित करता है कि AI समझ सके कि "गिराना" वास्तव में कैसा दिखता है, बजाय इसके कि वह केवल कप को गायब कर दे।
  • अभ्यास (Reinforcement Learning): AI द्वारा वीडियो जेनरेट करने के बाद, उन्होंने इसे मानवीय प्राथमिकताओं के विरुद्ध खुद को "ग्रेड" करने के लिए कहा। यदि वीडियो अजीब लग रहा था या भौतिक विज्ञान गलत था, तो AI को "खराब ग्रेड" मिला और उसे फिर से प्रयास करना पड़ा। यह एक छात्र द्वारा अभ्यास टेस्ट देने जैसा है जब तक कि वह फाइनल एग्जाम में अव्वल न आ जाए।

3. दो मुख्य उपकरण

यह नया परिवार दो मुख्य उपकरण पेश करता है:

A. Cosmos-Predict2.5 (द सिम्युलेटर)

  • यह क्या करता है: यह आपके निर्देशों के आधार पर शून्य से नए संसार बनाता है।
  • उपमा: यह एक ऐसे निर्देशक की तरह है जो आपके द्वारा कल्पना की गई कोई भी फिल्म फिल्मा सकता है, लेकिन वह फिल्म वास्तविकता का एक सिमुलेशन है। आप कह सकते हैं, "मंगल ग्रह पर चलते हुए रोबोट की फिल्म बनाओ," और यह उसका वीडियो जेनरेट कर देगा।
  • यह बेहतर क्यों है: यह पिछले संस्करण की तुलना में अधिक तेज़, स्पष्ट और निर्देशों को बेहतर ढंग से समझने वाला है। यह 2 बिलियन या 14 बिलियन "मस्तिष्क कोशिकाओं" (parameters) को संभाल सकता है, जिससे यह अविश्वसनीय रूप से स्मार्ट बन जाता है।

B. Cosmos-Transfer2.5 (द ट्रांसलेटर)

  • यह क्या करता है: यह एक रफ स्केच या एक साधारण वीडियो लेता है और उसे एक फोटोरियलिस्टिक मास्टरपीस में बदल देता है।
  • उपमा: कल्पना कीजिए कि आपके पास सड़क का एक क्रेयॉन ड्राइंग (रंगों से बना चित्र) है। यह टूल एक जादुई कलाकार की तरह कार्य करता है जो उस ड्राइंग को लेता है और उसे उस सड़क के हाइपर-रियलिस्टिक, 4K वीडियो में पेंट करता है, जिसमें कारें, लोग और छायाएँ जोड़ी जाती हैं, जबकि आपके द्वारा बनाए गए लेआउट को बिल्कुल वैसा ही रखा जाता है।
  • जादू: यह पुराने संस्करण से 3.5 गुना छोटा है लेकिन उच्च गुणवत्ता प्रदान करता है। यह लंबे वीडियो भी बना सकता है बिना चित्र के धुंधला हुए या कहानी के तर्क खोने के (जिसे "एरर एक्यूमुलेशन" कहा जाता है)।

4. यह क्यों मायने रखता है? (वास्तविक दुनिया का प्रभाव)

यह केवल शानदार वीडियो बनाने के बारे में नहीं है; यह रोबोट्स को सुरक्षित रूप से प्रशिक्षित करने के बारे में है।

  • रोबोट्स के लिए: कपड़े तह करने का तरीका सीखने के लिए 1,000 असली रोबोटिक हाथों को तोड़ने के बजाय, इंजीनियर इस "Cosmos" सिम्युलेटर में रोबोट को प्रशिक्षित कर सकते हैं। रोबोट इस डिजिटल दुनिया में अपनी सभी गलतियाँ करता है, सटीक चालें सीखता है, और फिर काम करने के लिए तैयार होकर वास्तविक दुनिया में कदम रखता है।
  • सेल्फ-ड्राइविंग कारों के लिए: आप रेगिस्तान में बर्फबारी के दौरान सेल्फ-ड्राइविंग कार का परीक्षण आसानी से नहीं कर सकते। Cosmos के साथ, आप तुरंत रेगिस्तान में बर्फबारी पैदा कर सकते हैं। आप कार के AI का लाखों "क्या होगा अगर" (what-if) वाले परिदृश्यों के खिलाफ परीक्षण कर सकते हैं (जैसे, "क्या होगा यदि एक हिरण अचानक सामने आ जाए?")।
  • डेटा के लिए: यह ऐसा "नकली" डेटा बनाता है जो इतना वास्तविक दिखता है कि असली चीज़ से अंतर करना मुश्किल है। यह अन्य AI को प्रशिक्षित करने में मदद करता है बिना लाखों घंटों के वास्तविक फुटेज की आवश्यकता के।

5. बड़ी तस्वीर

NVIDIA सोर्स कोड और मॉडल्स को मुफ्त में (ओपन सोर्स) जारी कर रहा है।

इसे इस तरह समझें कि NVIDIA पूरी दुनिया को एक सुपर-पावरफुल सिमुलेशन इंजन के ब्लूप्रिंट और कच्चा माल बांट रहा है। वे चाहते हैं कि शोधकर्ता, छात्र और कंपनियाँ वास्तविक दुनिया की समस्याओं को हल करने के लिए अपने स्वयं के "डिजिटल संसार" बनाएं।

संक्षेप में:
Cosmos-Predict2.5 एक टाइम मशीन और एक समानांतर ब्रह्मांड जनरेटर का मिश्रण है। यह हमें रोबोट और सेल्फ-ड्राइविंग कारों के प्रशिक्षण को तेज करने की अनुमति देता है, जिससे वे वास्तविक दुनिया को छूने से पहले कंप्यूटर में एक हजार जीवन जी सकें। यह भौतिक AI के भविष्य के लिए अंतिम सुरक्षा जाल और अंतिम अभ्यास मैदान है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →