← नवीनतम पेपर
🤖 AI

Render, Don't Decode: Weight-Space World Models with Latent Structural Disentanglement

NOVA एक नवीन वर्ल्ड मॉडलिंग फ्रेमवर्क पेश करता है जो सिस्टम स्टेट्स को कोऑर्डिनेट-आधारित इम्प्लिसिट न्यूरल रिप्रेजेंटेशन्स के वेट्स के रूप में प्रदर्शित करता है, जिससे कुशल, डिकोडर-मुक्त रेंडरिंग और ज़ीरो-शॉट सुपर-रिज़ॉल्यूशन सक्षम होता है और साथ ही कंट्रोलेबल वीडियो फोरकास्टिंग के लिए सीन स्ट्रक्चर और मोशन का अनसुपरवाइज्ड डिसेंटैंगलमेंट प्राप्त होता है।

मूल लेखक: Roussel Desmond Nzoyem, Mauro Comi

प्रकाशित 2026-05-11
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Roussel Desmond Nzoyem, Mauro Comi

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक कंप्यूटर को यह सिखाने की कोशिश कर रहे हैं कि वीडियो में आगे क्या होने वाला है, जैसे कि एक गेंद का उछलना या मौसम के पैटर्न का बदलना। वर्तमान के अधिकांश AI मॉडल यह काम एक वीडियो को लेकर, उसे एक बहुत ही छोटे, अदृश्य "गुप्त कोड" (लेटेंट स्पेस) में कंप्रेस करके, और फिर उस कोड को वापस एक तस्वीर में बदलने के लिए एक विशाल, जटिल मशीन का उपयोग करके करते हैं।

इस पेपर के लेखक तर्क देते हैं कि यह "डिकोड" करने वाला चरण ही समस्या है। यह धीमा है, इसे समझना कठिन है, और यह AI को कठोर बनाता है (यदि आप उच्च-रिज़ॉल्यूशन वाली तस्वीर चाहते हैं, तो आपको पूरी चीज़ को फिर से प्रशिक्षित करना होगा)।

इसके बजाय, वे एक नया फ्रेमवर्क प्रस्तावित करते हैं जिसे NOVA (न्यूरल ऑन्टोलॉजी फॉर विजुअल एब्स्ट्रैक्शन) कहा जाता है। उनका दर्शन सरल है: डिकोड नहीं, रेंडर करें (Render, Don't Decode)।

यहाँ NOVA कैसे काम करता है, रोजमर्रा के उदाहरणों का उपयोग करते हुए दिया गया है:

1. "रेसिपी" बनाम "केक"

अधिकांश AI मॉडल एक वीडियो फ्रेम को एक केक की तरह मानते हैं। वे हर एक कण (पिक्सेल) की सटीक व्यवस्था को याद रखने की कोशिश करते हैं और फिर एक नया केक बनाने की कोशिश करते हैं जो बिल्कुल उसी जैसा दिखता हो। इसके लिए एक बहुत बड़े ओवन (डिकोलर) की आवश्यकता होती है और यह उस एक विशिष्ट केक के आकार के लिए बहुत विशिष्ट होता है।

NOVA एक वीडियो फ्रेम को एक रेसिपी की तरह मानता है। पिक्सेल को याद करने के बजाय, यह उन निर्देशों (वेट्स और बायस) को याद करता है जिनकी आवश्यकता केक बनाने के लिए होती है।

  • उदाहरण: कल्पना कीजिए कि आपके पास एक मास्टर बेकर (AI) है। बेकर को एक केक की फोटो देने और उससे उसी को कॉपी करने के लिए कहने के बजाय, आप उन्हें एक विशिष्ट सेट निर्देश देते हैं: "2 कप मैदा, 1 अंडा लें, और 350 डिग्री पर बेक करें।"
  • लाभ: यदि आप एक छोटा केक या एक बड़ा केक चाहते हैं, तो आपको नए बेकर या नई फोटो की आवश्यकता नहीं है। आप बस पैन का आकार (कोऑर्डिनेट ग्रिड) बदल सकते हैं और बेकर को उन्हीं निर्देशों का पालन करने के लिए कह सकते हैं। "रेसिपी" (वेट्स) पोर्टेबल, संक्षिप्त है, और इसका उपयोग किसी भी रिज़ॉल्यूशन पर तुरंत केक बनाने के लिए किया जा सकता है।

2. वास्तविकता का तीन-परत वाला केक

पेपर का दावा है कि NOVA बिना किसी विशेष प्रशिक्षण युक्तियों के एक वीडियो को तीन अलग-अलग भागों में स्वाभाविक रूप से विभाजित करता है। एक वीडियो दृश्य को एक स्टेज प्ले की तरह समझें:

  1. बैकग्राउंड (सेट): यह कमरे का वह स्थिर हिस्सा है जो कभी नहीं बदलता। NOVA इसे एक बार सीख लेता है और इसे "बेस रेसिपी" के रूप में संग्रहीत करता है। यह थिएटर की स्थायी दीवारों की तरह है।
  2. फोरग्राउंड (अभिनेता): यह हिलने-डुलने वाली चीजें हैं, जैसे किसी व्यक्ति का चलना या गेंद का उछलना। NOVA इसे बेस रेसिपी में एक छोटे "समायोजन" के रूप में मानता है। यह बेकर को यह बताने जैसा है, "बेस रेसिपी को बनाए रखें, लेकिन ऊपर से एक चेरी जोड़ दें।"
  3. मोशन (स्क्रिप्ट): यह इस बारे में निर्देश है कि अभिनेता कैसे चलते हैं। यह गेंद फेंकने का निर्देश है या व्यक्ति के चलने की गति है।

क्योंकि NOVA इन तीनों चीजों (सेट, अभिनेता और स्क्रिप्ट) को अलग रखता है, आप कुछ जादुई कर सकते हैं: भौतिकी (physics) को तोड़े बिना वीडियो को एडिट करना।

3. "मैजिक स्वैप" (डिसेन्टैंगलमेंट)

पेपर यह प्रदर्शित करता है कि चूंकि "अभिनेता" (कंटेंट) और "स्क्रिप्ट" (मोशन) अलग-अलग संग्रहीत हैं, इसलिए आप उन्हें स्वतंत्र रूप से आपस में बदल सकते हैं।

  • प्रयोग: कल्पना कीजिए कि एक लाल गेंद स्क्रीन पर लुढ़क रही है।
  • स्वैप: आप लाल गेंद से "स्क्रिप्ट" (लुढ़कने की गति) ले सकते हैं और इसे एक नीले वर्ग (blue square) पर लागू कर सकते हैं।
  • परिणाम: नीला वर्ग ठीक वैसे ही लुढ़केगा जैसे लाल गेंद लुढ़की थी, लेकिन वह अभी भी एक नीले वर्ग की तरह ही दिखेगा।
  • महत्व: अन्य AI मॉडलों में, यदि आप मोशन को बदलने की कोशिश करते हैं, तो वस्तु अक्सर अपना आकार या रंग भी बदल लेती है, या पूरा वीडियो धुंधला हो जाता है। NOVA वस्तु की "पहचान" को सुरक्षित रखते हुए उसे कैसे हिलना है, यह बदलने की अनुमति देता है।

4. अदृश्य को देखना (सुपर-रिज़ॉल्यूशन)

चूंकि NOVA "रेसिपी" (गणितीय कार्यों) का उपयोग करता है न कि पिक्सेल के निश्चित ग्रिड का, यह किसी भी आकार पर वीडियो को "रेंडर" कर सकता है।

  • उदाहरण: यदि आपके पास एक डिजिटल फोटो है, तो ज़ूम करने पर वह आमतौर पर ब्लॉक जैसा (पिक्सेलेटेड) दिखने लगता है। यदि आपके पास एक वेक्टर ड्राइंग (जैसे एक लोगो) है, तो आप कितना भी ज़ूम करें, वह स्पष्ट रहता है।
  • NOVA की शक्ति: NOVA एक वेक्टर ड्राइंग की तरह है। पेपर दिखाता है कि यह एक कम-रिज़ॉल्यूशन वाले मौसम मानचित्र को तुरंत 32 गुना उच्च रिज़ॉल्यूशन पर "रेंडर" कर सकता है, जिससे मानक AI अपस्केलिंग से मिलने वाले धुंधलेपन के बिना बारीक विवरण सामने आते हैं।

5. यह एक बड़ी बात क्यों है?

लेखकों ने तीन बहुत अलग प्रकार के वीडियो पर NOVA का परीक्षण किया:

  • मूविंग डिजिट्स: इधर-उधर उछलते अंक।
  • फिजिक्स कोलिजन: एक-दूसरे से टकराती गेंदें (यह जांचने के लिए कि क्या AI मोमेंटम जैसी वास्तविक दुनिया की भौतिकी को समझता है)।
  • वेदर मैप्स: वैश्विक तापमान परिवर्तन की भविष्यवाणी करना।

उन्होंने पाया कि NOVA इन दृश्यों के भविष्य की सटीक भविष्यवाणी कर सकता है, कंटेंट और मोशन को स्वतंत्र रूप से एडिट कर सकता है, और एक सिंगल स्टैंडर्ड कंप्यूटर ग्राफिक्स कार्ड (एक कंज्यूमर GPU) पर लगभग 40 मिलियन पैरामीटर्स के साथ चल सकता है।

संक्षेप में: पेपर का तर्क है कि वीडियो कैसा दिखता है इसका अनुमान लगाने के लिए एक विशाल, अपारदर्शी मशीन बनाने के बजाय, हमें वीडियो उत्पन्न करने के नियमों को सीखने वाला सिस्टम बनाना चाहिए। "नियमों" (वेट्स) को सीधे संग्रहीत करके, AI छोटा, तेज़, एडिट करने में आसान और दुनिया को किसी भी स्तर के विवरण के साथ देखने में सक्षम हो जाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →