← नवीनतम पेपर
💻 computer science

VideoWorld 2: Learning Transferable Knowledge from Real-world Videos

VideoWorld 2 एक डायनेमिक-एन्हांस्ड लेटेंट डायनेमिक्स मॉडल (dLDM) पेश करता है जो वास्तविक दुनिया के कच्चे वीडियो से सीधे हस्तांतरणीय, कार्य-संबंधी ज्ञान सीखने के लिए एक्शन डायनेमिक्स को विजुअल अपीयरेंस से अलग करता है, जिससे जटिल हस्तशिल्प कार्यों और रोबोटिक हेरफेर में प्रदर्शन में महत्वपूर्ण सुधार होता है।

मूल लेखक: Zhongwei Ren, Yunchao Wei, Xiao Yu, Guixun Luo, Yao Zhao, Bingyi Kang, Jiashi Feng, Xiaojie Jin

प्रकाशित 2026-02-11
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Zhongwei Ren, Yunchao Wei, Xiao Yu, Guixun Luo, Yao Zhao, Bingyi Kang, Jiashi Feng, Xiaojie Jin

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बच्चे को कागज का हवाई जहाज बनाना सिखाने की कोशिश कर रहे हैं। आप उसे भौतिकी के समीकरणों वाला 500 पन्नों का मैनुअल नहीं देते; आप बस उसे किसी को ऐसा करते हुए दिखाने वाला एक वीडियो दिखा देते हैं। बच्चा देखता है, गति के सार को समझता है—मोड़, क्रीज, टक—और फिर अपने कमरे में जाकर, कागज का एक अलग टुकड़ा लेता है, और खुद इसे करता है।

वर्तमान AI मॉडल उन छात्रों की तरह हैं जो "विवरणों के प्रति बहुत अधिक जुनूनी" हैं। यदि आप उन्हें लकड़ी की मेज पर कागज मोड़ने वाले व्यक्ति का वीडियो दिखाते हैं, तो वे सोच सकते हैं कि कागज मोड़ने के "ज्ञान" में लकड़ी की बनावट या कमरे की विशिष्ट रोशनी भी शामिल है। यदि आप फिर कागज को एक सफेद डेस्क पर रख देते हैं, तो AI भ्रमित हो जाता है और विफल हो जाता है, क्योंकि उसने यह नहीं सीखा कि कैसे मोड़ना है; उसने केवल उस विशिष्ट वीडियो को दोहराना सीख लिया था।

VideoWorld 2 AI को दृश्य के "त्वचा" (दिखावट) के बजाय क्रिया की "आत्मा" पर ध्यान केंद्रित करने का एक नया तरीका है।

समस्या: "अत्यधिक विस्तृत छात्र"

अधिकांश AI मॉडल एक साथ सब कुछ सीखने की कोशिश करते हैं: हाथों की गति, कागज का रंग, मेज पर छाया, और पृष्ठभूमि। क्योंकि वे हर एक पिक्सेल को याद करने की कोशिश करते हैं, वे "अपीयरेंस एंटैंगलमेंट" (Appearance Entanglement) का शिकार होते हैं। यह नृत्य सीखने की कोशिश करने जैसा है, लेकिन डांसर के जूतों के रंग से इतना विचलित हो जाना कि आप संगीत की लय ही भूल जाएं। जब जूतों का रंग बदल जाता है, तो आप ताल खो देते हैं।

समाधान: "निर्देशक और कोरियोग्राफर"

शोधकर्ताओं ने dLDM (डायनेमिक्स-एनहैंस्ड लेटेंट डायनेमिक्स मॉडल) नामक एक प्रणाली बनाई है। यह समझने के लिए कि यह कैसे काम करता है, एक फिल्म निर्माण की कल्पना करें जो दो विशिष्ट भूमिकाओं में विभाजित है:

  1. कोरियोग्राफर (द लेटेंट डायनेमिक्स मॉडल): AI का यह हिस्सा सुंदरता के प्रति "अंधा" है। इसे इस बात से कोई फर्क नहीं पड़ता कि कागज नीला है, लाल है, या उस पर बिंदियां हैं। इसका एकमात्र काम गति के कंकाल (skeleton) को मैप करना है। यह क्रिया के "गणित" को पकड़ता है: हाथ को बाईं ओर ले जाएं \rightarrow नीचे दबाएं \rightarrow कोना मोड़ें। यह कार्य का एक सरलीकृत, "स्केच जैसा" संस्करण बनाता है जो पूरी तरह से गति के तर्क पर केंद्रित है।
  2. निर्देशक (द वीडियो डिफ्यूजन मॉडल): यह एक अत्यधिक कुशल कलाकार है जिसने लाखों सुंदर वीडियो देखे हैं। निर्देशक को यह नहीं पता कि कार्य क्या है, लेकिन वह जानता है कि चीजों को वास्तविक कैसे बनाया जाए। वे कोरियोग्राफर द्वारा दिए गए "स्केच" को लेते हैं और कहते हैं, "ठीक है, मैं गति देख रहा हूँ; अब मुझे इसे वास्तविक बनावट, रोशनी और रंगों के साथ पेंट करने दें।"

इन दोनों को अलग करके, AI कुछ जादुई हासिल करता है: स्थानांतरणीय ज्ञान (Transferable Knowledge)।

यह क्यों महत्वपूर्ण है: "वास्तविक दुनिया" का परीक्षण

शोधकर्ताओं ने दो बहुत कठिन "फाइनल परीक्षाओं" पर इसका परीक्षण किया:

  • हस्तशिल्प परीक्षण (Video-CraftBench): उन्होंने AI को केवल वीडियो देखकर कागज का हवाई जहाज बनाने या ब्लॉकों से मीनार बनाने जैसे जटिल, बहु-चरणीय कार्यों को सीखने के लिए कहा। क्योंकि AI ने मेज के दिखावट के बजाय मोड़ के तर्क को सीखा था, इसलिए वह पूरी तरह से नए वातावरण में सफलतापूर्वक कागज मोड़ सका जिसे उसने पहले कभी नहीं देखा था। इसने पुराने तरीकों की तुलना में सफलता दर में 70% तक सुधार किया।
  • रोबोट परीक्षण (CALVIN): उन्होंने इंटरनेट के विशाल वीडियो डेटासेट से सीखा गया ज्ञान एक रोबोट में "ट्रांसफर" किया। यह एक ऐसे व्यक्ति की तरह है जो YouTube के कुकिंग वीडियो देखता है और फिर वास्तव में एक असली रसोई का उपयोग सफलतापूर्वक करता है। AI ने वस्तुओं के हेरफेर को इस तरह सीखा जो विभिन्न रोबोटिक भुजाओं और सेटिंग्स में काम करता था।

बड़ी तस्वीर

VideoWorld 2 एक ऐसे कदम की ओर है जहाँ AI दुनिया को वैसे ही देखता है जैसे एक इंसान देखता है। केवल पिक्सेल की नकल करने वाली एक हाई-टेक फोटोकॉपी मशीन बनने के बजाय, यह एक तर्कसंगत पर्यवेक्षक (reasoning observer) बन रहा है—एक ऐसा एजेंट जो दुनिया को देख सकता है, खेल के "नियमों" को समझ सकता है, और वास्तविक दुनिया में नई समस्याओं को हल करने के लिए उन नियमों को लागू कर सकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →