← नवीनतम पेपर
💻 computer science

VideoVerse: Does Your T2V Generator Have World Model Capability to Synthesize Videos?

यह शोध पत्र VideoVerse को प्रस्तुत करता है, जो एक व्यापक बेंचमार्क है जिसे एक व्यवस्थित, मानव-संरेखित QA-आधारित मूल्यांकन पाइपलाइन के माध्यम से घटना-स्तरीय लौकिक कार्य-कारण (temporal causality) और विश्व ज्ञान का आकलन करके टेक्स्ट-टू-वीडियो जनरेटरों की वर्ल्ड मॉडल क्षमताओं का मूल्यांकन करने के लिए डिज़ाइन किया गया है।

मूल लेखक: Zeqing Wang, Xinyu Wei, Bairui Li, Zhen Guo, Jinrui Zhang, Hongyang Wei, Keze Wang, Lei Zhang

प्रकाशित 2026-03-18
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Zeqing Wang, Xinyu Wei, Bairui Li, Zhen Guo, Jinrui Zhang, Hongyang Wei, Keze Wang, Lei Zhang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक जादुई रोबोट शेफ है। लंबे समय से, हम इस शेफ का परीक्षण करने के लिए उससे सैंडविच बनाने को कह रहे हैं। यदि ब्रेड अच्छी दिखती है और चीज़ सही जगह पर है, तो हम उसे एक गोल्ड स्टार देते हैं। हम इसी तरह Text-to-Video (T2V) AI मॉडल्स का परीक्षण करते थे: हम उन्हें एक विवरण के आधार पर वीडियो बनाने के लिए कहते थे, और हम देखते थे कि क्या चित्र सुंदर दिखते हैं और क्या वस्तुएं सही स्थान पर रहती हैं।

लेकिन अब, ये AI शेफ "सुंदर चित्र" बनाने में इतने अच्छे हो गए हैं कि पुराने परीक्षण अब काम नहीं करते। वे सभी गोल्ड स्टार प्राप्त कर लेते हैं, भले ही वे वास्तव में यह न समझते हों कि दुनिया कैसे काम करती है।

यह पेपर एक नया, बहुत कठिन परीक्षण पेश करता है जिसे VideoVerse कहा जाता है। इसे ऐसे समझें जैसे आप AI को "कुकिंग क्लास" से हटाकर "सर्वाइवल सिमुलेशन" (जीवित रहने के सिम्युलेशन) में ले जा रहे हैं।

समस्या: "स्पष्टता" का जाल (The "Obvious" Trap)

कल्पना कीजिए कि आप AI से कहते हैं: "एक रबर डक फर्श पर फेंकी जाती है, जो इसकी ऊर्जावान उछाल (energetic bounce) को दर्शाती है।"
AI बस "ऊर्जावान उछाल" शब्दों की नकल करता है और एक उछलते हुए डक का चित्र बना देता है। यह नकल करना (cheating) है! उसे यह नहीं पता था कि डक उछलती है; उसने बस निर्देश पढ़ लिया।

VideoVerse नियमों को बदल देता है। यह पूछता है: "एक रबर डक फर्श पर फेंकी जाती है।"
यह उछाल वाले हिस्से को छिपा देता है। एक स्मार्ट AI (एक "वर्ल्ड मॉडल") को पता होना चाहिए कि यदि आप एक रबर डक फेंकते हैं, तो वह भौतिकी (physics) के कारण उछलेगी ही। यदि डक फर्श से टकराकर वहीं रुक जाती है, तो AI टेस्ट में फेल हो गया, भले ही वह डक कितनी भी सुंदर क्यों न दिख रही हो।

नया परीक्षण: AI को तोड़ने के 10 तरीके

लेखकों ने 300 पेचीदा प्रॉम्प्ट्स बनाए हैं ताकि यह देखा जा सके कि क्या AI "ब्रह्मांड के नियमों" को समझता है। उन्होंने इस टेस्ट को दो श्रेणियों में विभाजित किया है: Static (जो स्थिर हैं) और Dynamic (जो समय के साथ बदलते हैं)।

1. स्टेटिक टेस्ट (द "वन-सेकंड" चेक)

ये सामान्य ज्ञान और विज्ञान पर आधारित अचानक होने वाले टेस्ट की तरह हैं।

  • सामान्य ज्ञान (Common Sense): यदि आप "जापानी संस्कृति का प्रतिनिधित्व करने वाले पेड़" के लिए पूछते हैं, तो AI को एक चेरी ब्लॉसम (Cherry Blossom) पेड़ बनाना चाहिए, न कि पाइन या पाम का पेड़।
  • प्राकृतिक बाधाएं (Natural Constraints): यदि आप -20°C पर एक झील के बारे में पूछते हैं, तो पानी जमा हुआ (frozen) होना चाहिए। यदि AI तरल पानी दिखाता है, तो वह फेल हो जाता है।
  • 3D गहराई (3D Depth): यदि आप कहते "एक बेंच के पीछे एक पेड़", तो पेड़ बेंच के सामने तैरने के बजाय उसके पीछे छिपा होना चाहिए।

2. डायनेमिक टेस्ट (द "मूवी" चेक)

यहीं असली जादू होता है। AI को कार्य और प्रभाव (cause and effect) को समझना होगा, जैसे एक निर्देशक जो जानता है कि फिल्म का दृश्य कैसा होना चाहिए।

  • घटना का पालन (Event Following - डोमिनो इफेक्ट): यदि आप कहते हैं, "एक आदमी गेंद फेंकता है, एक कुत्ता उसे पकड़ता है, और आदमी कुत्ते को पट्टे (leash) से बांधता है," तो AI को ये सब उसी क्रम में करना होगा। यदि कुत्ता गेंद फेंकने से पहले उसे पकड़ लेता है, तो AI समय के बारे में भ्रमित है।
  • परस्पर क्रिया (Interaction - "टच" टेस्ट): यदि आप कहते हैं, "एक आदमी अपनी दाढ़ी बनाता है," तो दाढ़ी छोटी होनी चाहिए। यदि AI चेहरे पर रेज़र चलाता हुआ दिखता है लेकिन दाढ़ी वैसी की वैसी ही मोटी रहती है, तो AI नहीं समझता कि "शेविंग" वास्तव में क्या करती है।
  • पदार्थ के गुण (Material Properties - "फिजिक्स" टेस्ट): यदि आप कहते, "चॉकलेट को गर्म किया जाता है," तो उसे पिघलकर तरल बनना चाहिए। यदि वह सख्त बनी रहती है, तो AI नहीं जानता कि चॉकलेट के साथ कैसा व्यवहार होता है।

परिणाम: "वर्ल्ड मॉडल" का अंतर (The "World Model" Gap)

शोधकर्ताओं ने बेहतरीन AI मॉडल्स (दोनों मुफ्त जैसे Wan2.2 और महंगे जैसे Sora-2 और Veo-3) का इस नए टेस्ट के साथ परीक्षण किया।

  • अच्छी खबर: AI मॉडल्स सुंदर चित्र बनाने और सरल निर्देशों का पालन करने में बेहतर हो रहे हैं।
  • बुरी खबर: वे अभी भी दुनिया के "छिपे हुए नियमों" को समझने में बहुत खराब हैं।
    • ओपन-सोर्स मॉडल्स (मुफ्त वाले) अक्सर "वर्ल्ड मॉडल" टेस्ट में पूरी तरह विफल हो जाते हैं। वे शायद एक शार्क का सुंदर वीडियो बना दें, लेकिन अगर शार्क नाव के बीच से तैरकर निकल जाए, तो उन्हें एहसास नहीं होता कि यह असंभव है।
    • क्लोज्ड-सोर्स मॉडल्स (महंगे वाले जैसे Sora-2) बहुत बेहतर हैं, लेकिन वे भी गलतियाँ करते हैं। वे शायद 70% बार भौतिकी को सही करते हैं, लेकिन 30% विफलता का मतलब है कि वे अभी तक वास्तव में "बुद्धिमान" नहीं हैं।

निष्कर्ष

वर्तमान AI वीडियो जनरेटर्स को ऐसे अद्भुत अभिनेताओं के रूप में देखें जो संवाद (lines) तो पूरी तरह याद कर सकते हैं लेकिन उन्हें कहानी (plot) समझ नहीं आती। वे कह सकते हैं "मैं दुखी हूँ" और इशारे पर रो सकते हैं, लेकिन वे वास्तव में दुख महसूस नहीं करते या यह नहीं समझते कि पात्र दुखी क्यों है।

VideoVerse पहला ऐसा टेस्ट है जो AI से पूछता है: "क्या तुम वास्तव में समझते हो कि दुनिया कैसे काम करती है, या तुम सिर्फ अंदाजा लगा रहे हो?"

पेपर यह निष्कर्ष निकालता है कि हालांकि हम करीब पहुँच रहे हैं, आज का AI अभी भी एक वास्तविक "वर्ल्ड मॉडल" नहीं है। यह अभी भी एक उछलने वाली रबर डक और एक पत्थर के बीच के अंतर को सीखने की प्रक्रिया में है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →