Video = World + Event Stream
यह शोध पत्र Wan-Streamer v0.3 को प्रस्तुत करता है, जो एक वास्तविक समय (real-time) ऑडियो-विजुअल इंटरेक्शन मॉडल है, जो वीडियो को एक निरंतर "विश्व" (world) और एक गतिशील "इवेंट स्ट्रीम" (event stream) के संयोजन के रूप में फ्रेम करता है ताकि पर्यावरणीय परिवर्तनों और एजेंट व्यवहारों का कम-विलंबता (low-latency) वाला, सामान्य-उद्देश्यीय पूर्वानुमान सक्षम किया जा सके।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक फिल्म देख रहे हैं, लेकिन केवल बैठकर देखने के बजाय, आप उस दृश्य के अंदर हैं, पात्रों से बात कर रहे हैं, और वे तुरंत आपको जवाब दे रहे हैं। यह रियल-टाइम आर्टिफिशियल इंटेलिजेंस (वास्तविक समय की कृत्रिम बुद्धिमत्ता) की रोमांचक दुनिया है, जहाँ कंप्यूटर हमें समझने और हमें उतनी ही तेज़ी से प्रतिक्रिया देने की कोशिश करते हैं जितना कि एक मानव मित्र करता है। ऐसा करने के लिए, AI को एक साथ तीन चीज़ों को संभालना पड़ता है: जो वह देखता है (वीडियो), जो वह सुनता है (ऑडियो), और जो वह कहता है या करता है (टेक्स्ट और क्रियाएं)। लंबे समय तक, AI को बिना किसी लैग (देरी) के यह सब करने के लिए तैयार करना एक भारी बैकपैक लेकर मैराथन दौड़ने जैसा था; यह धीमा और बोझिल था। बड़ा सवाल जो शोधकर्ता पूछ रहे थे वह यह है: हम AI को यह कैसे सिखा सकते हैं कि वह जिस "मंच" पर है और उस पर होने वाली "घटना" को समझे, ताकि वह स्वाभाविक रूप से और तुरंत प्रतिक्रिया दे सके?
यहाँ आता है Wan-Streamer v0.3, जो अलीबाबा ग्रुप की Wan टीम द्वारा बनाया गया एक नया निर्माण है। इस पेपर को एक सुपर-फास्ट, सुपर-स्मार्ट डिजिटल अभिनेता की एक चतुर रेसिपी के रूप में समझें। लेखकों ने महसूस किया कि वीडियो को बदलते हुए पिक्सेल के एक विशाल, भ्रमित करने वाले ढेर के रूप में देखने के बजाय, हम इसे दो सरल भागों में तोड़ सकते हैं: एक वर्ल्ड (विश्व) और एक इवेंट स्ट्रीम (घटना प्रवाह)। "वर्ल्ड" स्थिर चीज़ें हैं—जिस कमरे में आप हैं, फर्नीचर, व्यक्ति का चेहरा, और बैकग्राउंड का शोर। यह बहुत अधिक नहीं बदलता है। "इवेंट स्ट्रीम" वह सब कुछ है जो बदलता है—व्यक्ति का चलना, बात करना, हाथ हिलाना, या कार का गुजरना। AI को यह समझाने के मामले में कि एक वीडियो केवल एक "वर्ल्ड" प्लस "इवेंट्स की एक स्ट्रीम" है, उन्होंने पाया कि इससे AI अगला क्या होने वाला है, इसका अनुमान लगाने में बहुत अधिक स्मार्ट और तेज़ हो जाता है।
बड़ा विचार: मंच और नाटक
यह पेपर वीडियो को देखने का एक नया तरीका प्रस्तावित करता है। एक थिएटर की कल्पना करें। वर्ल्ड सेट डिज़ाइन है: चित्रित बैकड्रॉप, लाइटिंग, प्रॉप्स और अभिनेता की पोशाक। एक बार जब नाटक शुरू हो जाता है, तो ये चीज़ें काफी हद तक वैसी ही रहती हैं। इवेंट स्ट्रीम स्वयं नाटक है: अभिनेता का मंच पर चलना, एक संवाद चिल्लाना, एक प्रॉप गिराना, या मुड़ना।
अतीत में, AI मॉडल पूरे नाटक और पूरे सेट डिज़ाइन को एक साथ सीखने की कोशिश करते थे, जो कठिन था। Wan-Streamer v0.3 एक सरल तरकीब सुझाता है: AI को एक बार सेट डिज़ाइन सिखाएं, और फिर बस नाटक पर ध्यान केंद्रित करें।
शोधकर्ताओं ने अपने मॉडल को वास्तविक दुनिया के वीडियो की एक विशाल मात्रा पर प्रशिक्षित किया। उन्होंने केवल AI को अगला फ्रेम गेस करने के लिए नहीं कहा; उन्होंने इसे एक "वर्ल्ड" (जैसे कि एक धूप वाला उपनगरीय सड़क या एक मुर्गी घर) को देखने और फिर "इवेंट स्ट्रीम" (जैसे कि एक रोबोट सड़क पर दौड़ रहा है, या एक महिला मुर्गियों को दाना खिला रही है) की भविष्यवाणी करने के लिए सिखाया। मॉडल ने सीखा कि यदि एक रोबोट फुटपाथ पर है, तो वह कार की ओर दौड़ सकता है, दरवाजा खोल सकता है और जा सकता है। यदि एक महिला मुर्गी घर में है, तो वह एक बाल्टी की ओर जा सकती है और दाना उठा सकती है। इन पैटर्न को सीखकर, AI दुनिया के बारे में एक "विश्व ज्ञान" (world knowledge) विकसित करता है कि चीजें स्वाभाविक रूप से कैसे चलती और बदलती हैं।
जादू का कमाल: बात करना और कार्य करना एक साथ
तो, यह वास्तव में क्या करता है? टीम ने इस विचार का परीक्षण एक रियल-टाइम, फुल-डुप्लेक्स ऑडियो-विजुअल इंटरेक्शन पर किया। "फुल-डुप्लेक्स" एक फैंसी शब्द है जिसका अर्थ है कि AI एक ही समय में बात कर सकता है और सुन सकता है, ठीक एक वास्तविक बातचीत की तरह, बिना आपके खत्म होने का इंतज़ार किए।
इस नए संस्करण (v0.3) में, AI एजेंट केवल एक बोलने वाला सिर नहीं है। अब यह फ्री-फॉर्म व्यवहार (स्वतंत्र व्यवहार) कर सकता है।
- पुराना तरीका: AI शायद बोलते समय केवल सिर हिला सकता है या आपकी ओर देख सकता है।
- नया तरीका: AI कह सकता है, "(कॉफी मग उठाता है और एक घूंट लेता है) याद दिलाने के लिए धन्यवाद," या "(हल्का सा त्योर चढ़ाता है) आपका क्या मतलब था?"
पेपर बताता है कि AI अपना जवाब एक विशेष "रोल-प्ले" प्रारूप में लिखता है। यह बोले गए शब्दों को कोष्ठक में लिखी गई क्रियाओं के साथ मिलाता है। क्योंकि AI ने "वर्ल्ड" (सेटिंग और चरित्र) को सीख लिया है, इसलिए वह जानता है कि यदि वह कहता है "(मग उठाता है)," तो वीडियो जनरेटर वास्तव में दिखाएगा कि चरित्र एक ऐसा मग उठा रहा है जो दृश्य के अनुकूल है। यह रियल-टाइम में होता है, और भाषण, क्रिया और वीडियो सभी पूरी तरह से सिंक्रोनाइज़ (तालमेल में) रहते हैं।
गति: इतना तेज़ कि वास्तविक लगे
इस पेपर का सबसे प्रभावशाली हिस्सा यह है कि उन्होंने इस नई बुद्धिमत्ता के लिए गति का त्याग नहीं किया। लेखक दिखाते हैं कि Wan-Streamer v0.3 अपने पिछले संस्करण (v0.2) के समान बिजली जैसी तेज़ प्रदर्शन बनाए रखता है।
- वीडियो गुणवत्ता: यह अभी भी 640×368 रिज़ॉल्यूशन पर वीडियो आउटपुट देता है।
- स्मूथनेस: यह 25 FPS (फ्रेम प्रति सेकंड) पर चलता है, जो प्राकृतिक दिखने के लिए पर्याप्त स्मूथ है।
- गति: AI खुद जवाब सोचने और उत्पन्न करने में लगभग 200 मिलीसेकंड लेता है। जब आप इसमें इंटरनेट द्वारा डेटा भेजने और वापस प्राप्त करने का समय (एक बजट 350 मिलीसेकंड) जोड़ देते हैं, तो आपके जवाब के लिए कुल प्रतीक्षा समय लगभग 550 मिलीसेकंड होता है।
इसे समझने के लिए, 550 मिलीसेकंड एक सेकंड से भी कम है। यह इतना तेज़ है कि बातचीत एक दोस्त के साथ वास्तविक चैट की तरह लगती है, न कि लोडिंग बार का इंतज़ार करते हुए एक रोबोट की तरह।
इसका क्या अर्थ है (और क्या नहीं)
पेपर सुझाव देता है कि "वर्ल्ड" को "इवेंट्स" से अलग करके, हम अधिक लचीला AI बना सकते हैं। इसे किसी भी प्रकार के वीडियो पर प्रशिक्षित किया जा सकता है और फिर विभिन्न कार्यों के लिए विशिष्ट बनाया जा सकता है, जैसे कि एक कमरे में नेविगेट करने वाला रोबोट या वीडियो गेम में एक पात्र। लेखक दिखाते हैं कि यह दृष्टिकोण उनके विशिष्ट परीक्षण मामले के लिए काम करता है: एक डिजिटल पात्र जो वास्तविक समय में बात करता है और कार्य करता है।
हालाँकि, पेपर इस बात पर ध्यान देने में सावधानी बरतता है कि यह एक विशिष्ट प्रदर्शन है। उन्होंने दिखाया है कि मॉडल यह कर सकता है, और उन्होंने गति और गुणवत्ता को मापा है। उन्होंने यह दावा नहीं किया है कि उन्होंने AI की हर समस्या को हल कर दिया है, न ही उन्होंने हर संभावित भविष्य के उपयोग की सूची दी है। वे बस वीडियो जनरेशन के बारे में सोचने का एक नया तरीका प्रस्तुत करते हैं जो AI को यह समझने में स्मार्ट बनाता है कि दुनिया कैसे काम करती है, जबकि इसे आपके साथ चैट करने के लिए पर्याप्त तेज़ भी रखता है।
संक्षेप में, Wan-Streamer v0.3 एक डिजिटल अभिनेता को एक स्क्रिप्ट देने जैसा है जो कहती है, "यहाँ मंच है, यहाँ आपकी पोशाक है, और यहाँ कहानी है। अब, जाओ अभिनय करो, बात करो और चलो, और यह सब मेरे पलक झपकने से पहले कर दो।" और इस नए "वर्ल्ड + इवेंट" के कमाल की बदौलत, ऐसा लगता है कि यह बिल्कुल वही कर रहा है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।