Wan-Streamer v0.1: End-to-end Real-time Interactive Foundation Models
Wan-Streamer एक नेटिव-स्ट्रीमिंग, एंड-टू-एंड इंटरैक्टिव फाउंडेशन मॉडल है जो लगभग 200 ms मॉडल-साइड लेटेंसी के साथ सब-सेकंड, फुल-डुप्लेक्स मल्टीमॉडल संचार प्राप्त करने के लिए एक ही ट्रांसफॉर्मर के भीतर भाषा, ऑडियो और वीडियो प्रोसेसिंग को एकीकृत करता है, जो पारंपरिक कैस्केडेड सिस्टम में निहित त्रुटि संचय और देरी को समाप्त करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप अपने किसी दोस्त के साथ बातचीत कर रहे हैं। आप उनके पूरे वाक्य के खत्म होने का इंतज़ार नहीं करते, सोचने के लिए रुकते नहीं, और फिर बोलना शुरू करते हैं। इसके बजाय, आप उनके बोलते समय उन्हें सुनते हैं, सिर हिलाते हैं, आँखों से संपर्क बनाए रखते हैं, आप शायद "रुको, सच में?" कहकर या हँसकर उन्हें बीच में टोक भी देते हैं, और आप उनके बोलने के दौरान ही अपना जवाब तैयार करना शुरू कर देते हैं। यह फुल-डुप्लेक्स (full-duplex) इंटरैक्शन है: सब कुछ एक साथ होता है, ओवरलैप होता है और स्वाभाविक रूप से बहता है।
लंबे समय से, कंप्यूटर इस मामले में बहुत खराब रहे हैं। वे आमतौर पर एक रिले रेस (relay race) की तरह काम करते हैं जिसमें अलग-अलग धावक होते हैं:
- धावक A आपकी आवाज़ सुनता है और उसे टेक्स्ट में बदल देता है (स्पीच-टू-टेक्स्ट)।
- धावक B उस टेक्स्ट को पढ़ता है और जवाब के बारे में सोचता है (दिमाग)।
- धावक C उस जवाब को वापस आवाज़ में बदल देता है (टेक्स्ट-टू-स्पीच)।
- धावक D उस आवाज़ को लेता है और शब्दों के साथ तालमेल बिठाने के लिए एक चेहरा एनिमेट करता है (वीडियो जनरेशन)।
जब तक जवाब आपके कानों तक पहुँचता है, तब तक काफी देरी हो जाती है, और कंप्यूटर अक्सर आपके चेहरे के भावों को मिस कर देता है या आपको अजीब तरह से बीच में टोक देता है क्योंकि "धावक" एक-दूसरे से इतनी तेज़ी से बात नहीं कर पाते।
Wan-Streamer एक नए प्रकार का AI है जो एक रिले टीम के बजाय एक एकल, सुपर-फास्ट इंसान बनने की कोशिश करता है। यह कैसे काम करता है, यहाँ सरल उपमाओं (analogies) का उपयोग किया गया है:
1. "एक व्यक्ति वाला बैंड" बनाम "ऑर्केस्ट्रा"
अधिकांश वर्तमान सिस्टम एक ऑर्केस्ट्रा की तरह हैं जहाँ वायलिन वादक, ड्रमर और गायक अलग-अलग कमरों में होते हैं। उन्हें अपना हिस्सा शुरू करने के लिए एक संकेत का इंतज़ार करना पड़ता है। यदि ड्रमर धीमा है, तो पूरा गाना खिंच जाता है।
Wan-Streamer एक एक व्यक्ति वाले बैंड (one-person band) की तरह है जो एक साथ गिटार बजाता है, गाता है और ताल बनाए रखता है। इसमें सुनने, सोचने, बोलने या चेहरा हिलाने के लिए अलग-अलग मॉड्यूल नहीं हैं। यह एक एकल "दिमाग" (एक ट्रांसफार्मर मॉडल) है जो आपके वीडियो को देखता है, आपकी आवाज़ सुनता है, और आपके टेक्स्ट को पढ़ता है और फिर तुरंत तय करता है कि क्या कहना है, कैसे बोलना है, और अपना चेहरा कैसे हिलाना है—यह सब एक साथ करता है।
2. "विचारक" और "कलाकार"
इसे अविश्वसनीय रूप से तेज़ बनाने के लिए, रचनाकारों ने काम को दो भूमिकाओं में विभाजित किया है जो एक कंडक्टर और एक संगीतकार की तरह पूर्ण तालमेल में काम करते हैं:
- विचारक (The Thinker): यह हिस्सा आपको सुनता है, आपकी बात समझता है, और प्रतिक्रिया की योजना बनाता है। यह एक कंडक्टर की तरह है जो अगले नोट का निर्णय ले रहा है।
- कलाकार (The Performer): यह हिस्सा योजना को लेता है और वास्तव में ध्वनि और वीडियो बनाता है। यह एक संगीतकार की तरह है जो वाद्य यंत्र बजा रहा है।
यहाँ असली जादू है: जब कलाकार आपकी वर्तमान प्रतिक्रिया के लिए वीडियो और ऑडियो बना रहा होता है, तब विचारक पहले से ही आपके अगले वाक्य को सुन रहा होता है और अगली प्रतिक्रिया की योजना बना रहा होता है। वे इतनी तेज़ी से एक-दूसरे को काम सौंपते हैं कि कोई प्रतीक्षा समय नहीं बचता। यह सिस्टम को बिना रुके वास्तविक समय की बातचीत बनाए रखने में सक्षम बनाता है।
3. "लाइव स्ट्रीम" बनाम "एडिट की गई फिल्म"
पुराने AI वीडियो सिस्टम एक फिल्म को एडिट करने की तरह हैं: वे पूरे सीन के फिल्माए जाने का इंतज़ार करते हैं, फिर उसे जोड़ते हैं। यदि आप एक लाइन बदलना चाहते हैं, तो उन्हें पूरी चीज़ को फिर से एडिट करना पड़ता है।
Wan-Streamer एक लाइव न्यूज़ ब्रॉडकास्ट की तरह है। यह होते ही फ्रेम-दर-फ्रेम वीडियो जेनरेट करता है।
- यदि आप बोलना बंद कर देते हैं, तो AI फ्रीज़ नहीं होता; वह "साँस लेता" रहता है, पलकें झपकाता है, और आपकी ओर देखता रहता है, ठीक वैसे ही जैसे एक वास्तविक व्यक्ति आपके जारी रखने का इंतज़ार करता है।
- यदि आप AI को बीच में टोकते हैं, तो वह तुरंत रुक जाता है और आपकी बात सुनता है, बजाय इसके कि वह अपनी बात पूरी करने के लिए "लॉक इन" रहे।
- यह आपके चेहरे के भावों पर तुरंत प्रतिक्रिया करता है। यदि आप भ्रमित दिखते हैं, तो यह एक ही सेकंड के भीतर धीमा हो सकता है या खुद को समझा सकता है।
4. यह कितना तेज़ है?
पेपर का दावा है कि यह सिस्टम अविश्वसनीय रूप से तेज़ है:
- AI के "दिमाग" का समय: AI को आपको सुनने, सोचने और प्रतिक्रिया उत्पन्न करना शुरू करने में लगभग 200 मिलीसेकंड (0.2 सेकंड) लगते हैं। यह एक इंसान की पलक झपकने से भी तेज़ है।
- कुल बातचीत का समय: जब आप इंटरनेट द्वारा सिग्नल को आगे-पीछे भेजने में लगने वाले समय (लगभग 350 ms) को जोड़ते हैं, तो कुल देरी लगभग 550 मिलीसेकंड (0.55 सेकंड) होती है।
इसे समझने के लिए: यदि आप एक वीडियो कॉल पर अपने दोस्त से बात कर रहे हैं जिसमें 0.5 सेकंड की देरी है, तो आप इसे मुश्किल से ही महसूस करेंगे। आप उन्हें टोक सकते हैं, और वे स्वाभाविक रूप से प्रतिक्रिया देंगे।
यह क्या खास बनाता है?
पेपर इस बात पर ज़ोर देता है कि Wan-Streamer केवल विभिन्न उपकरणों को आपस में "जोड़ता" नहीं है। इसने शुरुआत से ही सुनना, बोलना और अपना चेहरा हिलाना एक साथ सीखा है।
- कोई "टेक्स्ट मिडिलमैन" नहीं: इसे आपकी आवाज़ को टेक्स्ट में बदलने और फिर वापस आवाज़ में बदलने की ज़रूरत नहीं है। यह सीधे ध्वनि और वीडियो को समझता है।
- स्वाभाविक लय: क्योंकि यह उन वास्तविक बातचीत से सीखता है जहाँ लोग एक-दूसरे की बात काटते हैं, यह जानता है कि कब रुकना है, कब सिर हिलाना है, और कब बीच में आना है। यह रोबोटिक या बेजान नहीं लगता।
निष्कर्ष
Wan-Streamer एक डिजिटल मानव का प्रोटोटाइप है जो आपके साथ वास्तविक समय में, आमने-सामने बातचीत कर सकता है। यह केवल सवालों के जवाब नहीं देता; यह आपको देखता है, आपको सुनता है, और चेहरे और आवाज़ के साथ ऐसी प्रतिक्रिया देता है जो जीवित महसूस होती है, और यह सब बातचीत के प्रवाह को बिना किसी अजीब ठहराव के बनाए रखता है। यह ऐसे AI की ओर एक कदम है जो कंप्यूटर प्रोग्राम के बजाय एक ऐसे व्यक्ति जैसा महसूस होता है जो आपके सामने मेज पर बैठा है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।