← नवीनतम पेपर
🤖 AI

Wan-Streamer v0.1: End-to-end Real-time Interactive Foundation Models

Wan-Streamer एक नेटिव-स्ट्रीमिंग, एंड-टू-एंड इंटरैक्टिव फाउंडेशन मॉडल है जो लगभग 200 ms मॉडल-साइड लेटेंसी के साथ सब-सेकंड, फुल-डुप्लेक्स मल्टीमॉडल संचार प्राप्त करने के लिए एक ही ट्रांसफॉर्मर के भीतर भाषा, ऑडियो और वीडियो प्रोसेसिंग को एकीकृत करता है, जो पारंपरिक कैस्केडेड सिस्टम में निहित त्रुटि संचय और देरी को समाप्त करता है।

मूल लेखक: Lianghua Huang, Zhifan Wu, Wei Wang, Yupeng Shi, Mengyang Feng, Junjie He, Chenwei Xie, Yu Liu, Jingren Zhou, Ang Wang, Bang Zhang, Baole Ai, Chen Liang, Cheng Yu, Chongyang Zhong, Jinwei Qi, Kai Zhu
प्रकाशित 2026-06-25
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Lianghua Huang, Zhifan Wu, Wei Wang, Yupeng Shi, Mengyang Feng, Junjie He, Chenwei Xie, Yu Liu, Jingren Zhou, Ang Wang, Bang Zhang, Baole Ai, Chen Liang, Cheng Yu, Chongyang Zhong, Jinwei Qi, Kai Zhu, Pandeng Li, Peng Zhang, Wenyuan Zhang, Xinhua Cheng, Yitong Huang, Yun Zheng, Zoubin Bi

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप अपने किसी दोस्त के साथ बातचीत कर रहे हैं। आप उनके पूरे वाक्य के खत्म होने का इंतज़ार नहीं करते, सोचने के लिए रुकते नहीं, और फिर बोलना शुरू करते हैं। इसके बजाय, आप उनके बोलते समय उन्हें सुनते हैं, सिर हिलाते हैं, आँखों से संपर्क बनाए रखते हैं, आप शायद "रुको, सच में?" कहकर या हँसकर उन्हें बीच में टोक भी देते हैं, और आप उनके बोलने के दौरान ही अपना जवाब तैयार करना शुरू कर देते हैं। यह फुल-डुप्लेक्स (full-duplex) इंटरैक्शन है: सब कुछ एक साथ होता है, ओवरलैप होता है और स्वाभाविक रूप से बहता है।

लंबे समय से, कंप्यूटर इस मामले में बहुत खराब रहे हैं। वे आमतौर पर एक रिले रेस (relay race) की तरह काम करते हैं जिसमें अलग-अलग धावक होते हैं:

  1. धावक A आपकी आवाज़ सुनता है और उसे टेक्स्ट में बदल देता है (स्पीच-टू-टेक्स्ट)।
  2. धावक B उस टेक्स्ट को पढ़ता है और जवाब के बारे में सोचता है (दिमाग)।
  3. धावक C उस जवाब को वापस आवाज़ में बदल देता है (टेक्स्ट-टू-स्पीच)।
  4. धावक D उस आवाज़ को लेता है और शब्दों के साथ तालमेल बिठाने के लिए एक चेहरा एनिमेट करता है (वीडियो जनरेशन)।

जब तक जवाब आपके कानों तक पहुँचता है, तब तक काफी देरी हो जाती है, और कंप्यूटर अक्सर आपके चेहरे के भावों को मिस कर देता है या आपको अजीब तरह से बीच में टोक देता है क्योंकि "धावक" एक-दूसरे से इतनी तेज़ी से बात नहीं कर पाते।

Wan-Streamer एक नए प्रकार का AI है जो एक रिले टीम के बजाय एक एकल, सुपर-फास्ट इंसान बनने की कोशिश करता है। यह कैसे काम करता है, यहाँ सरल उपमाओं (analogies) का उपयोग किया गया है:

1. "एक व्यक्ति वाला बैंड" बनाम "ऑर्केस्ट्रा"

अधिकांश वर्तमान सिस्टम एक ऑर्केस्ट्रा की तरह हैं जहाँ वायलिन वादक, ड्रमर और गायक अलग-अलग कमरों में होते हैं। उन्हें अपना हिस्सा शुरू करने के लिए एक संकेत का इंतज़ार करना पड़ता है। यदि ड्रमर धीमा है, तो पूरा गाना खिंच जाता है।

Wan-Streamer एक एक व्यक्ति वाले बैंड (one-person band) की तरह है जो एक साथ गिटार बजाता है, गाता है और ताल बनाए रखता है। इसमें सुनने, सोचने, बोलने या चेहरा हिलाने के लिए अलग-अलग मॉड्यूल नहीं हैं। यह एक एकल "दिमाग" (एक ट्रांसफार्मर मॉडल) है जो आपके वीडियो को देखता है, आपकी आवाज़ सुनता है, और आपके टेक्स्ट को पढ़ता है और फिर तुरंत तय करता है कि क्या कहना है, कैसे बोलना है, और अपना चेहरा कैसे हिलाना है—यह सब एक साथ करता है।

2. "विचारक" और "कलाकार"

इसे अविश्वसनीय रूप से तेज़ बनाने के लिए, रचनाकारों ने काम को दो भूमिकाओं में विभाजित किया है जो एक कंडक्टर और एक संगीतकार की तरह पूर्ण तालमेल में काम करते हैं:

  • विचारक (The Thinker): यह हिस्सा आपको सुनता है, आपकी बात समझता है, और प्रतिक्रिया की योजना बनाता है। यह एक कंडक्टर की तरह है जो अगले नोट का निर्णय ले रहा है।
  • कलाकार (The Performer): यह हिस्सा योजना को लेता है और वास्तव में ध्वनि और वीडियो बनाता है। यह एक संगीतकार की तरह है जो वाद्य यंत्र बजा रहा है।

यहाँ असली जादू है: जब कलाकार आपकी वर्तमान प्रतिक्रिया के लिए वीडियो और ऑडियो बना रहा होता है, तब विचारक पहले से ही आपके अगले वाक्य को सुन रहा होता है और अगली प्रतिक्रिया की योजना बना रहा होता है। वे इतनी तेज़ी से एक-दूसरे को काम सौंपते हैं कि कोई प्रतीक्षा समय नहीं बचता। यह सिस्टम को बिना रुके वास्तविक समय की बातचीत बनाए रखने में सक्षम बनाता है।

3. "लाइव स्ट्रीम" बनाम "एडिट की गई फिल्म"

पुराने AI वीडियो सिस्टम एक फिल्म को एडिट करने की तरह हैं: वे पूरे सीन के फिल्माए जाने का इंतज़ार करते हैं, फिर उसे जोड़ते हैं। यदि आप एक लाइन बदलना चाहते हैं, तो उन्हें पूरी चीज़ को फिर से एडिट करना पड़ता है।

Wan-Streamer एक लाइव न्यूज़ ब्रॉडकास्ट की तरह है। यह होते ही फ्रेम-दर-फ्रेम वीडियो जेनरेट करता है।

  • यदि आप बोलना बंद कर देते हैं, तो AI फ्रीज़ नहीं होता; वह "साँस लेता" रहता है, पलकें झपकाता है, और आपकी ओर देखता रहता है, ठीक वैसे ही जैसे एक वास्तविक व्यक्ति आपके जारी रखने का इंतज़ार करता है।
  • यदि आप AI को बीच में टोकते हैं, तो वह तुरंत रुक जाता है और आपकी बात सुनता है, बजाय इसके कि वह अपनी बात पूरी करने के लिए "लॉक इन" रहे।
  • यह आपके चेहरे के भावों पर तुरंत प्रतिक्रिया करता है। यदि आप भ्रमित दिखते हैं, तो यह एक ही सेकंड के भीतर धीमा हो सकता है या खुद को समझा सकता है।

4. यह कितना तेज़ है?

पेपर का दावा है कि यह सिस्टम अविश्वसनीय रूप से तेज़ है:

  • AI के "दिमाग" का समय: AI को आपको सुनने, सोचने और प्रतिक्रिया उत्पन्न करना शुरू करने में लगभग 200 मिलीसेकंड (0.2 सेकंड) लगते हैं। यह एक इंसान की पलक झपकने से भी तेज़ है।
  • कुल बातचीत का समय: जब आप इंटरनेट द्वारा सिग्नल को आगे-पीछे भेजने में लगने वाले समय (लगभग 350 ms) को जोड़ते हैं, तो कुल देरी लगभग 550 मिलीसेकंड (0.55 सेकंड) होती है।

इसे समझने के लिए: यदि आप एक वीडियो कॉल पर अपने दोस्त से बात कर रहे हैं जिसमें 0.5 सेकंड की देरी है, तो आप इसे मुश्किल से ही महसूस करेंगे। आप उन्हें टोक सकते हैं, और वे स्वाभाविक रूप से प्रतिक्रिया देंगे।

यह क्या खास बनाता है?

पेपर इस बात पर ज़ोर देता है कि Wan-Streamer केवल विभिन्न उपकरणों को आपस में "जोड़ता" नहीं है। इसने शुरुआत से ही सुनना, बोलना और अपना चेहरा हिलाना एक साथ सीखा है।

  • कोई "टेक्स्ट मिडिलमैन" नहीं: इसे आपकी आवाज़ को टेक्स्ट में बदलने और फिर वापस आवाज़ में बदलने की ज़रूरत नहीं है। यह सीधे ध्वनि और वीडियो को समझता है।
  • स्वाभाविक लय: क्योंकि यह उन वास्तविक बातचीत से सीखता है जहाँ लोग एक-दूसरे की बात काटते हैं, यह जानता है कि कब रुकना है, कब सिर हिलाना है, और कब बीच में आना है। यह रोबोटिक या बेजान नहीं लगता।

निष्कर्ष

Wan-Streamer एक डिजिटल मानव का प्रोटोटाइप है जो आपके साथ वास्तविक समय में, आमने-सामने बातचीत कर सकता है। यह केवल सवालों के जवाब नहीं देता; यह आपको देखता है, आपको सुनता है, और चेहरे और आवाज़ के साथ ऐसी प्रतिक्रिया देता है जो जीवित महसूस होती है, और यह सब बातचीत के प्रवाह को बिना किसी अजीब ठहराव के बनाए रखता है। यह ऐसे AI की ओर एक कदम है जो कंप्यूटर प्रोग्राम के बजाय एक ऐसे व्यक्ति जैसा महसूस होता है जो आपके सामने मेज पर बैठा है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →