← नवीनतम पेपर
💻 computer science

Vorch-Streamer: Extending Human Audio-Visual Generation to Real-Time Long-Form Streaming

Vorch-Streamer एक पोस्ट-ट्रेनिंग फ्रेमवर्क है जो मिश्रित फोर्सिंग रणनीतियों के साथ प्रशिक्षित एक कॉज़ल जनरेटर, लॉन्ग-होरिज़न स्थिरता के लिए DMD डिस्टिलेशन, और स्पीच प्लानिंग के लिए एक बाहरी लैंग्वेज मॉडल को जोड़कर रीयल-टाइम, लॉन्ग-फॉर्म टेक्स्ट-टू-ऑडियो-वीडियो स्ट्रीमिंग को सक्षम बनाता है ताकि उच्च-गति, सिंक्रोनाइज़्ड और सुसंगत अवतार जनरेशन प्राप्त किया जा सके।

मूल लेखक: Menglin Han, Yang Ding, Yulei Lu, Haoran Yu, Xin Ma, Junyi Chen, Zhangkai Ni, Lin Ma, Yaohui Wang

प्रकाशित 2026-08-07
📖 3 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Menglin Han, Yang Ding, Yulei Lu, Haoran Yu, Xin Ma, Junyi Chen, Zhangkai Ni, Lin Ma, Yaohui Wang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को कहानी सुनाना सिखाने की कोशिश कर रहे हैं। आप चाहते हैं कि वह बोलता है, अपने होंठ हिलाता है और एक ही समय में अपने चेहरे के भाव बदलता है, बिल्कुल एक वास्तविक व्यक्ति की तरह। लंबे समय तक, सबसे अच्छे रोबोट केवल बहुत छोटे क्लिप के लिए ऐसा कर सकते थे, जैसे कि 5 सेकंड का अभिवादन। वे एक ऐसे निर्देशक की तरह काम करते थे जो फिल्म करने से पहले पूरी पटकथा को देखता है, यह देखने के लिए कि आगे क्या होने वाला है। लेकिन वास्तविक दुनिया में, हमारे पास बात करना शुरू करने से पहले पूरी कहानी लिखे जाने का इंतज़ार करने का समय नहीं होता। हमें चाहिए कि रोबोट अभी बोले, केवल इस आधार पर कि उसने अब तक क्या कहा है, जबकि अपने चेहरे और आवाज़ को पूरी तरह से तालमेल में रखे। यह "रियल-टाइम स्ट्रीमिंग" की चुनौती है। समस्या यह है कि यदि कोई रोबोट पहले सेकंड में एक छोटी सी गलती करता है, तो वह गलती समय के साथ जमा होती जा सकती है, जिससे रोबोट का चेहरा अजीब दिखने लगता है या उसकी आवाज़ बातचीत के अंत तक विषय से भटक जाती है। वैज्ञानिक यह समझने की कोशिश कर रहे हैं कि कैसे इन डिजिटल अवतारों को बिना अपना मानसिक संतुलन खोए या अपनी लय बिगड़े मिनटों तक बात करने के योग्य बनाया जाए।

यहाँ आता है Vorch-Streamer, एक नया सिस्टम जो एक अत्यंत व्यवस्थित, रियल-टाइम कहानीकार की तरह कार्य करता है। पूरी पटकथा को बोलने से पहले याद करने के बजाय, Vorch-Streamer शो को बिना रुके दो मिनट से अधिक समय तक जारी रखने के लिए एक चतुर दो-भाग वाली रणनीति का उपयोग करता है। इसे एक लंबे जैम सेशन (jam session) को बजाने वाले बैंड की तरह समझें। आमतौर पर, यदि कोई संगीतकार गलत नोट बजाता है, तो बाकी गाना बिगड़ सकता है। लेकिन Vorch-Streamer के पास एक विशेष "रिहर्सल" मोड है। पहले, यह एक शिक्षक (एक पूर्व-प्रशिक्षित मॉडल जो इसे पूरी तरह से करना जानता है) द्वारा धीरे-धीरे सुधारा जाते हुए छोटे खंडों को बजाने का अभ्यास करता है। फिर, यह पूरे गाने को शुरू से अंत तक बजाने का अभ्यास करता है, लेकिन इस बार, यह अपनी पिछली गलतियों को सुनता है और उन्हें चलते-फिरते ठीक करना सीखता है, और यह सब तब होता है जब एक "कंडक्टर" (एक AI प्लानर) उसे ठीक से बताता है कि आगे कौन से शब्द बोलने हैं।

इसका परिणाम एक ऐसा डिजिटल अवतार है जो 27.12 फ्रेम प्रति सेकंड (FPS) पर वीडियो और ऑडियो को एक साथ उत्पन्न कर सकता है। इसे समझने के लिए, मानक वीडियो 24 FPS पर चलता है, जिसका अर्थ है कि यह रोबोट वास्तव में रियल-टाइम से भी तेज़ है! यह लगभग लगातार दो मिनट तक अपने चेहरे को एक ही व्यक्ति जैसा बनाए रख सकता है, अपने शब्दों के साथ अपने होंठों को सटीक समय पर हिला सकता है, और अपनी आवाज़ को स्पष्ट और सटीक रख सकता है। शोधकर्ताओं ने पाया कि बिना एक विशिष्ट "प्लानिंग" चरण के यह तय करने के कि आगे क्या कहना है, रोबोट भ्रमित हो जाता और बड़बड़ाने लगता या खुद को दोहराने लगता। इस प्लानर को जोड़कर, सिस्टम ने सफलतापूर्वक इस पहेली को हल किया है कि भविष्य को देखे बिना एक लंबी बातचीत को कैसे सुचारू रूप से जारी रखा जाए। यह सिद्ध करता है कि आप एक शक्तिशाली, धीमे रोबोट को, जो कहानी के बारे में सब कुछ जानता है, एक तेज़, लाइव परफॉर्मर में बदल सकते हैं जो केवल उतना जानता है जितना कि एक सेकंड में शो को जारी रखने के लिए आवश्यक है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →