← नवीनतम पेपर
🤖 machine learning

StreamDiffusionV2: A Streaming System for Dynamic and Interactive Video Generation

StreamDiffusionV2 एक ट्रेनिंग-फ्री, स्केलेबल पाइपलाइन है जो विषम (heterogeneous) GPU क्लस्टर्स पर अल्ट्रा-लो लेटेंसी और हाई थ्रूपुट प्राप्त करने के लिए SLO-अवेयर शेड्यूलिंग, मोशन-अवेयर कंट्रोल और पैरेलल ऑर्केस्ट्रेशन को एकीकृत करके वीडियो डिफ्यूजन मॉडल्स के साथ रीयल-टाइम इंटरैक्टिव वीडियो स्ट्रीमिंग को सक्षम बनाती है।

मूल लेखक: Tianrui Feng, Zhi Li, Shuo Yang, Haocheng Xi, Muyang Li, Xiuyu Li, Lvmin Zhang, Keting Yang, Kelly Peng, Song Han, Maneesh Agrawala, Kurt Keutzer, Akio Kodaira, Chenfeng Xu

प्रकाशित 2026-02-24
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Tianrui Feng, Zhi Li, Shuo Yang, Haocheng Xi, Muyang Li, Xiuyu Li, Lvmin Zhang, Keting Yang, Kelly Peng, Song Han, Maneesh Agrawala, Kurt Keutzer, Akio Kodaira, Chenfeng Xu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक कैनवास पर एक उत्कृष्ट कृति (masterpiece) पेंट करने की कोशिश कर रहे हैं, लेकिन आपको दर्शकों को पहला ब्रशस्ट्रोक दिखाने से पहले पूरी पेंटिंग खत्म करनी होगी। वर्तमान AI वीडियो जनरेटर इसी तरह काम करते हैं: वे पूरी फिल्म की योजना बनाते हैं, हर फ्रेम की गणना एक साथ करते हैं, और फिर उसे चलाना शुरू करते हैं। यह गुणवत्ता के लिए तो बेहतरीन है, लेकिन लाइव इंटरेक्शन के लिए बहुत खराब है।

StreamDiffusionV2 एक जादुई चित्रकार की तरह है जो आधे सेकंड से भी कम समय में आपको पहला ब्रशस्ट्रोक दिखाना शुरू कर सकता है और बिना किसी झिलमिलाहट (flickering) या कहानी के भटकने के, रीयल-टाइम में फ्रेम-दर-फ्रेम पेंटिंग जारी रख सकता है।

यहाँ बताया गया है कि उन्होंने इसे कैसे किया, कुछ रोजमर्रा के उदाहरणों का उपयोग करके:

1. समस्या: "बैचिंग" (Batching) की बाधा

पुराना तरीका (ऑफलाइन जनरेशन):
एक बेकरी की कल्पना करें जो केवल तभी ब्रेड बनाती है जब उसके पास एक पूरा ट्रक भरने के लिए पर्याप्त ऑर्डर हों। वे 100 ऑर्डर होने तक इंतजार करते हैं, उन सभी को एक साथ पकाते हैं, और फिर उन्हें डिलीवर करते हैं। यह बेकरी के लिए कुशल है (उच्च थ्रूपुट), लेकिन यदि आप एक अकेला पाव (loaf) ऑर्डर करते हैं, तो आपको घंटों इंतजार करना पड़ता है।

  • AI के संदर्भ में: वर्तमान वीडियो मॉडल एक साथ 80+ फ्रेम के बड़े हिस्से को प्रोसेस करने के लिए इंतजार करते हैं। इससे वीडियो शुरू होने से पहले भारी देरी होती है (Time-to-First-Frame)।

StreamDiffusionV2 का तरीका:
यह सिस्टम एक फूड ट्रक की तरह है जो आपके ऑर्डर देते ही एक बर्गर बनाना शुरू कर देता है। यह भीड़ का इंतजार नहीं करता। यह इस आधार पर अपनी गति को अनुकूलित करता है कि अभी लाइन में कितने लोग हैं।

  • नवाचार: वे एक "SLO-aware Batching Scheduler" का उपयोग करते हैं। AI को बड़े बैच के लिए मजबूर करने के बजाय, यह गतिशील रूप से निर्णय लेता है: "ठीक है, स्ट्रीम को चालू रखने के लिए मैं अभी 2 फ्रेम प्रोसेस करूँगा, फिर अगर कंप्यूटर खाली है तो 4 फ्रेम।" यह सुनिश्चित करता है कि पहला फ्रेम तुरंत (0.5 सेकंड से कम में) पहुंचे और उसके बाद का हर फ्रेम समय पर मिले।

2. समस्या: "भटकती" हुई कहानी (Drifting Story)

पुराना तरीका:
एक कहानीकार की कल्पना करें जो 10 घंटे तक कहानी सुना रहा है। यदि वह अपने नोट्स नहीं देखता है, तो 5वें घंटे तक, मुख्य पात्र शायद अपना नाम भूल गया होगा, या सेटिंग जंगल से बदलकर रेगिस्तान हो गई होगी। इसे टेम्पोरल ड्रिफ्ट (temporal drift) कहा जाता है।

  • AI के संदर्भ में: मानक वीडियो मॉडल लंबे स्ट्रीम के दौरान भ्रमित हो जाते हैं। "सिंक टोकन्स" (जो AI के मेमोरी एंकर के रूप में कार्य करते हैं) पुराने पड़ जाते हैं, और वीडियो अजीब या धुंधला दिखने लगता है।

StreamDiffusionV2 का तरीका:
इस सिस्टम के पास कहानीकार के बगल में बैठा एक स्मार्ट एडिटर है। हर कुछ मिनटों में, एडिटर फुसफुसाता है, "हे, याद रखना कि पात्र ने लाल टोपी पहनी है। सुनिश्चित करें कि हम इसे बनाए रखें।"

  • नवाचार: वे Adaptive Sink Tokens और RoPE Refresh का उपयोग करते हैं। सिस्टम लगातार अपने "मेमोरी एंकरों" को वर्तमान प्रॉम्प्ट और विजुअल कॉन्टेक्स्ट के अनुसार अपडेट करता रहता है। यदि दृश्य बदलता है, तो सिस्टम अपने आंतरिक समय को रीसेट कर देता है ताकि वह समय में पीछे न छूट जाए। यह वीडियो को केवल सेकंडों के लिए नहीं, बल्कि घंटों तक स्थिर रखता है।

3. समस्या: "धुंधली" तेज़ एक्शन (Blurry Fast Action)

पुराना तरीका:
एक रेसिंग कार की फोटो लेने की कल्पना करें। यदि आपके कैमरा सेटिंग्स एक धीरे चलते फूल के लिए ट्यून की गई हैं, तो कार एक धुंधले धब्बे जैसी दिखेगी।

  • AI के संदर्भ में: अधिकांश AI मॉडल धीमी, शांत वीडियो पर प्रशिक्षित होते हैं। जब आप उनसे तेज़ फाइट सीन या रेसिंग कार बनाने के लिए कहते हैं, तो वे इसे बहुत अधिक "स्मूथ" करने की कोशिश करते हैं, जिससे इमेज में घोस्टिंग या टीयरिंग (जहाँ इमेज टूट जाती है) होने लगती है।

StreamDiffusionV2 का तरीका:
इस सिस्टम में कैमरे के अंदर एक मोशन सेंसर लगा हुआ है।

  • नवाचार: वे एक Motion-Aware Noise Controller का उपयोग करते हैं।
    • यदि दृश्य धीमा है (कोई व्यक्ति बात कर रहा है), तो AI "आक्रामक" हो जाता है और बारीक विवरण जोड़ता है ताकि यह स्पष्ट दिखे।
    • यदि दृश्य तेज़ है (एक कार तेज़ी से गुजर रही है), तो AI "रूढ़िवादी" हो जाता है, चीजों को बस इतना स्मूथ करता है कि इमेज टूटे नहीं, लेकिन मोशन स्पष्ट रहे। यह एक फोटोग्राफर की तरह है जो विषय की गति के आधार पर स्वचालित रूप से लेंस बदल लेता है।

4. समस्या: कई GPUs के साथ "ट्रैफिक जाम"

पुराना तरीका:
4 निर्माण टीमों (construction crews) के साथ एक घर बनाने की कल्पना करें। यदि टीम 1 को दीवारों के निर्माण से पहले टीम 2 के नींव (foundation) पूरा करने का इंतजार करना पड़ता है, और उन सभी को साइट पर निर्देश चिल्लाकर देने पड़ते हैं, तो वे काम करने से ज्यादा इंतजार करने में समय बिताते हैं।

  • AI के संदर्भ में: कई GPUs (कंप्यूटरों) का उपयोग करने से आमतौर पर संचार में देरी (communication delays) होती है। "सीक्वेंस पैरेललिज्म" (समय के आधार पर काम को विभाजित करना) चिप्स के बीच बहुत अधिक बातचीत पैदा करता है, जिससे सब कुछ धीमा हो जाता है।

StreamDiffusionV2 का तरीका:
उन्होंने एक कन्वेयर बेल्ट असेंबली लाइन बनाई है।

  • नवाचार: वे पाइपलाइन ऑर्केस्ट्रेशन (Pipeline Orchestration) का उपयोग करते हैं। पूरे घर के बनने का इंतजार करने के बजाय, टीम 1 दीवारें पेंट करती है जबकि टीम 2 छत डालती है, और टीम 3 खिड़कियां लगाती है, और यह सब एक ही समय में होता है। वे एक ब्लॉक शेड्यूलर (Block Scheduler) का भी उपयोग करते हैं ताकि कोई भी टीम अगले काम के इंतजार में खाली न बैठी रहे। यह उन्हें 4 शक्तिशाली GPUs का उपयोग करके डेटा ट्रांसफर के "ट्रैफिक जाम" के बिना लगभग 4 गुना गति प्राप्त करने की अनुमति देता है।

परिणाम: आपको इसकी परवाह क्यों करनी चाहिए?

इससे पहले, उच्च-गुणवत्ता वाला AI वीडियो एक लग्जरी कार की तरह था: महंगी, शुरू होने में धीमी और रीयल-टाइम में चलाने में कठिन।

StreamDiffusionV2 इसे एक विश्वसनीय, हाई-स्पीड ट्रेन में बदल देता है:

  • गति: यह 0.5 सेकंड में वीडियो शुरू कर देता है (पलक झपकने से भी तेज़)।
  • प्रदर्शन: यह मानक हाई-एंड कंप्यूटरों पर 58 से 64 फ्रेम प्रति सेकंड (स्मूथ, सिनेमैटिक क्वालिटी) जेनरेट कर सकता है।
  • पहुंच: यह एक शक्तिशाली कंप्यूटर से लेकर विशाल सर्वर फार्म तक, सब कुछ पर काम करता है, जिसका अर्थ है कि एक अकेला यूट्यूबर और एक बड़ी स्ट्रीमिंग प्लेटफॉर्म दोनों इसका उपयोग कर सकते हैं।

संक्षेप में, उन्होंने AI वीडियो जनरेशन को इंस्टेंट, स्टेबल और लाइव टीवी के लिए पर्याप्त तेज़ बनाने का तरीका खोज लिया है, जो इंटरैक्टिव वर्चुअल होस्ट, रीयल-टाइम गेम स्ट्रीमिंग और इंस्टेंट वीडियो एडिटिंग के द्वार खोलता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →