← नवीनतम पेपर
💻 computer science

Long-Horizon Streaming Video Generation via Hybrid Attention with Decoupled Distillation

यह शोध पत्र हाइब्रिड फोर्सिंग (Hybrid Forcing) का प्रस्ताव करता है, जो एक नवीन ढांचा है जो हल्के लीनियर टेम्पोरल अटेंशन (linear temporal attention), ब्लॉक-स्पार्स लोकल अटेंशन (block-sparse local attention) और एक डिकपल्ड डिस्टिलेशन स्ट्रैटेजी (decoupled distillation strategy) को जोड़ता है ताकि अत्याधुनिक प्रदर्शन और नगण्य कम्प्यूटेशनल ओवरहेड के साथ रीयल-टाइम, अनबाउंड स्ट्रीमिंग वीडियो जनरेशन को सक्षम किया जा सके।

मूल लेखक: Ruibin Li, Tao Yang, Fangzhou Ai, Tianhe Wu, Shilei Wen, Bingyue Peng, Lei Zhang

प्रकाशित 2026-04-15
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Ruibin Li, Tao Yang, Fangzhou Ai, Tianhe Wu, Shilei Wen, Bingyue Peng, Lei Zhang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप अपने एक दोस्त को कहानी सुनाने की कोशिश कर रहे हैं, लेकिन आपको केवल पिछले कुछ वाक्यों के बारे में ही याद रहता है जो आपने अभी बोले हैं। यदि कहानी छोटी है, तो यह ठीक है। लेकिन यदि आप एक 30 मिनट की महागाथा सुनाने की कोशिश करते हैं, तो अंततः आप भूल जाएंगे कि कहानी कैसे शुरू हुई थी। पात्रों के नाम बदल सकते हैं, सेटिंग किसी दूसरे ग्रह में जा सकती है, या कथानक का कोई अर्थ नहीं रह जाएगा क्योंकि आपने संदर्भ खो दिया है।

यह बिल्कुल वही समस्या है जिसका सामना कंप्यूटर लंबे वीडियो बनाने के दौरान करते हैं। वे छोटे क्लिप बनाने में माहिर हैं, लेकिन जैसे-जैसे वीडियो लंबा होता जाता है, वे शुरुआत को "भूल" जाते हैं, जिससे अजीबोगली सी गड़बड़ियाँ और टूटी हुई कहानियाँ बनने लगती हैं।

आपके द्वारा साझा किया गया पेपर एक नई विधि पेश करता है जिसे Hybrid Forcing कहा जाता है, जो इस समस्या को हल करता है। यह कैसे काम करता है, यहाँ सरल उपमाओं के साथ समझाया गया है:

1. समस्या: "छोटी याददाश्त" बनाम "भारी बैग"

वर्तमान वीडियो AI मॉडल Sliding Window Attention नामक तकनीक का उपयोग करते हैं।

  • उपमा: कल्पना कीजिए कि आप एक किताब पढ़ रहे हैं, लेकिन आप अपने हाथ में केवल अंतिम 5 पृष्ठ ही पकड़ सकते हैं। जैसे ही आप पृष्ठ 6 पढ़ते हैं, आपको जगह बनाने के लिए पृष्ठ 1 को फेंकना पड़ता है।
  • परिणाम: यदि आप एक रहस्य उपन्यास लिख रहे हैं, तो जब तक आप पृष्ठ 100 पर पहुँचते हैं, तब तक आप पृष्ठ 1 के सुराग फेंक चुके होते हैं। कहानी बिखर जाती है।
  • विकल्प: कुछ मॉडल पहले पृष्ठ को हमेशा के लिए रखने की कोशिश करते हैं (एक बुकमार्क की तरह)। लेकिन यह पृष्ठ 100 पढ़ते समय किताब के कवर को घूरने जैसा है; आप शुरुआत को याद रखते हैं, लेकिन आप बीच में हुई सभी महत्वपूर्ण घटनाओं को मिस कर देते हैं।

2. समाधान: "हाइब्रिड" मस्तिष्क

लेखकों ने एक ऐसा सिस्टम बनाया है जो एक ऐसे इंसान की तरह काम करता है जिसकी याददाश्त फोटोग्राफिक है लेकिन दिमाग बहुत तेज़ है। उन्होंने दो तरीकों को मिलाया है:

ट्रिक A: "सारांश नोटबुक" (Linear Temporal Attention)

शुरुआत से हर एक फ्रेम (पृष्ठ) को याद रखने के बजाय, AI एक संक्षिप्त सारांश रखता है।

  • उपमा: कल्पना कीजिए कि आप एक डायरी लिख रहे हैं। इसके बजाय कि आप 10 साल पहले के अपने हर विचार को लिखें, आप उस वर्ष का एक पन्ने का सारांश लिखते हैं। जब आपको 10 साल पहले की किसी चीज़ को याद करने की आवश्यकता होती है, तो आप बस वह सारांश पढ़ लेते हैं।
  • यह कैसे मदद करता है: AI दूर के अतीत में जो कुछ भी हुआ है, उसका एक छोटा, लगातार अपडेट होने वाला "नोट" रखता है। इसमें लगभग कोई मेमोरी स्पेस नहीं लगता लेकिन यह सुनिश्चित करता है कि AI वीडियो की मुख्य कहानी कभी न भूले।

ट्रिक B: "स्पॉटलाइट" (Block-Sparse Attention)

हाल के अतीत (पिछले कुछ सेकंड) के लिए, AI को सब कुछ देखने की आवश्यकता नहीं है।

  • उपमा: कल्पना कीजिए कि आप एक भीड़ भरे कमरे में हैं। आपको यह जानने के लिए कि क्या हो रहा है, हर एक व्यक्ति को घूरने की ज़रूरत नहीं है। आपको बस उन लोगों पर ध्यान केंद्रित करने की आवश्यकता है जो आपसे बात कर रहे हैं या जो अजीब तरह से हिल रहे हैं।
  • यह कैसे मदद करता है: AI हाल के वीडियो के उबाऊ, दोहराव वाले हिस्सों को अनदेखा करने के लिए एक "स्पॉटलाइट" का उपयोग करता है और केवल महत्वपूर्ण, बदलते हिस्सों पर ध्यान देता है। यह कंप्यूटर को बहुत तेज़ी से काम करने में मदद करता है।

3. प्रशिक्षण रणनीति: "चलना सीखें, फिर दौड़ना"

AI को यह सब एक साथ करने के लिए प्रशिक्षित करना कठिन है। यदि आप इसे एक साथ अतीत को याद रखने और तेज़ चलने के लिए सिखाने की कोशिश करते हैं, तो यह भ्रमित हो जाता है और बुरी आदतें सीख लेता है (जैसे एक छात्र जो जोड़ सीखना जारी रखते हुए कैलकुलस सीखने की कोशिश कर रहा हो)।

लेखकों ने Decoupled Distillation रणनीति का उपयोग किया है:

  • चरण 1 (कक्षा): पहले, वे AI को एक मानक, धीमी विधि का उपयोग करके कहानी और पात्रों को समझने के लिए सिखाते हैं। वे इसे गति या लंबी अवधि की स्मृति की चिंता किए बिना वीडियो की "शब्दावली" सीखने देते हैं।
  • चरण 2 (परीक्षा): एक बार जब AI बुनियादी बातें समझ जाता है, तो वे "सारांश नोटबुक" और "स्पốtलाइट" को चालू कर देते हैं। अब, AI यह सीखता है कि चरण 1 में बनी ठोस नींव का उपयोग करके तेज़ और लंबी कहानी को कैसे याद रखा जाए।

4. परिणाम: वास्तविक समय, अनंत वीडियो

इन ट्रिक्स के कारण, नया मॉडल एक सिंगल शक्तिशाली कंप्यूटर चिप पर 29.5 फ्रेम्स प्रति सेकंड (जो वास्तविक समय से भी तेज़ है!) की दर से वीडियो बना सकता है।

  • जादू: यह एक ऐसा वीडियो बना सकता है जो सैद्धांतिक रूप से अनंत लंबाई का हो। आप इसे 10 मिनट की फिल्म बनाने के लिए कह सकते हैं, और यह पात्रों की निरंतरता और कहानी की तर्कसंगतता बनाए रखेगा, बिना कंप्यूटर की मेमोरी खत्म हुए या वीडियो के ग्लिच से भरा होने के।

सारांश

Hybrid Forcing वीडियो AI को एक फोटोग्राफिक मेमोरी (सारांश नोटबुक के माध्यम से) और एक सुपर-फास्ट फोकस (स्पॉटलाइट के माध्यम से) देने जैसा है, जबकि इसे दो चरणों में सिखाया जाता है ताकि यह अभिभूत न हो जाए। परिणाम एक ऐसा वीडियो जनरेटर है जो इंसानी कहानीकार की तरह तुरंत लंबी, सुसंगत कहानियाँ सुना सकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →