← नवीनतम पेपर
🤖 AI

Fast Autoregressive Video Diffusion and World Models with Temporal Cache Compression and Sparse Attention

यह शोध पत्र FAST-AR को प्रस्तुत करता है, जो एक प्रशिक्षण-मुक्त (training-free) ढांचा है जो टेम्पोरल कैश्स (temporal caches) को संकुचित करके और अनुमानित निकटतम पड़ोसी मिलान (approximate nearest neighbor matching) के माध्यम से अटेंशन को विरल (sparsify) करके ऑटोरेग्रेसिव वीडियो डिफ्यूजन और वर्ल्ड मॉडल्स को तेज़ करता है, जिससे दृश्य गुणवत्ता को बनाए रखते हुए स्थिर मेमोरी उपयोग के साथ 5-10 गुना की गति प्राप्त होती है।

मूल लेखक: Dvir Samuel, Issar Tzachor, Matan Levy, Michael Green, Gal Chechik, Rami Ben-Ari

प्रकाशित 2026-06-15
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Dvir Samuel, Issar Tzachor, Matan Levy, Michael Green, Gal Chechik, Rami Ben-Ari

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत लंबी कहानी लिखने की कोशिश कर रहे हैं, एक बार में एक वाक्य करके। हर बार जब आप एक नया वाक्य लिखते हैं, तो आपको अपने द्वारा लिखे गए पिछले हर एक वाक्य को फिर से पढ़ना पड़ता है ताकि यह सुनिश्चित हो सके कि नया वाक्य पूरी तरह से फिट बैठता है।

AI वीडियो जनरेशन की दुनिया में, बिल्कुल ऐसा ही होता है। जैसे-जैसे AI फ्रेम दर फ्रेम वीडियो बनाता है, वह अब तक जो कुछ भी बनाया है उसका एक "मेमोरी बैंक" (जिसे KV Cache कहा जाता है) रखता है। अगला फ्रेम बनाने के लिए, AI को इस बढ़ते हुए मेमोरी बैंक को देखना पड़ता है।

समस्या क्या है? जैसे-जैसे वीडियो लंबा होता जाता है, यह मेमोरी बैंक बहुत विशाल होता जाता है। AI को अगला वाक्य लिखने के लिए बहुत सारा टेक्स्ट पढ़ना पड़ता है। यह प्रक्रिया को बनाता है:

  1. धीमा और धीमा (जैसे किसी ऐसी लाइब्रेरी में विशिष्ट शब्द खोजने की कोशिश करना जो हर सेकंड नए किताबें जोड़ती जा रही है)।
  2. अधिक महंगा (यह कंप्यूटर मेमोरी खत्म कर देता है, जैसे एक भारी होता हुआ बैकपैक जिसे ढोना मुश्किल हो जाए)।

यह पेपर इस समस्या को ठीक करने के लिए FAST-AR नामक एक नई विधि पेश करता है। इसे AI को स्मार्ट शॉर्टकट का एक सेट देने के रूप में समझें ताकि वह थके बिना या अपनी याददाश्त खोए बिना लंबी कहानियाँ लिख सके।

यहाँ वे तीन "जादुွေ जादू के नुस्खे" दिए गए हैं जिनका FAST-AR उपयोग करता है:

1. "डुप्लिकेट खोजने वाला" (TempCache)

समस्या: वीडियो में, कई चीजें लंबे समय तक एक जैसी रहती हैं। यदि एक बिल्ली बगीचे में चल रही है, तो फ्रेम 100 और फ्रेम 101 में पृष्ठभूमि के पेड़ और बिल्ली के बाल लगभग एक जैसे दिखते हैं। AI एक ही चीज़ को दो बार याद करने में अपना समय बर्बाद कर रहा था।
समाधान: FAST-AR एक स्मार्ट लाइब्रेरियन की तरह काम करता है जो ध्यान देता है, "हे, मेरे पास इस पेड़ की एक परफेक्ट कॉपी पहले से ही है। मुझे इसे दोबारा लिखने की ज़रूरत नहीं है।"
यह इन "लगभग-डुप्लिकेट" क्षणों को मर्ज करके मेमोरी को कंप्रेस करता है। हर फ्रेम को याद रखने के बजाय, यह दृश्य के सार (essence) को याद रखता है। यह मेमोरी के आकार को छोटा और स्थिर रखता है, चाहे वीडियो कितना भी लंबा क्योंก็ตาม।

2. "प्रासंगिक पाठक" (AnnCA)

समस्या: कल्पना कीजिए कि आप एक बहुत लंबे प्रॉम्प्ट (एक विस्तृत विवरण) के आधार पर एक कहानी लिख रहे हैं। प्रॉम्प्ट कह सकता है, "एक बिल्ली चलती है, एक वैन गुजरती है, फिर एक कुत्ता दिखाई देता है।" जब AI वर्तमान में "बिल्ली" बना रहा होता है, तो उसे "वैन" या "कुत्ता" शब्दों को देखने की आवश्यकता नहीं होती। लेकिन पुराने AI मॉडल हर बार पूरे प्रॉम्प्ट को पढ़ते हैं, जिससे ऊर्जा बर्बाद होती है।
समाधान: FAST-AR एक "फास्ट सर्च" टूल (जिसे Approximate Nearest Neighbor कहा जाता है) का उपयोग करता है ताकि तुरंत यह पता लगाया जा सके कि: "प्रॉम्प्ट में कौन से शब्द इस विशिष्ट फ्रेम के लिए वास्तव में महत्वपूर्ण हैं?"
यह अप्रासंगिक शब्दों को अनदेखा कर देता है। यदि बिल्ली स्क्रीन पर है, तो यह केवल "बिल्ली" शब्द पर ध्यान देता है। इससे कंप्यूटिंग पावर की भारी बचत होती है।

3. "फोकस फ़िल्टर" (AnnSA)

समस्या: वीडियो के भीतर, AI हर पिक्सेल को दूसरे हर पिक्सेल के संबंध में देखता है। यह एक समय में स्टेडियम में मौजूद सभी लोगों से बात करने की कोशिश करने जैसा है, भले ही आपको केवल अपने बगल में खड़े व्यक्ति से बात करने की आवश्यकता हो।
समाधान: FAST-AR समान चीजों को एक साथ समूहबद्ध करता है। यदि एक पिक्सेल "बिल्ली" का हिस्सा है, तो वह केवल उन पिक्सेल्स से बात करता है जो बिल्ली का भी हिस्सा हैं। यह बैकग्राउंड या अन्य वस्तुओं को अनदेखा कर देता है जो उससे संबंधित नहीं हैं। यह लोगों को एक विशाल, शोर भरे भीड़ के बजाय छोटे, केंद्रित बातचीत के घेरों में रखने जैसा है।

परिणाम: एक मैराथन धावक, स्प्रिंटर नहीं

पेपर दिखाता है कि इन तीन ट्रिक्स के साथ, AI पहले की तुलना में 5 से 10 गुना तेज़ वीडियो बना सकता है।

  • पुराना तरीका: जैसे-जैसे वीडियो लंबा होता जाता है, AI धीमा और धीमा होता जाता है, और अंततः मेमोरी खत्म हो जाती है (जैसे एक धावक थककर रुक जाता है)।
  • FAST-AR तरीका: AI हमेशा एक स्थिर, तेज़ गति से दौड़ता रहता है। चाहे वीडियो 10 सेकंड का हो या 2 मिनट का, गति और मेमोरी का उपयोग समान रहता है।

संक्षेप में: FAST-AR AI को सिखाता है कि कैसे अपने पुराने नोट्स को दोबारा पढ़ना बंद करें, उन शब्दों को अनदेखा करें जिनकी उसे आवश्यकता नहीं है, और केवल उन्हीं लोगों पर ध्यान केंद्रित करें जिनसे वह बात कर रहा है। यह उसे अपनी ही मेमोरी के बोझ तले दबे बिना लंबे, उच्च-गुणवत्ता वाले वीडियो बनाने की अनुमति देता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →