← नवीनतम पेपर
🤖 machine learning

CHAI: CacHe Attention Inference for text2video

CHAI, कैश अटेंशन (Cache Attention) को पेश करके टेक्स्ट-टू-वीडियो डिफ्यूजन इन्फरेंस को तेज़ करता है, जो अर्थपूर्ण रूप से संबंधित प्रॉम्प्ट्स के बीच कैश किए गए लेटेंट्स (latents) का पुन: उपयोग करने के लिए एक तंत्र है, जिससे केवल 8 डिनोइजिंग स्टेप्स के साथ उच्च वीडियो गुणवत्ता बनाए रखते हुए OpenSora 1.2 की तुलना में 1.65x–3.35x की गति वृद्धि प्राप्त होती है।

मूल लेखक: Joel Mathew Cherian, Ashutosh Muralidhara Bharadwaj, Vima Gupta, Anand Padmanabha Iyer

प्रकाशित 2026-02-19
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Joel Mathew Cherian, Ashutosh Muralidhara Bharadwaj, Vima Gupta, Anand Padmanabha Iyer

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक कलाकार हैं जिसे फ्रेम-दर-फ्रेम एक मूवी सीन को शून्य से पेंट करने का काम सौंपा गया है। आप एक खाली कैनवास से शुरुआत करते हैं जो स्टैटिक नॉइज़ (जैसे टीवी पर दिखने वाला बर्फ जैसा शोर/static noise) से ढका हुआ है। एक "धूप वाले समुद्र तट" (sunny beach) की स्पष्ट तस्वीर पाने के लिए, आपको धीरे-धीरे उस शोर को हटाना होगा, और चरण-दर-चरण छवि को परिष्कृत करना होगा।

समस्या:
वर्तमान AI वीडियो जेनरेटर (जैसे OpenSora) अविश्वसनीय रूप से प्रतिभाशाली लेकिन धीमे चित्रकारों की तरह हैं। एक सुचारू, उच्च गुणवत्ता वाला वीडियो बनाने के लिए, उन्हें हर एक फ्रेम के लिए शोर को 30 से 50 बार हटाना पड़ता है। इसमें बहुत समय लगता है, जिससे इन्हें रियल-टाइम अनुप्रयोगों या त्वरित प्रोजेक्ट्स के लिए उपयोग करना कठिन हो जाता है।

पुराने समाधान:

  1. रिट्रेनिंग (Retraining): चित्रकार को तेजी से पेंट करने का एक नया तरीका सिखाना। यह बहुत महंगा है और इसमें महीनों लग जाते हैं।
  2. कदम छोड़ना (Skipping Steps): चित्रकार को कहना, "बस बीच के चरणों को छोड़ दो, मैं अंदाज़ा लगा लूँगा कि क्या होता है।" यह तेज़ है, लेकिन पेंटिंग अक्सर धुंधली, ग्लिच वाली या विकृत (melted) दिखाई देती है।

नया समाधान: CHAI (CacHe Attention Inference)
इस पेपर के लेखकों ने, CHAI, एक चतुर तरीका निकाला है। हर बार पूरी तरह से शोर (noise) से शुरुआत करने के बजाय, वे कहते हैं: "आइए देखें कि हमने पहले क्या पेंट किया था।"

CHAI कैसे काम करता है, इसे सरल उपमाओं (analogies) के माध्यम से समझाया गया है:

1. "पूरा प्रॉम्प्ट" बनाम "एंटिटी" की गलती

कल्पना कीजिए कि आपने AI को "जंगल में दौड़ते हुए एक बाघ" को चित्रित करने के लिए कहा।

  • पुराना तरीका (NIRVANA): सिस्टम आपके पूरे वाक्य को देखता है। वह पूछता है, "क्या मैंने पहले कभी जंगल में दौड़ते हुए बाघ को बनाया है?" यदि उत्तर है "नहीं, मैंने केवल गुफा में बैठे हुए बाघ को बनाया था," तो वह कहता है, "कोई मेल नहीं! शून्य से शुरुआत करो।"
  • CHAI का तरीका: CHAI अधिक स्मार्ट है। यह वाक्य को एंटिटीज (वस्तुओं और दृश्यों) में तोड़ देता है। यह पूछता है, "क्या मैंने कभी एक बाघ बनाया है?" हाँ। "क्या मैंने कभी एक जंगल बनाया है?" हाँ।
    • उपमा: यह एक शेफ की तरह है। यदि आप "स्पाइसी चिकन टैकोस" का ऑर्डर देते हैं, और शेफ ने पहले ही "स्पाइसी चिकन बरिटोस" बना चुका है, तो एक सामान्य शेफ कहेगा, "यह एक अलग व्यंजन है, मैं शून्य से शुरू करूँगा।" एक CHAI शेफ कहता है, "मेरे पास स्पाइसी चिकन सॉस और टॉर्टिला पहले से तैयार हैं! मुझे बस आकार बदलने की जरूरत है।"

2. "मैजिक अटेंशन" लेंस (Cache Attention)

यही असली राज है। आप पिछले वीडियो के "बाघ" को सीधे कॉपी-पेस्ट नहीं कर सकते, क्योंकि नए वीडियो में बाघ को दौड़ते हुए दिखने की आवश्यकता हो सकती है, न कि बैठे हुए।

CHAI एक तंत्र पेश करता है जिसे कैश अटेंशन (Cache Attention) कहा जाता है।

  • उपमा: कल्पना कीजिए कि पुराना वीडियो संदर्भ तस्वीरों का एक पुस्तकालय है। जब AI नया वीडियो बनाना शुरू करता है, तो वह केवल पूरी फोटो नहीं उठाता। इसके बजाय, वह विशेष चश्मे (अटेंशन मैकेनिज्म) पहन लेता है।
  • ये चश्मे AI को पुराने "बाघ" की फोटो देखने देते हैं और कहते हैं, "ठीक है, मैं पुराने फोटो से बाघ का आकार और बालों का रंग लूंगा, लेकिन मैं उसके 'बैठने' के पोज़ को अनदेखा कर दूंगा।"
  • यह पिछले काम से उपयोगी हिस्सों (एंटिटीज) को चुनिweise रूप से "चुनता" है और उन्हें नए निर्देशों के साथ मिला देता है। यह AI को यह समझने के शुरुआती उबाऊ और दोहराव वाले चरणों को छोड़ने की अनुमति देता है कि "एक बाघ कैसा दिखता है" और सीधे इस पर कूदने में मदद करता है कि "इस बाघ को दौड़ते हुए कैसे बनाया जाए।"

3. परिणाम: बिना धुंधलेपन के गति

क्योंकि CHAI पिछले वीडियो के "कंकाल" (वस्तुओं और दृश्यों) का पुन: उपयोग करता है, इसलिए उसे शून्य से शुरू करने की आवश्यकता नहीं होती है।

  • बेसलाइन (Baseline): एक पूर्ण वीडियो पेंट करने के लिए 30 चरणों की आवश्यकता होती है।
  • CHAI: इसे केवल 8 चरणों की आवश्यकता होती है।

उपमा:

  • मानक AI: हर बार नया कमरा बनाने के लिए जमीन से घर बनाने जैसा है। आपको हर बार कंक्रीट डालना होगा, ईंटें बिछानी होंगी और दीवारें खड़ी करनी होंगी।
  • CHAI: पहले से बने हुए दीवारों और खिड़कियों के गोदाम रखने जैसा है। यदि आपको एक नया कमरा चाहिए, तो आप पहले से बनी दीवारों को उठाते हैं (कैश्ड एंटिटीज), उन्हें असेंबल करते हैं, और अंतिम विवरणों को पेंट करते हैं। आप भारी मेहनत को छोड़ देते हैं।

यह एक बड़ी बात क्यों है?

  • गति: यह वीडियो जेनरेशन को 1.6 से 3.3 गुना तेज़ बनाता है।
  • गुणवत्ता: अन्य "तेज़" तरीकों के विपरीत, जो वीडियो को ग्लिच से भरा हुआ बना देते हैं, CHAI गुणवत्ता को लगभग मूल (धीमी और पूर्ण) संस्करण के समान रखता है।
  • दक्षता: यह तब भी काम करता है जब आपके पास कम कंप्यूटर मेमोरी (कैशे) हो, क्योंकि यह स्मार्ट है और जानता है कि "बीच" और "समुद्र" एक दूसरे के समान हैं और उनके काम को पुन: उपयोग किया जा सकता है।

संक्षेप में:
CHAI एक अत्यंत कुशल सहायक की तरह है जो आपके पिछले प्रोजेक्ट्स के विवरण को याद रखता है। हर बार जब आप वीडियो के लिए पूछते हैं, तो यह आपको शून्य से शुरू करने के बजाय कहता है, "मैंने पहले ही कठिन काम कर लिया है कि एक 'बीच' कैसा दिखता है। आइए बस इसे आपकी नई रिक्वेस्ट के लिए थोड़ा बदल देते हैं।" यह वीडियो को स्पष्ट और साफ रखते हुए आपके इंतजार के घंटों को बचा लेता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →