← नवीनतम पेपर
💻 computer science

Token Radius Attention for Efficient Video Generation

टोकन रेडियस अटेंशन (TRA) एक प्रशिक्षण-मुक्त फ्रेमवर्क है जो क्वेरी एंट्रॉपी को टोकन-निर्भर अटेंशन रेडियस में गतिशील रूप से मैप करके वीडियो डिफ्यूजन ट्रांसफॉर्मर्स को कुशलतापूर्वक त्वरित करता है, जिससे केवल 9-19% अटेंशन इंटरैक्शन को बनाए रखते हुए न्यूनतम गुणवत्ता हानि के साथ महत्वपूर्ण गति प्राप्त होती है।

मूल लेखक: Jiayu Chen, Zhikun Jiang, Maoliang Li, Jiayi Luo, Jiawei Yang, Zihao Zheng, Hengyi Zhang, Guojie Luo, Xiang Chen

प्रकाशित 2026-08-04
📖 3 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Jiayu Chen, Zhikun Jiang, Maoliang Li, Jiayi Luo, Jiawei Yang, Zihao Zheng, Hengyi Zhang, Guojie Luo, Xiang Chen

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक मील तक फैली हुई दीवार पर एक विशाल, चलती-फिरती भित्ति चित्र (म्यूरल) पेंट करने की कोशिश कर रहे हैं। चित्र को वास्तविक दिखाने के लिए, आपको अब तक लगाए गए हर एक ब्रशस्ट्रोक को देखना होगा और यह तय करना होगा कि वह अभी जो आप पेंट कर रहे हैं, उससे कैसे जुड़ता है। आर्टिफिशियल इंटेलिजेंस की दुनिया में, वीडियो डिफ्यूजन ट्रांसफॉर्मर्स (Video Diffusion Transformers) बिल्कुल यही करते हैं। वे शून्य से शानदार वीडियो बनाने वाले डिजिटल कलाकार हैं, लेकिन वीडियो को स्मूथ और वास्तविक बनाने के लिए, कंप्यूटर को पूरे वीडियो के हर एक पिक्सेल की तुलना दूसरे हर पिक्सेल से करनी पड़ती है। यह एक स्टेडियम में मौजूद हर व्यक्ति से हाथ मिलाने की कोशिश करने जैसा है जबकि आप एक ही जगह खड़े हैं; यह अविश्वसनीय रूप से गहन है, लेकिन इसमें बहुत अधिक समय और ऊर्जा लगती है। वैज्ञानिक इसे "डेंस अटेंशन" (dense attention) कहते हैं, और यही कारण है कि उच्च गुणवत्ता वाले AI वीडियो बनाना वर्तमान में धीमा और महंगा है। बड़ा सवाल जो शोधकर्ता पूछ रहे हैं वह यह है: क्या हम AI को इस बारेට स्मार्ट बना सकते हैं कि वह किसके साथ हाथ मिलाए, ताकि वह उबाऊ हिस्सों को छोड़ सके और केवल महत्वपूर्ण कनेक्शनों पर ध्यान केंद्रित कर सके, बिना चित्र को खराब किए?

यह पेपर इस समस्या को हल करने के लिए टोकन रेडियस अटेंशन (Token Radius Attention - TRA) नामक एक चतुर नई रणनीति पेश करता है। वीडियो के हर हिस्से के साथ एक जैसा व्यवहार करने के बजाय, लेखकों ने पाया कि वीडियो के अलग-अलग हिस्सों को वास्तव में ध्यान (अटेंशन) की अलग-अलग मात्रा की आवश्यकता होती है। इसे एक पार्टी की तरह समझें: कुछ मेहमान एक गंभीर बातचीत में डूबे हुए हैं और उन्हें केवल अपने ठीक बगल वाले लोगों को सुनने की आवश्यकता है (कम अटेंशन), जबकि अन्य लोग बेतहाशा नाच रहे हैं और उन्हें पूरे कमरे पर नज़र रखने की आवश्यकता है (उच्च अटेंशन)। शोधकर्ताओं ने पाया कि वे "एन्ट्रॉपी" (entropy) नामक माप का उपयोग करके यह सटीक भविष्यवाणी कर सकते हैं कि वीडियो के प्रत्येक हिस्से को कितने "अटेंशन" की आवश्यकता है, जिससे पता चलता है कि उनका वर्तमान फोकस कितना "भ्रमित" या "फैला हुआ" है।

इस अंतर्दृष्टि का उपयोग करते हुए, टीम ने एक प्रणाली बनाई है जो एक स्मार्ट रेडियस गार्ड (radius guard) की तरह काम करती है। वीडियो के प्रत्येक छोटे टुकड़े (जिसे "टोकन" कहा जाता है) के लिए, सिस्टम उसके चारों ओर एक कस्टम-साइज़ का घेरा (circle) बनाता है। यदि टुकड़ा केंद्रित और शांत है, तो घेरा छोटा होता है, और AI केवल उसके आस-पास के पड़ोसियों को देखता है। यदि टुकड़ा अराजक या जटिल है, तो घेरा बड़ा हो जाता है ताकि अधिक पड़ोसियों को शामिल किया जा सके। यह स्वचालित रूप से होता है बिना AI को रुककर हर एक संभावना को रैंक करने की आवश्यकता के, जो बहुत सारा समय बचाता है। परिणाम स्वरूप, एक ऐसा वीडियो जनरेटर मिलता है जो मूल कनेक्शनों का केवल 9% से 19% हिस्सा रखता है लेकिन 1.56 से 2.05 गुना तेज़ चलता है, और ऐसे वीडियो बनाता है जो धीमे और भारी संस्करणों जितने ही अच्छे दिखते हैं। लेखकों ने कई अलग-अलग वीडियो बनाने वाले मॉडलों पर इसका परीक्षण किया और पाया कि यह लगातार अच्छा काम करता है, जो यह साबित करता है कि एक शानदार परिणाम पाने के लिए आपको सब कुछ चेक करने की आवश्यकता नहीं है—आपको बस सही चीजों को चेक करने की आवश्यकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →