← नवीनतम पेपर
🤖 AI

VideoMLA: Low-Rank Latent KV Cache for Minute-Scale Autoregressive Video Diffusion

यह शोधपत्र VideoMLA प्रस्तुत करता है, जो एक नवीन आर्किटेक्चर है जो मिनट-स्केल ऑटोरेग्रेसिव वीडियो डिफ्यूजन में मल्टी-हेड लेटेंट अटेंशन को लागू करता है, जिससे बेसलाइन गुणवत्ता को बनाए रखते हुए या उससे बेहतर प्रदर्शन करते हुए, KV कैश मेमोरी में 92.7% की कमी और 1.23x थ्रूपुट सुधार प्राप्त होता है, भले ही यह विधि इस तथ्य के बावजूद सफल होती है कि प्रीट्रेंड अटेंशन स्वाभाविक रूप से लो-रैंक नहीं है।

मूल लेखक: Hidir Yesiltepe, Jiazhen Hu, Tuna Han Salih Meral, Adil Kaan Akan, Kaan Oktay, Hoda Eldardiry, Pinar Yanardag

प्रकाशित 2026-05-29
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Hidir Yesiltepe, Jiazhen Hu, Tuna Han Salih Meral, Adil Kaan Akan, Kaan Oktay, Hoda Eldardiry, Pinar Yanardag

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक ऐसी कहानी सुनाने की कोशिश कर रहे हैं जो एक घंटे तक चलती है, लेकिन आपके पास इसे लिखने के लिए केवल एक छोटी सी नोटबुक है। हर बार जब आप एक नया वाक्य जोड़ते हैं, तो आपको वह सब कुछ याद रखना पड़ता है जो आपने पहले लिखा है ताकि आपकी कहानी का अर्थ बना रहे।

AI वीडियो जनरेशन की दुनिया में, यह "नोटबुक" KV Cache कहलाती है। यह एक मेमोरी बैंक है जहाँ AI उस वीडियो के फ्रेमों के बारे में जानकारी संग्रहीत करता है जिन्हें उसने पहले ही बना लिया है, ताकि वह अगले फ्रेम बना सके।

समस्या: नोटबुक बहुत भारी है

वर्तमान AI वीडियो मॉडल ऐसे छात्रों की तरह हैं जो एक घंटे लंबी कहानी लिखने की कोशिश कर रहे हैं, लेकिन उनकी नोटबुक इतनी भारी है कि वे उसे उठा भी नहीं पा रहे हैं।

  • पुराना तरीका: वीडियो के हर एक फ्रेम को याद रखने के लिए, AI उसके नेटवर्क के हर एक "सेल" (हेड/head) के लिए एक विशाल और विस्तृत विवरण लिखता है।
  • परिणाम: जैसे-जैसे वीडियो लंबा होता जाता है (मिनटों के हिसाब से), यह नोटबुक इतनी बड़ी हो जाती है कि मेमोरी खत्म हो जाती है। इसे ठीक करने के लिए, अधिकांश सिस्टम बस पुराने पन्ने फेंक देते हैं (स्लाइडिंग विंडो), लेकिन वे पन्ने जिन्हें वे रखते हैं, वे अभी भी अविश्वसनीय रूप से भारी और पढ़ने में धीमे होते हैं।

समाधान: VideoMLA (एक "सारांश" वाली नोटबुक)

यह पेपर VideoMLA पेश करता है, जो इस कहानी को लिखने का एक नया तरीका है जो नोटबुक को 92.7% तक छोटा कर देता है।

यह इस तरह काम करता है (एक सरल उपमा के माध्यम से):

1. "साझा सारांश" (Low-Rank Latent)
कल्पना कीजिए कि आप अपने 12 दोस्तों के समूह (AI के 12 "हेड्स") को एक दृश्य का वर्णन कर रहे हैं।

  • पहले: आप प्रत्येक मित्र के लिए एक अलग, 128-पृष्ठों की विस्तृत रिपोर्ट लिखते थे। वह प्रति फ्रेम 12×128=1,53612 \times 128 = 1,536 पृष्ठों की जानकारी थी!
  • VideoMLA: आप महसूस करते हैं कि आपके सभी दोस्त एक ही कहानी सुन रहे हैं। 12 अलग-अलग रिपोर्ट लिखने के बजाय, आप एक एकल, संक्षिप्त सारांश (द "लेटेंट") लिखते हैं जो दृश्य के मूल सार को पकड़ता है। आपके सभी 12 दोस्त इसी एक सारांश को साझा करते हैं।
  • जादू: यह सारांश बहुत छोटा है (1,536 के बजाय केवल 192 पृष्ठ)। यह बिना किसी दोहराव के "क्या" (सामग्री) को पकड़ लेता है।

2. "अलग मानचित्र" (Decoupled 3D-RoPE)
सारांश आपको बताता है कि क्या हो रहा है, लेकिन यह नहीं बताता कि कहाँ या कब हो रहा है।

  • पहले: स्थान और समय की जानकारी उन भारी, बोझिल रिपोर्टों में मिली हुई थी।
  • VideoMLA: आप स्थान और समय की जानकारी (जैसे "दोपहर 2 बजे बाईं ओर बारिश हो रही है") लेते हैं और उसे एक छोटे, अलग स्टिकी नोट पर रखते हैं। यह नोट भी सभी के द्वारा साझा किया जाता है।
  • परिणाम: अब आपके पास 12 विशाल रिपोर्टों के बजाय एक छोटा सारांश + एक छोटा स्टिकी नोट है।

बड़ी हैरानी: यह तब भी काम करता है जब इसे "नहीं करना चाहिए"

आमतौर पर, वैज्ञानिक इस "सारांश" तकनीक (जिसे मल्टी-हेड लेटेंट अटेंशन कहा जाता है) का उपयोग इसलिए करते हैं क्योंकि उनका मानना है कि मूल जानकारी स्वाभाविक रूप से सरल और सारांशित करने में आसान होती है (जैसे एक लो-रैंक गणित की समस्या)।

पेपर की खोज:
लेखकों ने मूल AI मॉडल की जांच की और पाया कि मूल जानकारी सरल नहीं है। यह वास्तव में अविश्वसनीय रूप से जटिल और अव्यवस्थित (हाई "रैंक") है।

  • पहेली: यदि आप एक जटिल, अव्यवस्थित पेंटिंग को एक साधारण रेखाचित्र (sketch) के साथ सारांशित करने की कोशिश करते हैं, तो आप आमतौर पर बहुत सारे विवरण खो देते हैं।
  • वास्तविकता: VideoMLA फिर भी काम करता है! भले ही मूल डेटा अव्यवस्थित है, AI पूरी कहानी को उस छोटे सारांश स्थान में फिट होने के लिए सीख जाता है। यह पता चला कि सीमा यह नहीं है कि कहानी कितनी अव्यवस्थित है, बल्कि यह है कि नोटबुक कितनी बड़ी है। AI बस पूरी कहानी को उस छोटे स्थान में पूरी तरह से फिट होने के लिए खुद को ढाल लेता है।

यह क्यों महत्वपूर्ण है

नोटबुक को छोटा करके:

  1. लंबे वीडियो: AI अब मेमोरी खत्म हुए बिना मिनटों लंबे वीडियो बना सकता है।
  2. तेज़ गति: एक छोटे सारांश को पढ़ना 12 विशाल रिपोर्टों को पढ़ने की तुलना में बहुत तेज़ है। पेपर दिखाता है कि यह AI को 1.23 गुना तेज़ बनाता है।
  3. बेहतर गुणवत्ता: भारी संपीड़न (compression) के बावजूद, वीडियो की गुणवत्ता उच्च बनी रहती है। AI में "स्टैटिक" या धुंधलापन नहीं आता; गति सुचारू रहती है और पात्र सुसंगत रहते हैं।

संक्षेप में

VideoMLA ऐसा है जैसे यह महसूस करना कि कहानी सुनाने के लिए आपको किताबों का पुस्तकालय ले जाने की आवश्यकता नहीं है। आपको बस एक अच्छी तरह से लिखा गया सारांश और एक छोटा मानचित्र चाहिए। यह AI को बिना सुपर-कंप्यूटर की मदद के, बहुत तेज़ी से और लंबे, सुचारू वीडियो बनाने की अनुमति देता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →