← नवीनतम पेपर
💻 computer science

Linear Scaling Video VLMs for Long Video Understanding

यह शोध पत्र StateKV को प्रस्तुत करता है, जो एक इन्फरेंस-टाइम (inference-time) विधि है जो पूर्व-प्रशिक्षित वीडियो विजन-लैंग्वेज मॉडल्स को फिक्स्ड-कैपेसिटी रिकरेंट स्टेट्स के साथ लीनियर-टाइम वीडियो प्रीफिलिंग प्राप्त करने में सक्षम बनाती है, जो बिना किसी आर्किटेक्चरल बदलाव या फाइन-ट्यूनिंग के मौजूदा स्ट्रीमिंग एप्रोक्सिमेशन्स की तुलना में स्केलेबिलिटी और सटीकता में महत्वपूर्ण सुधार करती है।

मूल लेखक: Cristobal Eyzaguirre, Jiajun Wu, Juan Carlos Niebles

प्रकाशित 2026-06-01
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Cristobal Eyzaguirre, Jiajun Wu, Juan Carlos Niebles

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

समस्या: AI का "मेमोरी ओवरलोड" (स्मृति का बोझ)

कल्पना कीजिए कि आप एक दोस्त के साथ फिल्म देख रहे हैं जिसके पास फोटोग्राफिक मेमोरी है, लेकिन चीजों को याद रखने का उसका तरीका बहुत ही अजीब है। हर बार जब एक नया दृश्य (फ्रेम) चलता है, तो आपका दोस्त केवल नया दृश्य नहीं देखता; वह फिल्म की शुरुआत से लेकर अब तक के हर एक पिछले दृश्य को एक साथ फिर से देखता है ताकि यह देख सके कि नया दृश्य पुराने दृश्यों से कैसे जुड़ता है।

  • फिल्म: एक लंबी वीडियो (जैसे 1 घंटे की ड्राइव या पूरा स्पोर्ट्स गेम)।
  • दोस्त: एक वीडियो विजन-लैंग्वेज मॉडल (VLM), एक AI जो वीडियो देखता है और उनके बारे में सवालों के जवाब देता है।
  • समस्या: यदि फिल्म 10 मिनट लंबी है, तो आपके दोस्त को हर नए सेकंड के लिए 10 मिनट का फुटेज फिर से देखना पड़ता है। यदि फिल्म 1 घंटे की है, तो उसे हर नए सेकंड के लिए एक घंटा का फुटेज फिर से देखना पड़ता है।

इसे क्वाड्रेटिक स्केलिंग (Quadratic Scaling) कहा जाता है। जैसे-जैसे वीडियो लंबा होता जाता है, आपके दोस्त को करने वाला काम विस्फोट की तरह बढ़ता जाता है। यह एक किताब पढ़ने जैसा है जहाँ पेज 100 समझने के लिए, आपको हर बार पेज 1 से 99 तक फिर से पढ़ना पड़ता है। अंततः, यह कार्य वास्तविक समय (real-time) में करना असंभव हो जाता है।

पुराने समाधान: "सारांश पुस्तक" (The Summary Book)

इसे ठीक करने के लिए, पिछले तरीकों ने दोस्त को सारांश (summary) बनाकर स्मार्ट बनाने की कोशिश की।

  • दृष्टिकोण: "आइए केवल पिछले 5 मिनट याद रखें," या "आइए 90% फ्रेम फेंक दें और केवल सबसे महत्वपूर्ण फ्रेम रखें।"
  • खामी: यह अपने दोस्त से फिल्म का सारांश लिखने के लिए कहने जैसा है लेकिन केवल हालिया वाक्यों को रखने के लिए। वे 20 मिनट पहले के किसी महत्वपूर्ण मोड़ को भूल सकते हैं जो यह समझाता है कि अभी क्या हो रहा है। या, यदि वे बहुत अधिक फ्रेम हटा देते हैं, तो वे उन विवरणों को खो देते हैं जो कठिन सवालों के जवाब देने के लिए आवश्यक हैं। यह एक समझौता है: आप समय बचाते हैं, लेकिन सटीकता खो देते हैं।

नया समाधान: StateKV (एक "स्मार्ट सहायक")

लेखक StateKV नामक एक नया तरीका पेश करते हैं। AI को सब कुछ फिर से देखने या जानकारी फेंकने के लिए मजबूर करने के बजाय, वे इसे दो-भागों वाले मेमोरी सिस्टम के साथ एक स्मार्ट सहायक (Smart Assistant) देते हैं।

AI की कल्पना एक जासूस के रूप में करें जो 1-घंटे की सुरक्षा टेप (security tape) देखते हुए रहस्य सुलझा रहा है।

1. "विस्तृत नोटबुक" (The Red Cache)

AI अब तक देखे गए हर एक फ्रेम की एक पूर्ण, विस्तृत नोटबुक रखता है। यह कुछ भी नहीं फेंकता। जब जासूस (AI) को अंतिम रिपोर्ट (सवाल का जवाब) लिखनी होती है, तो वह सटीक विवरण खोजने के लिए इस पूरी नोटबुक को पलट सकता है। यह सुनिश्चित करता है कि अंतिम उत्तर सटीक हो।

2. "जेब में छोटा नोट" (The Blue State)

यही असली जादू है। जब AI वीडियो देख रहा होता है (प्रोसेसिंग कर रहा होता है), तो वह पूरी नोटबुक अपने दिमाग में नहीं रख सकता। इसलिए, वह एक छोटे जेब वाले चीट शीट (Cheat Sheet) का उपयोग करता है।

  • यह कैसे काम करता है: जैसे-जैसे वीडियो चलता है, AI नए दृश्य को देखता है और पूछता है: "अतीत के कौन से हिस्से वास्तव में इस नए दृश्य को समझने के लिए महत्वपूर्ण हैं?"
  • चयन (Selection): यह अतीत के कुछ बहुत ही "महत्वपूर्ण" क्षणों को चुनता है (जिन्हें टेम्पोरल सिंक्स/Temporal Sinks कहा जाता है) और उन्हें चीट शीट पर लिख लेता है। यह 10 मिनट पहले का किसी पात्र का चेहरा या कोई विशिष्ट ध्वनि प्रभाव हो सकता है।
  • अपडेट: जब अगला दृश्य आता है, तो AI चीट शीट को अपडेट करता है। वह उन चीजों को रखता है जो अभी भी प्रासंगिक हैं और उन चीजों को हटा देता है जिनकी अब आवश्यकता नहीं है, ताकि नए महत्वपूर्ण विवरणों के लिए जगह बनाई जा सके।

परिणाम: देखते समय AI को केवल इस छोटे से चीट शीट के विरुद्ध नए दृश्य की तुलना करनी होती है। यह काम को स्थिर रखता है, चाहे वीडियो कितना भी लंबा क्यों न हो। यह ऐसा है जैसे जासूस को कहानी से जुड़े रहने के लिए पूरी किताब को फिर से पढ़ने के बजाय केवल 3 इंच के इंडेक्स कार्ड पर एक नज़र डालने की आवश्यकता है।

यह एक बड़ी बात क्यों है

पेपर दावा करता है कि StateKV की तीन मुख्य जीत हैं:

  1. यह तेज़ और लीनियर (Linear) है: क्योंकि AI देखते समय केवल छोटे चीट शीट की जांच करता है, इसलिए वीडियो को प्रोसेस करने में लगने वाला समय लीनियरली बढ़ता है (1 घंटा 30 मिनट के मुकाबले दोगुना समय लेगा)। यह पुराने तरीके की तरह अचानक से विस्फोट नहीं करता।
  2. यह सटीक है: पुराने "सारांश" तरीकों के विपरीत जो डेटा फेंक देते थे, StateKV अंतिम उत्तर के लिए पूरी नोटबुक रखता है। यह केवल देखने की प्रक्रिया को सरल बनाता है, परिणाम को नहीं।
  3. यह "हालियापन" (Recency) से बेहतर है: पुराने तरीके अक्सर कहते थे, "पिछले 5 मिनट याद रखो।" StateKV स्मार्ट है; यह कहता है, "सबसे महत्वपूर्ण क्षणों को याद रखो, भले ही वे 40 मिनट पहले क्यों न थे।" पेपर दिखाता है कि AI स्वाभाविक रूप से इन विशिष्ट "एंकर" क्षणों पर ध्यान केंद्रित करता है, और StateKV उन्हें पूरी तरह से पकड़ लेता है।

"बजट" का उदाहरण

कल्पना कीजिए कि आपके पास कार खरीदने के लिए एक निश्चित राशि (कंप्यूटिंग पावर) है।

  • पुराना तरीका: आप एक छोटी, सस्ती कार (एक छोटा AI मॉडल) खरीदते हैं जो तेज़ चल सकती है लेकिन बहुत कम सामान (कम सटीकता) ले जा सकती है।
  • StateKV तरीका: क्योंकि StateKV इतना कुशल है, आप इतनी बचत कर लेते हैं कि आप एक बड़ी, लग्जरी SUV (एक बहुत बड़ा, स्मार्ट AI मॉडल) खरीद सकें जो छोटी कार की समान कीमत पर बहुत अधिक सामान (उच्च सटीकता) ले जा सके।

सारांश

StateKV एक तरीका है जिससे AI बिना "दिमागी धुंध" (brain fog) के घंटों लंबे वीडियो देख सकता है। यह ऐसा इसलिए करता है क्योंकि यह कहानी से जुड़े रहने के लिए एक छोटे, गतिशील सारांश का उपयोग करता है, लेकिन बाद में सवालों के जवाब देने के लिए एक पूर्ण, विस्तृत रिकॉर्ड रखता है। यह पुराने तरीकों की तुलना में तेज़ है और "बस पिछले कुछ मिनटों को याद रखो" वाले दृष्टिकोण से कहीं अधिक स्मार्ट है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →