← नवीनतम पेपर
💬 NLP

StreamingVLM: Real-Time Understanding for Infinite Video Streams

StreamingVLM एक एकीकृत विज़न-लैंग्वेज मॉडल फ्रेमवर्क है जो एक नवीन KV कैश पुन: उपयोग रणनीति और ओवरलैप्ड चंक्स पर सुपरवाइज्ड फाइन-ट्यूनिंग के माध्यम से प्रशिक्षण को स्ट्रीमिंग इन्फरेंस के साथ संरेखित करके अनंत वीडियो स्ट्रीम की वास्तविक समय में, स्थिर समझ को सक्षम बनाता है, जिससे कम विलंबता बनाए रखते हुए लंबी अवधि के बेंचमार्क पर अत्याधुनिक प्रदर्शन प्राप्त होता है।

मूल लेखक: Ruyi Xu, Guangxuan Xiao, Yukang Chen, Liuning He, Yao Lu, Song Han

प्रकाशित 2026-06-02
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Ruyi Xu, Guangxuan Xiao, Yukang Chen, Liuning He, Yao Lu, Song Han

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप अपने एक दोस्त को फोन पर लाइव स्पोर्ट्स गेम का वर्णन करने की कोशिश कर रहे हैं। आप उसे ठीक वही बताना चाहते हैं जो अभी हो रहा है—एक गोल, एक फाउल, एक जश्न—बिना एक भी पल छोड़े, और आप बिना थके या यह भूले बिना कि पहला गोल किसने किया था, घंटों तक ऐसा करना चाहते हैं।

यह समस्या StreamingVLM कंप्यूटरों के लिए हल करता है।

समस्या: कंप्यूटर अभिभूत (Overwhelmed) हो जाते हैं

वर्तमान AI मॉडल जो वीडियो देखते हैं (जिन्हें विजन-लैंग्वेज मॉडल कहा जाता है), वे एक किताब पढ़ने की कोशिश करने वाले छात्रों की तरह हैं।

  • "पूर्ण ध्यान" देने वाला छात्र: यह छात्र हर बार एक वाक्य बोलने के लिए पेज 1 से पेज 1,000 तक पूरी किताब पढ़ने की कोशिश करता है। जैसे-जैसे किताब लंबी होती जाती है, इसमें बहुत समय लगता है और अंततः छात्र के पास डेस्क की जगह (मेमोरी) खत्म हो जाती है और वह क्रैश हो जाता है।
  • "स्लाइडिंग विंडो" वाला छात्र: यह छात्र केवल पिछले कुछ पन्नों को ही देखता है। यदि उसे पेज 10 से कुछ याद करने की आवश्यकता है, तो उसे बार-बार उन पन्नों को पीछे जाकर फिर से पढ़ना पड़ता है। यह धीमा है और इससे वह कहानी के प्रवाह को भूल जाता है।

दोनों तरीके विफल हो जाते हैं जब वीडियो "अनंत" (जैसे एक लाइव प्रसारण जो कभी समाप्त नहीं होता) हो।

समाधान: StreamingVLM

लेखकों ने एक नया AI बनाया है जिसे StreamingVLM कहते हैं। इसे एक अति-कुशल स्पोर्ट्स कमेंटेटर के रूप में सोचें जिसके पास अपने नोट्स व्यवस्थित करने का एक विशेष तरीका है।

यह कैसे काम करता है, सरल उपमाओं का उपयोग करते हुए:

1. "नोटबुक" का तरीका (KV कैश)

पूरे खेल को याद रखने या केवल पिछले 5 सेकंड को याद रखने के बजाय, StreamingVLM एक स्मार्ट नोटबुक सिस्टम का उपयोग करता है:

  • "एंकर" (अटेंशन सिंक्स): यह शुरुआत के कुछ प्रमुख नोट्स रखता है (जैसे टीम के नाम और किक-ऑफ पर स्कोर) ताकि यह कभी न भूले कि कौन खेल रहा है।
  • "हालिया इतिहास" (टेक्स्ट विंडो): यह इसके द्वारा बोले गए पिछले कुछ वाक्यों की एक लंबी सूची रखता है, ताकि यह बातचीत के प्रवाह को याद रख सके।
  • "लाइव एक्शन" (विज़न विंडो): यह केवल खेल के पिछले कुछ सेकंड के दृश्य विवरणों को रखता है (खिलाड़ियों का दौड़ना, गेंद का हिलना) क्योंकि इस समय वही महत्वपूर्ण है।

पुराने दृश्य विवरण (जैसे 10 मिनट पहले का एक प्ले) नए विवरणों के लिए जगह बनाने के लिए धीरे से हटा दिए जाते हैं, लेकिन "एंकर" और "हालिया इतिहास" सुरक्षित रहते हैं। यह कंप्यूटर के मेमोरी उपयोग को कम और स्थिर रखता है, चाहे वीडियो कितना भी लंबा क्यों न हो।

2. "प्रशिक्षण" का तरीका

आप कंप्यूटर को 10 घंटे का खेल नहीं सिखा सकते यदि आप प्रशिक्षण के दौरान उसे केवल 1 मिनट के क्लिप दिखाते हैं। लेखकों ने इस चतुराई भरे तरीके से इसे हल किया:

  • उन्होंने AI को खेलों के छोटे, ओवरलैपिंग क्लिप दिखाए (जैसे 24-सेकंड के टुकड़े जो 12 सेकंड ओवरलैप होते हैं)।
  • उन्होंने AI को उस छोटे से टुकड़े के अंदर सब कुछ पर ध्यान देने के लिए प्रशिक्षित किया।
  • क्योंकि टुकड़े ओवरलैप होते हैं, AI एक टुकड़े के अंत को अगले के प्रारंभ से जोड़ने में सक्षम होता है, जिससे वह प्रभावी रूप से एक निरंतर स्ट्रीम को संभालने का तरीका सीख जाता है, बिना कभी प्रशिक्षण के दौरान 10 घंटे का वीडियो देखे।

3. "नंबरिंग" का तरीका (कंटीगुअस RoPE)

आमतौर पर, जब आप नोटबुक से पुराने पन्ने हटाते हैं, तो पेज नंबर गड़बड़ा जाते हैं (पेज 1, 2, 3... और फिर अचानक पेज 100)। यह AI को भ्रमित करता है। StreamingVLM एक विशेष "री-नंबरिंग" सिस्टम का उपयोग करता है। जब यह पुराने विजुअल डेटा को हटाता है, तो यह तुरंत शेष पन्नों को फिर से लेबल करता है ताकि वे अभी भी 1, 2, 3, 4... के रूप में क्रमांकित रहें। यह AI को यह समझने में भ्रमित होने से बचाता है कि चीजें कब हुईं, भले ही घंटों का वीडियो बीत गया हो।

परिणाम: एक मैराथन धावक

टीम ने इस नए AI का परीक्षण एक नए बेंचमार्क पर किया जिसे Inf-Streams-Eval कहा जाता है, जिसमें औसतन 2 घंटे से अधिक लंबे स्पोर्ट्स गेम शामिल हैं।

  • गति: यह एक सिंगल शक्तिशाली कंप्यूटर चिप पर रियल-टाइम में (लगभग 8 फ्रेम प्रति सेकंड) खेल देख सकता है और उसके बारे में बात कर सकता है। इसमें कोई लैग नहीं आता।
  • मेमोरी: यह खेल की शुरुआत को भूले बिना या क्रैश हुए बिना 3 घंटे से अधिक समय तक कमेंट्री कर सकता है।
  • गुणवत्ता: शीर्ष-स्तरीय मॉडलों (जैसे GPT-4o mini) के साथ आमने-सामने की तुलना में, StreamingVLM ने स्पोर्ट्स कमेंट्री के लिए 66% बार जीत हासिल की। यह अधिक स्वाभाविक लगता है और खेल को बेहतर ढंग से याद रखता है।
  • बोनस: भले ही इसे केवल स्पोर्ट्स कमेंट्री के लिए प्रशिक्षित किया गया था, यह सामान्य वीडियो प्रश्नों के उत्तर देने में भी बेहतर हुआ, जो यह साबित करता है कि यह वीडियो समझने के लिए एक सामान्य अपग्रेड है।

संक्षेप में

StreamingVLM एक अथक स्पोर्ट्स कमेंटेटर की तरह है जिसके पास एक जादुई याददाश्त है। यह खेल की शुरुआत को याद रखता है, अभी हो रही कार्रवाई पर तीव्रता से ध्यान केंद्रित करता है, और जगह बचाने के लिए 10 मिनट पहले के उबाऊ हिस्सों को भूल जाता है। यह इसे एक अनंत वीडियो स्ट्रीम को रियल-टाइम में देखने और उसका वर्णन करने की अनुमति देता है, जो कि एक ऐसी चीज़ है जिसे पिछले कंप्यूटर बिना अभिभूत हुए नहीं कर सकते थे।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →