StreamingVLM: Real-Time Understanding for Infinite Video Streams
StreamingVLM एक एकीकृत विज़न-लैंग्वेज मॉडल फ्रेमवर्क है जो एक नवीन KV कैश पुन: उपयोग रणनीति और ओवरलैप्ड चंक्स पर सुपरवाइज्ड फाइन-ट्यूनिंग के माध्यम से प्रशिक्षण को स्ट्रीमिंग इन्फरेंस के साथ संरेखित करके अनंत वीडियो स्ट्रीम की वास्तविक समय में, स्थिर समझ को सक्षम बनाता है, जिससे कम विलंबता बनाए रखते हुए लंबी अवधि के बेंचमार्क पर अत्याधुनिक प्रदर्शन प्राप्त होता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप अपने एक दोस्त को फोन पर लाइव स्पोर्ट्स गेम का वर्णन करने की कोशिश कर रहे हैं। आप उसे ठीक वही बताना चाहते हैं जो अभी हो रहा है—एक गोल, एक फाउल, एक जश्न—बिना एक भी पल छोड़े, और आप बिना थके या यह भूले बिना कि पहला गोल किसने किया था, घंटों तक ऐसा करना चाहते हैं।
यह समस्या StreamingVLM कंप्यूटरों के लिए हल करता है।
समस्या: कंप्यूटर अभिभूत (Overwhelmed) हो जाते हैं
वर्तमान AI मॉडल जो वीडियो देखते हैं (जिन्हें विजन-लैंग्वेज मॉडल कहा जाता है), वे एक किताब पढ़ने की कोशिश करने वाले छात्रों की तरह हैं।
- "पूर्ण ध्यान" देने वाला छात्र: यह छात्र हर बार एक वाक्य बोलने के लिए पेज 1 से पेज 1,000 तक पूरी किताब पढ़ने की कोशिश करता है। जैसे-जैसे किताब लंबी होती जाती है, इसमें बहुत समय लगता है और अंततः छात्र के पास डेस्क की जगह (मेमोरी) खत्म हो जाती है और वह क्रैश हो जाता है।
- "स्लाइडिंग विंडो" वाला छात्र: यह छात्र केवल पिछले कुछ पन्नों को ही देखता है। यदि उसे पेज 10 से कुछ याद करने की आवश्यकता है, तो उसे बार-बार उन पन्नों को पीछे जाकर फिर से पढ़ना पड़ता है। यह धीमा है और इससे वह कहानी के प्रवाह को भूल जाता है।
दोनों तरीके विफल हो जाते हैं जब वीडियो "अनंत" (जैसे एक लाइव प्रसारण जो कभी समाप्त नहीं होता) हो।
समाधान: StreamingVLM
लेखकों ने एक नया AI बनाया है जिसे StreamingVLM कहते हैं। इसे एक अति-कुशल स्पोर्ट्स कमेंटेटर के रूप में सोचें जिसके पास अपने नोट्स व्यवस्थित करने का एक विशेष तरीका है।
यह कैसे काम करता है, सरल उपमाओं का उपयोग करते हुए:
1. "नोटबुक" का तरीका (KV कैश)
पूरे खेल को याद रखने या केवल पिछले 5 सेकंड को याद रखने के बजाय, StreamingVLM एक स्मार्ट नोटबुक सिस्टम का उपयोग करता है:
- "एंकर" (अटेंशन सिंक्स): यह शुरुआत के कुछ प्रमुख नोट्स रखता है (जैसे टीम के नाम और किक-ऑफ पर स्कोर) ताकि यह कभी न भूले कि कौन खेल रहा है।
- "हालिया इतिहास" (टेक्स्ट विंडो): यह इसके द्वारा बोले गए पिछले कुछ वाक्यों की एक लंबी सूची रखता है, ताकि यह बातचीत के प्रवाह को याद रख सके।
- "लाइव एक्शन" (विज़न विंडो): यह केवल खेल के पिछले कुछ सेकंड के दृश्य विवरणों को रखता है (खिलाड़ियों का दौड़ना, गेंद का हिलना) क्योंकि इस समय वही महत्वपूर्ण है।
पुराने दृश्य विवरण (जैसे 10 मिनट पहले का एक प्ले) नए विवरणों के लिए जगह बनाने के लिए धीरे से हटा दिए जाते हैं, लेकिन "एंकर" और "हालिया इतिहास" सुरक्षित रहते हैं। यह कंप्यूटर के मेमोरी उपयोग को कम और स्थिर रखता है, चाहे वीडियो कितना भी लंबा क्यों न हो।
2. "प्रशिक्षण" का तरीका
आप कंप्यूटर को 10 घंटे का खेल नहीं सिखा सकते यदि आप प्रशिक्षण के दौरान उसे केवल 1 मिनट के क्लिप दिखाते हैं। लेखकों ने इस चतुराई भरे तरीके से इसे हल किया:
- उन्होंने AI को खेलों के छोटे, ओवरलैपिंग क्लिप दिखाए (जैसे 24-सेकंड के टुकड़े जो 12 सेकंड ओवरलैप होते हैं)।
- उन्होंने AI को उस छोटे से टुकड़े के अंदर सब कुछ पर ध्यान देने के लिए प्रशिक्षित किया।
- क्योंकि टुकड़े ओवरलैप होते हैं, AI एक टुकड़े के अंत को अगले के प्रारंभ से जोड़ने में सक्षम होता है, जिससे वह प्रभावी रूप से एक निरंतर स्ट्रीम को संभालने का तरीका सीख जाता है, बिना कभी प्रशिक्षण के दौरान 10 घंटे का वीडियो देखे।
3. "नंबरिंग" का तरीका (कंटीगुअस RoPE)
आमतौर पर, जब आप नोटबुक से पुराने पन्ने हटाते हैं, तो पेज नंबर गड़बड़ा जाते हैं (पेज 1, 2, 3... और फिर अचानक पेज 100)। यह AI को भ्रमित करता है। StreamingVLM एक विशेष "री-नंबरिंग" सिस्टम का उपयोग करता है। जब यह पुराने विजुअल डेटा को हटाता है, तो यह तुरंत शेष पन्नों को फिर से लेबल करता है ताकि वे अभी भी 1, 2, 3, 4... के रूप में क्रमांकित रहें। यह AI को यह समझने में भ्रमित होने से बचाता है कि चीजें कब हुईं, भले ही घंटों का वीडियो बीत गया हो।
परिणाम: एक मैराथन धावक
टीम ने इस नए AI का परीक्षण एक नए बेंचमार्क पर किया जिसे Inf-Streams-Eval कहा जाता है, जिसमें औसतन 2 घंटे से अधिक लंबे स्पोर्ट्स गेम शामिल हैं।
- गति: यह एक सिंगल शक्तिशाली कंप्यूटर चिप पर रियल-टाइम में (लगभग 8 फ्रेम प्रति सेकंड) खेल देख सकता है और उसके बारे में बात कर सकता है। इसमें कोई लैग नहीं आता।
- मेमोरी: यह खेल की शुरुआत को भूले बिना या क्रैश हुए बिना 3 घंटे से अधिक समय तक कमेंट्री कर सकता है।
- गुणवत्ता: शीर्ष-स्तरीय मॉडलों (जैसे GPT-4o mini) के साथ आमने-सामने की तुलना में, StreamingVLM ने स्पोर्ट्स कमेंट्री के लिए 66% बार जीत हासिल की। यह अधिक स्वाभाविक लगता है और खेल को बेहतर ढंग से याद रखता है।
- बोनस: भले ही इसे केवल स्पोर्ट्स कमेंट्री के लिए प्रशिक्षित किया गया था, यह सामान्य वीडियो प्रश्नों के उत्तर देने में भी बेहतर हुआ, जो यह साबित करता है कि यह वीडियो समझने के लिए एक सामान्य अपग्रेड है।
संक्षेप में
StreamingVLM एक अथक स्पोर्ट्स कमेंटेटर की तरह है जिसके पास एक जादुई याददाश्त है। यह खेल की शुरुआत को याद रखता है, अभी हो रही कार्रवाई पर तीव्रता से ध्यान केंद्रित करता है, और जगह बचाने के लिए 10 मिनट पहले के उबाऊ हिस्सों को भूल जाता है। यह इसे एक अनंत वीडियो स्ट्रीम को रियल-टाइम में देखने और उसका वर्णन करने की अनुमति देता है, जो कि एक ऐसी चीज़ है जिसे पिछले कंप्यूटर बिना अभिभूत हुए नहीं कर सकते थे।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।