← नवीनतम पेपर
💬 NLP

Small Vision-Language Models are Smart Compressors for Long Video Understanding

यह शोध पत्र टेंपो (Tempo) का प्रस्ताव करता है, जो एक क्वेरी-जागरूक फ्रेमवर्क है जो एक स्थानीय टेम्पोरल कंप्रेसर के रूप में एक स्मॉल विजन-लैंग्वेज मॉडल और एक अडैप्टिव टोकन एलोकेशन राउटर का लाभ उठाकर घंटों लंबे वीडियो को इरादा-अनुरूप (intent-aligned), संक्षिप्त निरूपणों में कुशलतापूर्वक संकुचित करता है, जिससे सख्त टोकन बजट के भीतर काम करते हुए लॉन्ग-फॉर्म वीडियो समझ के बेंचमार्क पर अत्याधुनिक प्रदर्शन प्राप्त होता है।

मूल लेखक: Junjie Fei, Jun Chen, Zechun Liu, Yunyang Xiong, Chong Zhou, Wei Wen, Junlin Han, Mingchen Zhuge, Saksham Suri, Qi Qian, Shuming Liu, Lemeng Wu, Raghuraman Krishnamoorthi, Vikas Chandra, Mohamed Elhos
प्रकाशित 2026-04-10
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Junjie Fei, Jun Chen, Zechun Liu, Yunyang Xiong, Chong Zhou, Wei Wen, Junlin Han, Mingchen Zhuge, Saksham Suri, Qi Qian, Shuming Liu, Lemeng Wu, Raghuraman Krishnamoorthi, Vikas Chandra, Mohamed Elhoseiny, Chenchen Zhu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप अपने एक दोस्त को एक तीन घंटे की फिल्म समझाने की कोशिश कर रहे हैं, जिसकी एकाग्रता शक्ति (attention span) बहुत कम है और वह एक बार में केवल 10 मिनट के विवरण ही याद रख पाता है।

यदि आप उसे पूरी कहानी शब्द-दर-शब्द सुनाने की कोशिश करेंगे, तो वह अभिभूत (overwhelmed) हो जाएगा, बीच तक पहुँचते-पहुँचते शुरुआत भूल जाएगा, और महत्वपूर्ण मोड़ (plot twists) भी चूक जाएगा। यह बिल्कुल वही समस्या है जिसका सामना कंप्यूटर लंबे वीडियो को समझने के दौरान करते हैं।

यह पेपर Tempo नामक एक स्मार्ट सिस्टम पेश करता है, जो इस समस्या का समाधान करता है। यह कैसे काम करता है, इसे सरल उपमाओं (analogies) के माध्यम से यहाँ समझाया गया है:

1. समस्या: "सूचना का सैलाब" (The Information Flood)

वर्तमान AI मॉडल उन छात्रों की तरह हैं जो एक बैठक में 1,000 पन्नों की किताब पढ़ने की कोशिश कर रहे हैं। यदि वे हर एक शब्द (वीडियो का हर एक फ्रेम) पढ़ने की कोशिश करते हैं, तो वे थक जाते हैं, ध्यान खो देते हैं और मुख्य बात चूक जाते हैं।

  • पुराने तरीके इसे इस तरह हल करने की कोशिश करते थे:
    • पन्ने छोड़ना (Skipping pages): हर 10वें पन्ने पर एक त्वरित नज़र डालना। (जोखिम: आप उस एक वाक्य को चूक सकते हैं जहाँ नायक मर जाता है)।
    • सब कुछ सारांशित करना (Summarizing everything): हर पन्ना पढ़ना लेकिन उसे एक धुंधले, सामान्य सारांश में बदल देना। (जोखिम: आप उन विशिष्ट विवरणों को खो देते हैं जो किसी प्रश्न का उत्तर देने के लिए आवश्यक हैं)।

2. समाधान: "स्मार्ट एडिटर" (The Smart Editor - Tempo)

Tempo एक सुपर-स्मार्ट फिल्म एडिटर की तरह काम करता है जो आपके सवाल पूछने के दौरान ही फिल्म देखता है।

वीडियो को डेटा के एक उबाऊ, एकसमान प्रवाह के रूप में देखने के बजाय, Tempo के पास दो मुख्य उपकरण हैं:

A. "क्वेरी-अवेयर" लेंस (The "Query-Aware" Lens)

कल्पना कीजिए कि आपने पूछा, "मेज पर कितने हरे मग रखे थे?"

  • पुराना AI: पूरे मूवी को देखता है और कहता है, "मैंने एक रसोई, एक लिविंग रूम और एक पार्क देखा।" (यह पार्क पर समय बर्बाद करता है)।
  • Tempo: तुरंत जानता है कि उसे रसोई के दृश्यों पर ज़ूम इन (zoom in) करना है जहाँ मग दिखाई दे सकते हैं और पार्क के दृश्यों को फास्ट-फॉरवर्ड (fast-forward) करना है। यह केवल उसी चीज़ पर ध्यान देता है जो आपके विशिष्ट प्रश्न के लिए महत्वपूर्ण है।

B. "स्मार्ट कंप्रेसर" (The "Smart Compressor" - The SVLM)

Tempo एक छोटे, तेज़ AI (जिसे Small Vision-Language Model कहा जाता है) का उपयोग एक कंप्रेशन फ़िल्टर के रूप में करता है।

  • वीडियो को पानी की एक नदी के रूप में सोचें।
  • "छोटा AI" एक छलनी (sieve) है जो नदी में स्थित है।
  • जब पानी एक उबाऊ हिस्से (जैसे दीवार का एक स्थिर शॉट) से बहता है, तो छलनी केवल एक नन्हा बूंद (temporal anchor) गुजरने देती है।
  • जब पानी एक रोमांचक हिस्से (जैसे कार चेज़ या किसी पात्र का बोलना) से बहता है, तो छलनी एक बहाव (gushing stream) को गुजरने देती है (उच्च विवरण)।

3. असली मंत्र: "एडेप्टिव टोकन एलोकेशन" (The Secret Sauce: "Adaptive Token Allocation" - ATA)

यह ऑपरेशन का मस्तिष्क है। यह तय करता है कि वीडियो के प्रत्येक भाग के लिए कितना विवरण रखना है, लेकिन यह इसे बिना किसी अतिरिक्त प्रशिक्षण के तुरंत करता है।

  • "ज़ीरो-शॉट" अंतर्ज्ञान (The "Zero-Shot" Intuition): सिस्टम के पास एक अंतर्निहित "अंतर्ज्ञान" (जो लाखों वीडियो पर प्रशिक्षण से सीखा गया है) है जो इसे बताता है, "यह दृश्य शायद महत्वपूर्ण है," या "यह दृश्य केवल बैकग्राउंड शोर है।"
  • "हेड ट्रंकेशन" तकनीक (The "Head Truncation" Trick): सिस्टम स्वाभाविक रूप से सबसे महत्वपूर्ण जानकारी को अपनी मेमोरी के शुरुआत में पैक करता है। इसलिए, यदि इसे जगह बचाने के लिए वीडियो को छोटा करना पड़ता है, तो यह बस मेमोरी के अंत को काट देता है। सबसे महत्वपूर्ण चीजें पहले से ही सामने सुरक्षित हैं!

4. परिणाम: छोटा लेकिन शक्तिशाली (The Results: Small but Mighty)

इस पेपर का सबसे आश्चर्यजनक हिस्सा यह है कि Tempo छोटा है (केवल 6 बिलियन पैरामीटर्स, जो GPT-4o जैसे दिग्गजों की तुलना में बहुत छोटा है) और तेज़ है।

  • "कम ही अधिक है" प्रभाव (The "Less is More" Effect): उबाऊ हिस्सों को काटने के मामले में इतना सख्त होने के कारण, Tempo वास्तव में उन विशाल मॉडलों से बेहतर प्रदर्शन करता है जो सब कुछ याद रखने की कोशिश करते हैं। यह एक ऐसे जासूस की तरह है जो पुलिस स्टेशन की हर फाइल पढ़ने के बजाय केवल उस एक सुराग पर ध्यान केंद्रित करके केस सुलझाता है जो मायने रखता है।
  • दिग्गजों को पछाड़ना: घंटे भर के वीडियो वाले परीक्षणों में, Tempo ने GPT-4o और Gemini 1.5 Pro जैसे मालिकाना दिग्गजों को भी पीछे छोड़ दिया, भले ही उन दिग्गजों के पास बहुत अधिक कंप्यूटिंग पावर थी।

सारांश उपमा (Summary Analogy)

कल्पना कीजिए कि आप 10 घंटे के शहर के दौरे के लिए एक टूर गाइड को काम पर रख रहे हैं।

  • पुराना तरीका: गाइड हर एक इमारत की हर एक ईंट का वर्णन करने की कोशिश करता है। आप बोर हो जाते हैं और दौरे के अंत तक शुरुआत भूल जाते हैं।
  • Tempo का तरीका: आप गाइड को बताते हैं, "मुझे केवल पुराने किले के इतिहास की परवाह है।" गाइड आधुनिक मॉल और पार्कों को अनदेखा करता है, किले पर ज़ूम करता है, और बाकी शहर को पलक झपकते ही छोड़ते हुए किले के बारे में आपको एक विस्तृत, उच्च-गुणवत्ता वाली कहानी देता है।

Tempo साबित करता है कि लंबे वीडियो के लिए, कहानी समझने के लिए आपको सब कुछ देखने की ज़रूरत नहीं है। आपको बस सही चीज़ों को देखने की ज़रूरत है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →