← नवीनतम पेपर
💻 computer science

Evidence-Driven Dynamic Visual Selector for Efficient Long Video Understanding

EviSelect एक सूक्ष्म-स्तरीय (fine-grained) गतिशील दृश्य चयन ढांचा है जो एक लक्ष्य MLLM के आंतरिक अटेंशन साक्ष्य का स्पार्स प्रीफिलिंग (sparse prefilling) के माध्यम से लाभ उठाता है ताकि एक अनुकूलित स्टोकेस्टिक पॉलिसी को निर्देशित किया जा सके, जिससे अनुकूलन योग्य स्थानिक-कालिक (spatiotemporal) नमूनाकरण सक्षम होता है जो उत्कृष्ट प्रदर्शन बनाए रखते हुए कम्प्यूटेशनल लागत को महत्वपूर्ण रूप से कम करता है और लंबे वीडियो की समझ को त्वरित करता है।

मूल लेखक: Bo Zhang, Wenxin Wang, Feng Chen, Zhihao Zhang, Zixuan Wang, Changsheng Li, Yinjie Lei

प्रकाशित 2026-08-07
📖 8 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Bo Zhang, Wenxin Wang, Feng Chen, Zhihao Zhang, Zixuan Wang, Changsheng Li, Yinjie Lei

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान रोबोट को फिल्म देखना और उस पर आधारित सवालों के जवाब देना सिखाने की कोशिश कर रहे हैं। यह रोबोट, जिसे मल्टीमॉडल लार्ज लैंग्वेज मॉडल (या संक्षेप में MLLM) कहा जाता है, चित्रों और शब्दों को समझने में अविश्वसनीय रूप से प्रतिभाशाली है। हालाँकि, एक समस्या है: फिल्में लंबी होती हैं, और रोबोट की "शॉर्ट-टर्म मेमोरी" (अल्पकालिक स्मृति) सीमित होती है। यदि आप रोबोट को पूरी दो घंटे की फिल्म फ्रेम-दर-फ्रेम खिलाते हैं, तो वह अभिभूत हो जाता है, महत्वपूर्ण हिस्सों को भूल जाता है, और एक स्थिर दीवार के धीमे पैन जैसे उबाऊ, दोहराव वाले दृश्यों को प्रोसेस करने में भारी मात्रा में ऊर्जा बर्बाद करता है। इसे ठीक करने के लिए, वैज्ञानिक रोबोट को एक बेहतर संपादक बनने के लिए सिखाने की कोशिश कर रहे हैं, ताकि वह केवल सबसे महत्वपूर्ण क्षणों को चुन सके। लेकिन पुराने तरीके से संपादन करना एक कठोर, पहले से लिखे गए स्क्रिप्ट की तरह था: यह यह अनुमान लगाने के लिए बाहरी उपकरणों पर निर्भर था कि क्या दिलचस्प है, जिससे अक्सर वे सूक्ष्म संकेत छूट जाते थे जिनकी वास्तव में रहस्य सुलझाने के लिए रोबोट को आवश्यकता होती थी।

यहीं पर EviSelect नामक एक नया दृष्टिकोण आता है। EviSelect को एक कठोर संपादक के रूप में नहीं, बल्कि एक जिज्ञासु जासूस के रूप में सोचें जो रोबोट के अपने मन को पढ़ना सीखता है। यह पूछने के बजाय कि किसी बाहरी विशेषज्ञ को क्या देखना चाहिए, EviSelect रोबोट के आंतरिक "अटेंशन मैप्स" (attention maps)—जो मूल रूप से एक हीट मैप है जो दिखाता है कि रोबोट का मस्तिष्क स्वाभाविक रूप से वीडियो के किन हिस्सों पर ध्यान केंद्रित कर रहा है—पर नज़र डालता है। "स्पार्स प्रीफिलिंग" (sparse prefilling) नामक एक चतुर तकनीक का उपयोग करके (जो पूरी फिल्म का एक सामान्य अहसास प्राप्त करने के लिए एक त्वरित, कम-रिज़ॉल्यूशन वाला स्नैपशॉट लेने जैसा है), EviSelect यह पता लगाता है कि एक्शन कहाँ है, चीजें कितनी तेज़ी से चल रही हैं, और कितने विवरण की आवश्यकता है। इसके बाद यह एक हल्के वजन वाले "सेलेक्टर" (selector) को वीडियो के हर क्षण के लिए तीन स्मार्ट निर्णय लेने के लिए प्रशिक्षित करता है: क्या हमें यह दृश्य रखना चाहिए? हमें यहाँ कितने फ्रेम दिखाने चाहिए? और तस्वीर कितनी स्पष्ट होनी चाहिए?

इसके परिणाम दक्षता के मामले में जादू की तरह हैं। तीन अलग-अलग लंबी-वीडियो चुनौतियों में परीक्षणों में, EviSelect ने मौजूदा तरीकों के समान या उनसे बेहतर प्रदर्शन किया, लेकिन इसने यह सब लगभग 50% कम विजुअल टोकन (वीडियो के डिजिटल निर्माण खंड) का उपयोग करके किया। डेटा में इस भारी कमी ने न केवल मेमोरी बचाई; बल्कि इसने पूरी प्रक्रिया को 3.9 गुना तेज़ बना दिया। पेपर सुझाव देता है कि रोबोट के अपने आंतरिक साक्ष्य को चयन का मार्गदर्शन करने देकर, बजाय कठोर नियमों या बाहरी अनुमान लगाने वालों के, हम वीडियो-समझने वाली ऐसी प्रणालियाँ बना सकते हैं जो अविश्वसनीय रूप से स्मार्ट और आश्चर्यजनक रूप से कुशल दोनों हों।

समस्या: "बहुत अधिक जानकारी" का बॉटलनेक

लंबे वीडियो वर्तमान AI के लिए एक दुःस्वप्न हैं। यदि आप एक रोबोट को 30 मिनट का वीडियो देखने और एक प्रश्न का उत्तर देने के लिए कहते हैं, तो वह एक दुविधा का सामना करता है। वह सब कुछ याद नहीं रख सकता, इसलिए वह "कीफ्रेम्स" (keyframes)—सबसे महत्वपूर्ण क्षणों—को चुनने की कोशिश करता है। लेकिन इन फ्रेमों को चुनने के पुराने तरीके त्रुटिपूर्ण थे। वे एक ऐसे फिल्म संपादक की तरह थे जो केवल संगीत के शोर या रंगों की चमक के आधार पर दृश्यों को काटने का निर्णय लेता है, कहानी को अनदेखा कर देता है। इन तरीकों ने (समानता स्कोर करने वाले एक अलग AI जैसे) बाहरी उपकरणों का उपयोग किया ताकि यह तय किया जा सके कि क्या रखना है। समस्या क्या थी? वह बाहरी उपकरण यह नहीं जानता था कि मुख्य रोबोट क्या सोच रहा है। वह एक चमकदार विस्फोट को हाइलाइट कर सकता है जबकि रोबोट को पहेली सुलझाने के लिए वास्तव में एक शांत बातचीत देखने की आवश्यकता थी।

इसके अलावा, ये पुराने तरीके "कठोर" थे। उन्होंने हर वीडियो के साथ एक जैसा व्यवहार किया, एक निश्चित संख्या में फ्रेम और एक निश्चित आकार में चुने। यह एक किताब को हर शब्द के बीच के स्थान सहित हर अक्षर को देखकर पढ़ने जैसा है, चाहे वाक्य सरल हो या जटिल। यह उबाऊ हिस्सों पर ऊर्जा बर्बाद करता है और रोमांचक हिस्सों की बारीकियों को मिस कर देता है।

समाधान: रोबोट के मन को पढ़ना

इस पेपर के लेखक, बो झांग और उनकी टीम ने EviSelect नामक एक नया ढांचा प्रस्तावित किया है। रोबोट को क्या चाहिए इसका अनुमान लगाने के बजाय, EviSelect सीधे रोबोट से पूछता है।

यह कैसे काम करता है, चरण-दर-चरण:

  1. "स्पार्स प्रीफिल" (Sparse Prefill) ट्रिक: रोबोट को पूरा वीडियो दिखाने से पहले, EviSelect उसे फिल्म का एक छोटा, संकुचित संस्करण देता है। यह रोबोट को पूरी फिल्म के त्वरित, धुंधले थंबनेल दिखाने जैसा है। यह सस्ता और तेज़ है।
    2."अटेंशन" (Attention) सुराग: भले ही वीडियो धुंधला और छोटा हो, रोबोट का मस्तिष्क अभी भी विशिष्ट क्षेत्रों में चमकता है। EviSelect इन "अटेंशन मैप्स" को कैप्चर करता है। यह उन्हें तीन प्रकार के सुरागों में तोड़ता है:
    • प्रासंगिकता (Relevance): क्या यह क्षण प्रश्न से मेल खाता है?
    • समय (Time): यह क्षण पिछले और अगले क्षणों से कैसे जुड़ता है?
    • स्थान (Space): क्या यहाँ बहुत अधिक विवरण की आवश्यकता है, या यह एक साधारण बैकग्राउंड है?
  2. स्मार्ट सेलेक्टर (Smart Selector): एक छोटा, हल्का AI ("सेलेक्टर") इन सुरागों को देखता है और वीडियो के प्रत्येक टाइमस्टैम्प के लिए तीन गतिशील निर्णय लेता है:
    • रखना या छोड़ना (Keep or Drop): क्या हमें इस सेकंड को बिल्कुल भी देखना चाहिए?
    • सैंपलिंग रेट (Sampling Rate): यदि हम इसे देखते हैं, तो क्या हमें प्रति सेकंड 1 फ्रेम, 4 फ्रेम या 8 फ्रेम की आवश्यकता है? (तेज़ एक्शन के लिए अधिक फ्रेम चाहिए; एक धीमी दृश्य के लिए कम फ्रेम)।
    • रेज़ोल्यूशन (Resolution): क्या हमें 4K तस्वीर चाहिए, या एक लो-रेज़ स्केच काफी होगा? (एक स्पष्ट चेहरा हाई-रेज़ चाहिए; एक अंधेरा गलियारा शायद लो-रेज़ में भी काम चल जाए)।

प्रशिक्षण: "ग्रुप तुलना" द्वारा सीखना

आप एक रोबोट को इन सेकंड-दर-सेकंड के संपादन निर्णय लेने के लिए कैसे सिखाते हैं? लेखकों ने GRPO (Group Relative Policy Optimization) नामक एक तकनीक का उपयोग किया। एक गेम शो की कल्पना करें जहाँ रोबोट एक ही समय में आठ अलग-अलग तरीकों से एक वीडियो को एडिट करने की कोशिश करता है। फिर सिस्टम चेक करता है कि किस वर्ज़न ने सही उत्तर प्राप्त किया। यदि एक वर्ज़न ने सही उत्तर दिया और कम पिक्सल का उपयोग किया, तो उसे एक बड़ा इनाम मिलता है। यदि उसने सही उत्तर दिया लेकिन बहुत अधिक पיםक्सल का उपयोग किया, तो उसे छोटा इनाम मिलता है। यदि उसने गलत उत्तर दिया, तो उसे कोई इनाम नहीं मिलता, भले ही वह कुशल रहा हो।

यह "ग्रुप तुलना" रोबोट को सही संतुलन खोजने के लिए प्रशिक्षित करती है: सही उत्तर देना और साथ ही न्यूनतम दृश्य डेटा का उपयोग करना।

परिणाम: तेज़, स्मार्ट, लीन

पेपर ने तीन प्रमुख बेंचमार्क पर EviSelect का परीक्षण किया: MLVU, LongVideoBench, और Video-MME। ये लंबी वीडियो समझ के लिए "ओलंपिक्स" की तरह हैं, जिनमें फिल्में, निगरानी फुटेज और जटिल कथाएं शामिल हैं।

निष्कर्ष प्रभावशाली थे:

  • सटीकता (Accuracy): EviSelect ने स्टेट-ऑफ-द-आर्ट प्रदर्शन हासिल किया, जिसने TSPO और Q-Frame जैसे मौजूदा तरीकों को पीछे छोड़ दिया। उदाहरण के लिए, Video-MME बेंचमार्क पर, इसने पिछले सर्वश्रेष्ठ की तुलना में सटीकता में 1.9% का सुधार किया।
  • दक्षता (Efficiency): इसने औसतन केवल 1,701 विजुअल टोकन का उपयोग किया, जबकि पिछले सर्वश्रेष्ठ तरीकों ने लगभग 3,360 का उपयोग किया था। यह डेटा में 49% की कमी है।
  • गति (Speed): क्योंकि यह कम डेटा प्रोसेस करता है, एंड-टू-एंड समय लगभग 10 सेकंड से घटकर केवल 2.55 सेकंड रह गया। यह 3.9x की गति वृद्धि है।

इसका क्या अर्थ है (और क्या नहीं है)

पेपर सुझाव देता है कि लंबी वीडियो को समझने की कुंजी केवल समस्या में अधिक कंप्यूटिंग पावर झोंकना नहीं है; बल्कि यह इस बारे में स्मार्ट होना है कि हम क्या देख रहे हैं। रोबोट के अपने आंतरिक "साक्ष्य" का उपयोग करके, बजाय बाहरी अनुमान लगाने वालों के, EviSelect हर वीडियो की अनूठी लय के अनुकूल हो जाता है।

हालाँकि, लेखक इसकी सीमाओं को लेकर भी सावधान हैं। चूंकि EviSelect विशेष रूप से रोबोट के आंतरिक अटेंशन से सीखता है, इसलिए यह पूरी तरह से काम नहीं कर सकता है यदि आप इसे बिना रिट्रेनिंग के किसी पूरी तरह से अलग प्रकार के रोबोट पर स्थानांतरित करते हैं। इसके अलावा, इस पद्धति के लिए रोबोट के आंतरिक "मस्तिष्क" (अटेंशन मैप्स) तक पहुंच की आवश्यकता होती है, इसलिए इसका उपयोग क्लोज्ड-सोर्स "ब्लैक बॉक्स" मॉडल पर नहीं किया जा सकता है जहाँ यह जानकारी छिपी होती है।

संक्षेप में, EviSelect साबित करता है कि यदि आप एक AI को यह सिखाते हैं कि वह जो महत्वपूर्ण है उसके बारे में अपने स्वयं के अंतर्ज्ञान पर भरोसा करे, तो वह आधी मेहनत और चार गुना गति के साथ एक फिल्म देख सकता है, सुराग ढूंढ सकता है और रहस्य सुलझा सकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →