तकनीकी सारांश: MERIT (Multi-key Episodic Retrieval with Inference-time Temporal expansion)
समस्या विवरण (Problem Statement)
मल्टी-मोडल लार्ज लैंग्वेज मॉडल्स (MLLMs) के तीव्र विकास ने वीडियो समझ को छोटे क्लिप्स से बदलकर घंटों या यहाँ तक कि दिनों तक चलने वाले अल्ट्रा-लॉन्ग स्ट्रीम्स में स्थानांतरित कर दिया है। हालाँकि, ऐसे अल्ट्रा-लॉन्ग वीडियो को सीधे एंड-टू-एंड प्रोसेस करना कॉन्टेक्स्ट विंडो की सीमाओं के कारण कम्प्यूटेशनल रूप से असंभव है। जबकि रिट्रीवल-ऑगमेंटेड जनरेशन (RAG) फ्रेमवर्क्स एक समाधान प्रदान करते हैं, पिछले दृष्टिकोण अल्ट्रा-लॉन्ग सेटिंग में दो महत्वपूर्ण अक्षमताओं से ग्रस्त हैं:
- क्वेरी-अग्नोस्टिक ओवरहेड (Query-Agnostic Overhead): मौजूदा तरीके (जैसे, पदानुक्रमित सारांशीकरण या ग्राफ-आधारित मेमोरी) डाउनस्ट्रीम क्वेरी जानने से पहले उच्च-स्तरीय सिमेंटिक संबंधों और संरचनाओं को मॉडल करने में महत्वपूर्ण कम्प्यूटेशनल संसाधन निवेश करते हैं। यह एक "क्वेरी-अग्नोस्टिक एब्स्ट्रैक्शन" को मजबूर करता है जो विशिष्ट रूप से आवश्यक जानकारी के साथ संरेखित नहीं हो सकता है।
- इंटेलिजेंस मिसलोकेशन (Intelligence Misallocation): जटिल, स्थिर मेमोरी निर्माण (जैसे, सेगमेंट को डे-लेवल सारांशों में मर्ज करना या नॉलेज ग्राफ बनाना) के लिए शक्तिशाली MLLMs का उपयोग करना उच्च-क्षमता वाले तर्क (reasoning) को उन कार्यों पर व्यर्थ करता है जिन्हें बाद के लिए टाला जा सकता था।
लेखक तर्क देते हैं कि बाधा उन्नत (advance) में जटिल स्टेटिक सिमेंटिक्स बनाने के बजाय, हाई-रिकॉल रिट्रीवल (high-recall retrieval) को सक्षम करने की ओर स्थानांतरित होनी चाहिए जो लगातार सही सूक्ष्म साक्ष्य (fine-grained evidence) प्रदान कर सके, और सिमेंटिक कंपोजिशन को इन्फरेंस टाइम (inference time) पर टाल देना चाहिए जब क्वेरी ज्ञात हो।
कार्यप्रणाली: MERIT (Methodology: MERIT)
MERIT एक हल्का, एजेंटिक फ्रेमवर्क है जिसे अल्ट्रा-लॉन्ग वीडियो समझने के लिए डिज़ाइन किया गया है। यह एक न्यूनतम दो-चरणीय प्रतिमान (paradigm) अपनाता है: एपिसोडिक मेमोरी कंस्ट्रक्शन (क्वेरी-अग्नोस्टिक) के बाद एजेंटिक रिट्रीवल एंड एनswering (क्वेरी-अवेयर)।
1. एपिसोडिक मेमोरी कंस्ट्रक्शन (चरण 1)
जटिल पदानुक्रमित ग्राफ या मल्टी-स्केल सारांश बनाने के बजाय, MERIT वीडियो V को गैर-ओवरलैपिंग 30-सेकंड के क्लिप्स में विभाजित करता है। प्रत्येक क्लिप के लिए, यह एक डेंस कैप्शन जेनरेट करता है और मल्टी-कीज़ (Ki) का एक सेट निकालता है।
- मल्टी-की रिप्रेजेंटेशन (Multi-Key Representation): प्रत्येक क्लिप को विविध दृष्टिकोणों को कैप्चर करने के लिए चार अलग-अलग, पूरक कुंजियों (keys) द्वारा इंडेक्स किया जाता है:
- इवेंट/एक्शन की (Event/Action Key): अवलोकन योग्य भौतिक क्रियाएं और इंटरैक्शन।
- डायलॉग/मेंशन की (Dialogue/Mention Key): बोले गए शब्द, कमांड, या विशिष्ट शब्द।
- ऑब्जेक्ट की (Object Key): संभाली गई, अनुरोधित या हिलाई गई विशिष्ट वस्तुएं, जिसमें स्टेट ट्रांज़िशन भी शामिल हैं।
- समरी की (Summary Key): मुख्य नैरेटिव का एक संक्षिप्त, कीवर्ड-शैली का एब्स्ट्रैक्शन।
- मेमोरी स्टोर (Memory Store): मेमोरी M एक सरल की-वैल्यू स्टोर है जहाँ कुंजियाँ (Ki) रिट्रीवल को सक्षम करती हैं और वैल्यूज़ (vi,di) कच्चे साक्ष्य प्रदान करती हैं।
2. एजेंटिक रिट्रीवल एंड एनswering (चरण 2)
इन्फरेंस के समय, सिस्टम एक इटरेटिव मल्टी-टर्न लूप में काम करता है:
- मल्टी-की रिट्रीवल (Multi-Key Retrieval): सॉल्वर एक रिट्रीवल क्वेरी q(j) जेनरेट करता है और एक सेंटेंस एम्बेडिंग मॉडल का उपयोग करके संग्रहीत कुंजियों के विरुद्ध इसे मैच करता है। रिट्रीवल रेलेवेंस को दिए गए क्लिप के लिए सभी कुंजियों में मैक्सिमम सिमिलैरिटी द्वारा निर्धारित किया जाता है:
Si(j)=k∈Kimaxsim(E(q(j)),E(k))
यह एक क्लिप को तब रिट्रीव करने की अनुमति देता है यदि इसकी कोई भी कुंजी क्वेरी के साथ संरेखित होती है, जिससे रिकॉल में काफी सुधार होता है।
- नेबर फिल्टरिंग (टेंपोरल एक्सपेंशन) (Neighbor Filtering - Temporal Expansion): यह पहचानते हुए कि साक्ष्य अक्सर कई आस-पास के क्षणों में फैले होते हैं, MERIT केवल रिट्रीव किए गए 30-सेकंड के एंकर पर निर्भर नहीं रहता है। रिट्रीव किए गए क्लिप्स के एक सेट को प्राप्त करने पर, सिस्टम पड़ोसी क्लिप्स (जैसे, ±Δ क्लिप्स) को शामिल करके टेंपोरल कॉन्टेक्स्ट को गतिशील रूप से विस्तारित करता है।
- क्वेरी-अवेयर फिल्टरिंग (Query-Aware Filtering): सॉल्वर इस विस्तारित लोकल कॉन्टेक्स्ट पर एक फिल्टर के रूप में कार्य करता है, जो केवल विशिष्ट क्वेरी के लिए प्रासंगिक जानकारी को निकालता है। यह पूर्व-निर्धारित ग्लोबल स्ट्रक्चर के बिना एक सुसंगत कॉन्टेक्स्ट को पुनर्गठित करता है।
- इटरेटिव रीजनिंग (Iterative Reasoning): एजेंट यह आकलन करता है कि क्या संचित साक्ष्य पर्याप्त हैं। यदि नहीं, तो वह क्वेरी को रिफाइन करता है और रिट्रीवल को दोहराता है; अन्यथा, वह अंतिम उत्तर जेनरेट करने के लिए साक्ष्य को एकीकृत करता है।
मुख्य योगदान (Key Contributions)
- इंटेलिजेंस एलोकेशन में प्रतिमान परिवर्तन (Paradigm Shift in Intelligence Allocation): यह पेपर क्वेरी-अग्नोस्टिक प्रीप्रोसेसिंग में निवेश करने के बजाय इन्फरेंस टाइम पर सिमेंटिक कंपोजिशन को टालने का प्रस्ताव देता है। यह MLLM की पूर्ण रीजनिंग क्षमता का उपयोग केवल तभी करता है जब कार्य निर्दिष्ट किया जाता है।
- सरल लेकिन प्रभावी मल्टी-की इंडेक्सिंग (Simple yet Effective Multi-Key Indexing): न्यूनतम एपिसोडिक सेगमेंट्स से चार विषम (heterogeneous) कुंजियाँ जोड़कर, MERIT पदानुक्रमित या ग्राफ-आधारित मेमोरी कंस्ट्रक्शन के कम्प्यूटेशनल ओवरहेड के बिना हाई-रिकॉल रिट्रीवल प्राप्त करता है।
- ऑन-डिमांड टेंपोरल एक्सपेंशन (On-Demand Temporal Expansion): "नेबर फिल्टरिंग" तंत्र इन्फरेंस के समय केवल रिट्रीव किए गए सेगमेंट्स के आसपास टेंपोरल स्कोप को विस्तारित करके व्यापक सिमेंटिक कॉन्टेक्स्ट को कैप्चर करता है, जिससे ग्लोबल मेमोरी कंस्ट्रक्शन की भारी लागत से बचा जा सके।
- मिनिमलिस्ट आर्किटेक्चर (Minimalist Architecture): MERIT महंगे मल्टी-स्टेज मेमोरी कंसोलिडेशन की आवश्यकता को समाप्त करता है, और इसके बजाय एक सरल की-मैचिंग मैकेनिज्म और डायनेमिक कॉन्टेक्स्ट एक्सपेंशन पर भरोसा करता है।
प्रयोगात्मक परिणाम (Experimental Results)
MERIT का मूल्यांकन तीन लॉन्ग-वीडियो बेंचमार्क्स पर किया गया: EgoLifeQA (अल्ट्रा-लॉन्ग, एगोजेंट्रिक), LVBench (घंटे भर का), और Video-MME (Long)।
- स्टेट-ऑफ-द-आर्ट परफॉरमेंस (State-of-the-Art Performance): MERIT ने सभी बेंचमार्क्स पर नए SOTA परिणाम हासिल किए।
- EgoLifeQA पर, GPT-5 को सॉल्वर के रूप में उपयोग करते हुए, MERIT ने 71.2% औसत सटीकता प्राप्त की, जो पिछले SOTA (WorldMM के साथ GPT-5) से +5.6% बेहतर है।
- LVBench पर, MERIT (GPT-5) ने 71.8% प्राप्त किया, जो पिछले SOTA से +9.9% अधिक है।
- Video-MME (Long) पर, MERIT ने 77.7% हासिल किया, जो WorldMM (76.6%) से बेहतर है।
- दक्षता (Efficiency): MERIT ने मेमोरी कंस्ट्रक्शन में महत्वपूर्ण दक्षता लाभ प्रदर्शित किया। WorldMM की तुलना में, इसने इनपुट टोकन को 8.4× और आउटपुट टोकन को 8.6× कम कर दिया, जबकि LLM कॉल्स को ~23,700 से घटाकर ~6,200 कर दिया।
- रिट्रीवल क्वालिटी (Retrieval Quality): MERIT ने पदानुक्रमित (EgoRAG: 0.15) और ग्राफ-आधारित (WorldMM: 0.53) बेसलाइन्स की तुलना में उच्च हिट रेट (0.56) प्राप्त किया, जो पुष्टि करता है कि सटीक, फाइन-ग्रेन्ड रिट्रीवल QA प्रदर्शन के लिए महत्वपूर्ण है।
- एब्लेशन स्टडीज (Ablation Studies):
- नेबर फिल्टरिंग (Neighbor Filtering): इस घटक को हटाने से प्रदर्शन में काफी गिरावट आई, विशेष रूप से उन श्रेणियों में जिनमें व्यापक कॉन्टेक्स्ट की आवश्यकता होती है (जैसे, RelationMap, HabitInsight)।
- मल्टी-की कॉम्बिनेशन (Multi-Key Combinations): सभी चार कुंजियों का एक साथ उपयोग करने से उच्चतम सटीकता मिली, जो कुंजियों की पूरक प्रकृति को प्रमाणित करती है।
- सॉल्वर डिपेंडेंसी (Solver Dependency): प्रदर्शन मजबूत सॉल्वर्स (जैसे, GPT-5 बनाम Qwen3-VL-8B) के साथ काफी स्केल हुआ, जो इस परिकल्पना को पुख्ता करता है कि मेमोरी को हल्का होना चाहिए जबकि सॉल्वर को जटिल तर्क संभालना चाहिए।
महत्व और दावे (Significance and Claims)
पेपर का दावा है कि क्वेरी-अग्नोस्टिक प्रीप्रोसेसिंग में निवेश करने के बजाय क्वेरी टाइम पर सिमेंटिक कंपोजिशन को टालना एक अधिक मौलिक और प्रभावी दृष्टिकोण है। परिणाम बताते हैं कि:
- सादगी प्रभावी है (Simplicity is Effective): एक सरल एपिसोडिक मल्टी-की मेमोरी, ऑन-डिमांड टेंपोरल एक्सपेंशन के साथ मिलकर, जटिल पदानुक्रमित और ग्राफ-आधारित आर्किटेक्चर से बेहतर प्रदर्शन कर सकती है।
- रिट्रीवल ही बाधा है (Retrieval is the Bottleneck): पूर्व-निर्धारित सिमेंटिक संरचनाओं की तुलना में फाइन-ग्रेन्ड साक्ष्य का हाई-रिकॉल रिट्रीवल अधिक महत्वपूर्ण है।
- स्केलेबिलिटी (Scalability): फ्रेमवर्क वीडियो की लंबाई बढ़ने के साथ जटिल ग्लोबल मेमोरी स्ट्रक्चर को अपडेट करने की कैस्केडिंग कम्प्यूटेशनल लागतों से बचकर, किसी भी लंबे वीडियो के लिए अत्यधिक स्केलेबल है।
लेखक MERIT को अल्ट्रा-लॉन्ग वीडियो समझने के लिए एक व्यावहारिक और स्केलेबल आधार के रूप में स्थापित करते हैं, और इस बात पर जोर देते हैं कि जटिल तर्क के लिए आवश्यक "इंटेलिजेंस" को इन्फरेंस स्टेज पर आवंटित किया जाना चाहिए जहाँ क्वेरी आवश्यक एब्स्ट्रैक्शंस को परिभाषित करती है।