← नवीनतम पेपर
💻 computer science

MSJoE: Jointly Evolving MLLM and Sampler for Efficient Long-Form Video Understanding

यह शोध पत्र MSJoE को प्रस्तुत करता है, जो एक नवीन ढांचा है जो लंबे वीडियो को समझने के लिए सूचनात्मक फ्रेम को कुशलतापूर्वक चुनने हेतु सुदृढीकरण शिक्षण (reinforcement learning) के माध्यम से एक मल्टीमॉडल लार्ज लैंग्वेज मॉडल और एक हल्के की-फ्रेम सैंपलर को संयुक्त रूप से विकसित करता है, जिससे कई बेंचमार्क पर अत्याधुनिक प्रदर्शन प्राप्त होता है।

मूल लेखक: Wenhui Tan, Xiaoyi Yu, Jiaze Li, Yijing Chen, Jianzhong Ju, Zhenbo Luo, Ruihua Song, Jian Luan

प्रकाशित 2026-02-27
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Wenhui Tan, Xiaoyi Yu, Jiaze Li, Yijing Chen, Jianzhong Ju, Zhenbo Luo, Ruihua Song, Jian Luan

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रहस्य सुलझाने की कोशिश कर रहे हैं, लेकिन आपके पास कुछ सुरागों के बजाय, एक व्यस्त शहर का 10 घंटे का सुरक्षा कैमरा टेप है। आपको वह एक क्षण ढूंढना है जहाँ किसी व्यक्ति ने चाबी गिरा दी थी।

यदि आप पूरे टेप को सामान्य गति से देखते हैं, तो इसमें बहुत समय लगेगा। यदि आप हर 10वें सेकंड को देखते हैं (एकसमान सैंपलिंग), तो आप चाबी गिरने के क्षण को मिस कर सकते हैं क्योंकि वह आपकी एक नज़र के बीच के छोटे से पल में हुआ होगा।

यही वह समस्या है जिसे MSJoE आर्टिफिशियल इंटेलिजेंस (AI) के लिए हल करता है।

यहाँ बताया गया है कि यह नया सिस्टम कैसे काम करता है, कुछ रचनात्मक उपमाओं (analogies) का उपयोग करके।

समस्या: "बहुत अधिक जानकारी" की बाधा (The "Too Much Information" Bottleneck)

वर्तमान AI मॉडल (जिन्हें MLLM कहा जाता है) प्रतिभाशाली जासूसों की तरह हैं जो टेक्स्ट और छवियों को पढ़ और समझ सकते हैं। लेकिन जब आप उन्हें एक लंबा वीडियो देते हैं, तो वे अभिभूत (overwhelmed) हो जाते हैं।

  • पुराना तरीका: वे हर फ्रेम को देखने की कोशिश करते हैं, या वे यादृच्छिक अंतराल (random intervals) पर फ्रेम चुनते हैं (जैसे हर 5 मिनट में अपनी घड़ी देखना)। यह धीमा है और अक्सर महत्वपूर्ण चीजों को मिस कर देता है।
  • खामी: वीडियो का अधिकांश हिस्सा उबाऊ होता है (लोग चल रहे हैं, बादल हिल रहे हैं)। AI अपने दिमाग की शक्ति को उबाऊ हिस्सों पर बर्बाद करता है और "की फ्रेम्स" (जासूसी सुराग) को मिस कर देता है।

समाधान: "स्मार्ट डिटेक्टिव और स्काउट" की टीम

इस पेपर के लेखकों ने दो AI एजेंटों की एक टीम बनाई है जो सीखते हैं कि एक साथ मिलकर पूरी तरह से कैसे काम करना है। वे इसे MSJoE (Jointly Evolving MLLM and Sampler) कहते हैं।

इसे एक डिटेक्टिव (जासूस) और एक स्काउट (खोजी) के रूप में सोचें।

1. द स्काउट (द सैंपलर)

स्काउट का काम 10 घंटे के वीडियो को देखना और डिटेक्टिव को दिखाने के लिए 32 सबसे महत्वपूर्ण फ्रेम चुनना है।

  • पुराने स्काउट्स: वे सरल नियमों का उपयोग करते थे (जैसे, "हर 5 मिनट में एक फ्रेम चुनें")। वे कभी-कभी उबाऊ फ्रेम चुन लेते थे।
  • MSJoE स्काउट: यह स्काउट "ट्रेनेबल" (प्रशिक्षण योग्य) है। यह विशिष्ट चीजों को खोजने के लिए सीखना जानता है। लेकिन यह अभी खुद से यह अनुमान नहीं लगा सकता कि क्या खोजना है।

2. द डिटेक्टिव (द MLLM)

डिटेक्टिव बड़ा दिमाग है। वह लाए गए फ्रेमों को देखता है और प्रश्न का उत्तर देता है।

  • समस्या: यदि डिटेक्टिव केवल कहता है, "मुझे चाबी ढूंढ कर दो," तो स्काउट को यह समझने में मुश्किल हो सकती है कि वीडियो के संदर्भ में "चाबी" कैसी दिखती है।
  • MSJoE डिटेक्टिव: केवल "चाबी ढूंढो" कहने के बजाय, डिटेक्टिव पहले सोचता है और प्रश्न को विशिष्ट दृश्य संकेतों (visual clues) में तोड़ता है।
    • खराब प्रश्न: "चाबी किसने गिराई?"
    • MSJoE डिटेक्टिव के संकेत: "धातु की वस्तु पकड़े हुए एक हाथ दिखाएं," "ज़मीन की ओर देखते हुए एक व्यक्ति दिखाएं," "फुटपाथ पर एक चमकदार वस्तु दिखाएं।"

वे एक साथ कैसे सीखते हैं ("संयुक्त विकास" - The Joint Evolution)

यह सबसे जादुई हिस्सा है। पिछले तरीकों में, डिटेक्टिव और स्काउट को अलग-अलग प्रशिक्षित किया जाता था। डिटेक्टिव को यह नहीं पता था कि स्काउट फ्रेम कैसे चुनता है, और स्काउट को यह नहीं पता था कि डिटेक्टिव को क्या चाहिए।

MSJoE में, वे रीइन्फोर्समेंट लर्निंग (Reinforcement Learning) नामक विधि का उपयोग करके उन्हें एक साथ प्रशिक्षित करते हैं (इसे एक वीडियो गेम की तरह समझें जहाँ जीतने पर अंक मिलते हैं)।

  1. लूप (The Loop):

    • डिटेक्टिव वीडियो के एक छोटे प्रीव्यू को देखता है और "विजुअल क्लूज़" (क्वेरीज़) की एक सूची लिखता है।
    • स्काउट उन संकेतों का उपयोग करके पूरे वीडियो को स्कैन करता है और सबसे अच्छे फ्रेम चुनता है।
    • डिटेक्टिव उन फ्रेमों को देखता है और प्रश्न का उत्तर देता है।
    • यदि वे सही उत्तर देते हैं: दोनों को एक "हाई फाइव" (पुरस्कार/रिवॉर्ड) मिलता है।
    • यदि वे गलत होते हैं: दोनों सीखते हैं कि कहाँ गलती हुई।
  2. परिणाम:

    • डिटेक्टिव बेहतर, अधिक विशिष्ट संकेत लिखने के लिए सीखता है ताकि स्काउट सही फ्रेम ढूंढ सके।
    • स्काउट उबाऊ हिस्सों को अनदेखा करना और ठीक उसी चीज़ पर ध्यान केंद्रित करना सीखता है जिसके लिए डिटेक्टिव कह रहा है।
    • वे एक साथ विकसित होते हैं, और एक परफेक्ट टीम बन जाते हैं।

"ट्रेनिंग कैंप" (नया डेटासेट)

इस टीम को प्रशिक्षित करने के लिए, शोधकर्ताओं ने महसूस किया कि मौजूदा वीडियो पर्याप्त कठिन नहीं थे। इसलिए, उन्होंने एक नया "जिम" (एक डेटासेट जिसे LongVideoQA कहा जाता है) बनाया।

  • उन्होंने 2,800 लंबे वीडियो (फिल्में, खेल, वृत्तचित्र) लिए।
  • उन्होंने समय के साथ घटनाओं को जोड़ने वाले कठिन प्रश्न उत्पन्न करने के लिए AI का उपयोग किया (जैसे, "चरित्र ने अपना आहार क्यों बदला?" के लिए डेंटिस्ट के पास जाने और पारिवारिक रात्रिभोज दोनों को देखना आवश्यक है)।
  • उन्होंने आसान प्रश्नों को हटा दिया ताकि AI टीम केवल कठिन चीजों का अभ्यास करे।

यह क्यों मायने रखता है?

  • गति: यह बहुत तेज़ है। 1,000 फ्रेम प्रोसेस करने के बजाय, यह केवल 32 फ्रेम प्रोसेस करता है।
  • स्मार्ट: यह केवल अनुमान नहीं लगाता; यह देखने से पहले इस बारे में तर्क करता है कि क्या देखना है।
  • बेहतर परिणाम: परीक्षणों में, इस टीम ने पिछले सर्वश्रेष्ठ तरीकों को काफी बड़े अंतर से पीछे छोड़ दिया (लग लगभग 8% बेहतर सटीकता)।

निचोड़ (The Bottom Line)

कल्पना कीजिए कि आप घास के ढेर में सुई ढूंढने की कोशिश कर रहे हैं।

  • पुराना AI: यादृच्छिक स्थानों से घास के कुछ गुच्छे उठाता है।
  • MSJoE: पहले पूछता है, "सुई कैसी दिखती है?" फिर वह एक चुंबक (स्काउट) भेजता है ताकि केवल धातु के हिस्सों को बाहर निकाला जा सके, और अंत में, वह सुई को खोजने के लिए धातु का परीक्षण करता है।

AI को यह सोचने के बारे में कि क्या खोजना है और इसे खोजने के तरीके के बारे में सीखने के लिए एक साथ प्रशिक्षित करके, उन्होंने लंबे वीडियो को समझने की प्रक्रिया को कुशल, सटीक और बहुत स्मार्ट बना दिया।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →