← नवीनतम पेपर
💻 computer science

Learning Compact Video Representations for Efficient Long-form Video Understanding in Large Multimodal Models

यह शोध पत्र बड़े मल्टीमॉडल मॉडल्स में कुशल लॉन्ग-फॉर्म वीडियो समझ के लिए एक एंड-टू-एंड फ्रेमवर्क का प्रस्ताव करता है जो मेमोरी की बाधाओं को दूर करने और अनावश्यक वीडियो अनुक्रमों से भेदभावपूर्ण जानकारी निकालने के लिए सूचना-घनत्व-आधारित अनुकूली वीडियो सैंपलर और ऑटोएन्कोडर-आधारित स्थानिक-कालिक संकुचक (स्पैटियोटेम्पोरल कंप्रेसर) को जोड़ता है।

मूल लेखक: Yuxiao Chen, Jue Wang, Zhikang Zhang, Jingru Yi, Xu Zhang, Yang Zou, Zhaowei Cai, Jianbo Yuan, Xinyu Li, Hao Yang, Davide Modolo

प्रकाशित 2026-02-23
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yuxiao Chen, Jue Wang, Zhikang Zhang, Jingru Yi, Xu Zhang, Yang Zou, Zhaowei Cai, Jianbo Yuan, Xinyu Li, Hao Yang, Davide Modolo

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके डेस्क पर एक विशाल, 3-घंटे की फिल्म रखी है, और आप चाहते हैं कि एक सुपर-स्मार्ट AI असिस्टेंट (एक "लार्ज मल्टीमॉडल मॉडल" या MLLM) इसे देखे और उस पर एक विशिष्ट प्रश्न का उत्तर दे।

समस्या क्या है? वह फिल्म बहुत बड़ी है।
यदि आप पूरी फिल्म को AI को खिलाने की कोशिश करते हैं, तो यह एक तेज़ जलधारा (firehose) से पानी पीने जैसा होगा। AI अभिभूत हो जाएगा, उसकी मेमोरी खत्म हो जाएगी, और वह मतिभ्रम (hallucination) करने लगेगा (चीज़ें बनाने लगेगा) क्योंकि वह बहुत अधिक डेटा में डूब रहा है। फिल्म का अधिकांश हिस्सा ऐसा है जहाँ लोग बस स्थिर बैठे हैं, धीरे चल रहे हैं, या दीवार को घूर रहे हैं—बहुत सारा "बोरिंग" सामान जो प्रश्न का उत्तर देने में मदद नहीं करता है।

यह पेपर इस समस्या को हल करने के लिए एक चतुर दो-चरणीय प्रणाली पेश करता है, जो AI के लिए एक सुपर-कुशल फिल्म संपादक की तरह काम करती है।

दो-चरणीय समाधान

लेखकों ने एक सिस्टम बनाया है जिसमें दो मुख्य उपकरण हैं:

1. "स्मार्ट क्लिपर" (एडैप्टिव वीडियो सैंपलर - AVS)

उपमा: कल्पना कीजिए कि आप एक फिल्म संपादक हैं जो एक 3-घंटे की डॉक्यूमेंट्री के सबसे रोमांचक क्षणों को खोजने की कोशिश कर रहे हैं।

  • पुराना तरीका (यूनिफॉर्म सैंपलिंग): आप कैंची उठाते हैं और हर 10 सेकंड में फिल्म का एक टुकड़ा काटते हैं, चाहे कुछ भी हो रहा हो। आप एक आदमी के सोने के बोरिंग 10 सेकंड को काट सकते हैं, फिर एक 10-सेकंड का विस्फोट काट सकते हैं, फिर एक और बोरिंग दृश्य काट सकते हैं। आप अपने "संपादन समय" को बोरिंग चीज़ों पर बर्बाद करते हैं।
  • नया तरीका (AVS): यह टूल एक स्मार्ट संपादक की तरह है जिसके पास छठी इंद्री है। यह वीडियो को देखता है और केवल उन्हीं फ्रेमों को काटता है जहाँ वास्तव में कुछ बदलता है। यदि कैमरा 5 मिनट तक एक स्थिर कमरे पर रहता है, तो यह उसे छोड़ देता है। जैसे ही दरवाज़ा खुलता है या कोई पात्र बोलता है, यह उस फ्रेम को पकड़ लेता है।
  • परिणाम: AI को 1,000 फ्रेम दिखाने के बजाय (जिनमें से अधिकांश समान हैं), यह AI को केवल उन 20 सबसे महत्वपूर्ण फ्रेमों को दिखाता है जो कहानी बताते हैं।

2. "मैजिक कंप्रेसर" (स्पैटियोटेम्पोरल वीडियो कंप्रेसर - SVC)

उपमा: अब जब आपके पास 20 बेहतरीन फ्रेम हैं, तो वे अभी भी हाई-डेफिनिशन, भारी फाइलें हैं। आपको उन्हें सिकोड़ना होगा ताकि AI उन्हें आसानी से ले जा सके, लेकिन आप उन्हें केवल एक पहचानने योग्य धुंधले धब्बे में नहीं बदल सकते।

  • पुराना तरीका (एवरेज पूलिंग): कल्पना कीजिए कि आप एक बिल्ली की 10 तस्वीरें और एक कुत्ते की 10 तस्वीरें लेते हैं, उन सभी को एक ब्लेंडर में मिलाते हैं, और AI को एक ग्रे स्मूदी के रूप में परोसते हैं। आप विवरण खो देते हैं! AI अब यह नहीं बता सकता कि वह बिल्ली है या कुत्ता।
  • नया तरीका (SVC): यह एक हाई-टेक कंप्रेशन एल्गोरिदम की तरह है (समान रूप से जैसे कि एक ZIP फ़ाइल काम करती है, लेकिन स्मार्ट है)। यह दृश्य जानकारी को "सारांशित" करना सीखता है। यह कच्चे वीडियो डेटा को लेता है और उसे एक छोटे, घने "लेटेंट स्पेस" (एक गुप्त कोड) में संकुचित कर देता है।
  • सीक्रेट सॉस: उन्होंने इस कंप्रेसर को एक "टीचर-स्टूडेंट" पद्धति का उपयोग करके प्रशिक्षित किया। कंप्रेसर वीडियो को सिकोड़ने की कोशिश करता है, और एक "डिकोडर" मूल वीडियो को उस संकुचन से फिर से बनाने की कोशिश करता है। यदि डिकोडर चित्र को फिर से बनाने में विफल रहता है, तो कंप्रेसर को पता चल जाता है कि उसने बहुत सारी जानकारी फेंक दी है और वह फिर से प्रयास करता है। यह सुनिश्चित करता है कि AI को एक छोटी फ़ाइल मिले जिसमें सभी महत्वपूर्ण विवरण सुरक्षित हों

यह सब मिलकर कैसे काम करता है

  1. इनपुट: आप सिस्टम को 2-घंटे का वीडियो देते हैं।
  2. चरण 1 (द क्लिपर): "स्मार्ट क्लिपर" वीडियो को स्कैन करता है, उबाऊ हिस्सों को अनदेखा करता है, और केवल उन प्रमुख क्षणों को चुनता है जहाँ एक्शन होता है।
  3. चरण heid (द कंप्रेसर): "मैजिक कंप्रेसर" उन प्रमुख क्षणों को लेता है और उन्हें 64 गुना सिकोड़ देता है। यह विजुअल डेटा के एक विशाल ढेर को एक छोटे, कुशल पैकेज में बदल देता है।
  4. चरण 3 (द AI): AI (एक लार्ज लैंग्वेज मॉडल) इस छोटे, उच्च-गुणवत्ता वाले पैकेज को प्राप्त करता है। क्योंकि डेटा बहुत कुशल है, AI बिना सिरदर्द या मेमोरी खत्म हुए पूरे 2-घंटे के वीडियो को अपने दिमाग में "पढ़" सकता है।

यह एक बड़ी बात क्यों है?

  • दक्षता: यह सिस्टम पिछले स्टेट-ऑफ-द-आर्ट मॉडलों की तुलना में 80% कम विजुअल टोकन (डेटा इकाइयाँ) का उपयोग करता है। यह हर किताब पढ़ने के बजाय केवल एक इंडेक्स कार्ड का उपयोग करके एक लाइब्रेरी से वही उत्तर प्राप्त करने जैसा है।
  • सटीकता: क्योंकि यह उबाऊ डेटा से अभिभूत नहीं होता है, यह प्रश्नों का बेहतर उत्तर देता है। परीक्षणों में, इसने EgoSchema और PerceptionTest जैसे बेंचमार्क पर अन्य शीर्ष मॉडलों को पछाड़ दिया।
  • कोई "मतिभ्रम" नहीं: डिस्क्रिमिनेटिव जानकारी (वह चीज़ जो वास्तव में मायने रखती है) को संरक्षित करके और शोर (noise) को हटाकर, AI के तथ्य बनाने की संभावना कम हो जाती है।

निचोड़

यह पेपर हमें सिखाता है कि लंबी वीडियो को समझने के लिए, आपको AI को सब कुछ दिखाने की आवश्यकता नहीं है। आपको बस उसे सही चीजें, सबसे छोटे संभव पैकेज में दिखाने की आवश्यकता है। यह किसी को 500 पन्नों का उपन्यास देने और उन्हें एक सटीक रूप से लिखे गए 5 पन्नों के सारांश को देने के बीच का अंतर है जो कहानी की आत्मा को पकड़ लेता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →