← नवीनतम पेपर
💻 computer science

EMCompress: Video-LLMs with Endomorphic Multimodal Compression

यह शोधपत्र EMCompress प्रस्तुत करता है, जो एक संज्ञानात्मक रूप से प्रेरित ढांचा है जो एंडोमोर्फिक मल्टीमॉडल कम्प्रेशन (EMC) को उत्तर अपरिवर्तनीयता (answer invariance) को संरक्षित करने वाले एक संरचनात्मक रूपांतरण के रूप में सूत्रबद्ध करता है ताकि लंबे वीडियो तर्क (long-video reasoning) में स्टेटिक फ्रेम सैंपलिंग और सूक्ष्म टेम्पोरल सिमेंटिक्स के बीच के तनाव को हल किया जा सके, जिससे वीडियो-LLMs में महत्वपूर्ण प्रदर्शन लाभ प्राप्त होता है।

मूल लेखक: Zheyu Fan, Jiateng Liu, Yuji Zhang, Zihan Wang, Yi R. Fung, Manling Li, Heng Ji

प्रकाशित 2026-04-28
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Zheyu Fan, Jiateng Liu, Yuji Zhang, Zihan Wang, Yi R. Fung, Manling Li, Heng Ji

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ पेपर EMCompress: Video-LLMs with Endomorphic Multimodal Compression का सरल भाषा और रचनात्मक उपमाओं (analogies) के साथ विवरण दिया गया है।

बड़ी समस्या: "भूसे के ढेर में सुई" (Needle in a Haystack) की दुविधा

कल्पना कीजिए कि आप एक रहस्य सुलझाने की कोशिश कर रहे हैं, लेकिन आपको एक सुराग के बजाय, एक व्यस्त शहर की सड़क का 2 घंटे का सुरक्षा कैमरा टेप थमा दिया गया है। आपसे पूछा जाता है, "लाल साइकिल किसने चुराई?"

वर्तमान AI मॉडल (Video-LLMs) इस समस्या को पूरे टेप को देखकर हल करने की कोशिश करते हैं। लेकिन क्योंकि वे हर एक सेकंड को प्रोसेस नहीं कर सकते, इसलिए वे वीडियो का एक त्वरित "स्नैपशॉट" ले लेते हैं—जैसे कि हर 10 सेकंड में एक फ्रेम।

  • दोष: यदि चोर टेप के बीच में केवल 5 सेकंड के लिए दिखाई देता है, तो AI उसे पूरी तरह से मिस कर सकता है। या, यदि AI पूरे टेप को देखता है, तो वह अप्रासंगिक चीजों (जैसे कि एक बिल्ली का गुजरना) से विचलित हो जाता है और महत्वपूर्ण विवरणों को भूल जाता है। यह एक उपन्यास के हर पेज का केवल पहला अक्षर पढ़कर पूरी कहानी समझने की कोशिश करने जैसा है।

समाधान: "एंडोमॉर्फिक मल्टीमॉडल कम्प्रेशन" (EMC)

लेखक इस समस्या को सोचने का एक नया तरीका प्रस्तावित करते हैं। AI को पूरी किताब पढ़ने के लिए मजबूर करने के बजाय, वे चाहते हैं कि AI पढ़ना शुरू करने से पहले ही सवाल को फिर से लिखे और किताब को काट दे

वे इसे एंडोमॉर्फिक मल्टीमॉडल कम्प्रेशन (EMC) कहते हैं।

उपमा: स्मार्ट लाइब्रेरियन (The Smart Librarian)

एक Video-LLM को एक बहुत ही बुद्धिमान लेकिन धीमे लाइब्रेरियन के रूप में सोचें जिसे एक सवाल का जवाब देने के लिए एक विशाल विश्वकोश (encyclopedia) पढ़ना है।

  1. पुराना तरीका: आप लाइब्रेरियन को पूरा विश्वकोश थमा देते हैं और पूछते हैं, "फ्रांस की राजधानी क्या है?" लाइब्रेरियन हजारों पन्ने पलटता है, थक जाता है, और शायद जवाब मिस कर देता है क्योंकि वह गलत पन्नों को देख रहा था।
  2. EMC का तरीका: लाइब्रेरियन के किताब खोलने से पहले, एक स्मार्ट असिस्टेंट (EMC सिस्टम) बीच में आता है।
    • असिस्टेंट आपके सवाल को पढ़ता है: "फ्रांस की राजधानी क्या है?"
    • असिस्टेंट जानता है कि जवाब पेज नंबर 42 पर है।
    • असिस्टेंट बाकी की किताब को काटकर अलग कर देता है, केवल पन्ने 40-45 को ही छोड़ता है।
    • असिस्टेंट आपके सवाल को उन कटे हुए पन्नों के अनुरूप फिर से लिखता है: "इस छोटे से क्लिप को देखते हुए, राजधानी क्या है?"
    • अब, लाइब्रेरियन को केवल एक छोटा, सटीक हिस्सा पढ़ना होगा। वे तुरंत और सही उत्तर देते हैं।

यह कैसे काम करता है: "ReSimplifyIt" टीम

पेपर इस काटने और फिर से लिखने के कार्य को करने के लिए ReSimplifyIt नामक एक विशिष्ट प्रणाली पेश करता है। यह तीन विशेषज्ञों की एक टीम की तरह काम करता जो मिलकर काम करते हैं:

  1. लॉन्चर (The Planner - योजनाकार):

    • यह एजेंट वीडियो देखे बिना ही सवाल को देखता है।
    • यह अनुमान लगाता है: "जवाब शायद उस हिस्से में है जहाँ व्यक्ति प्याज काट रहा है।"
    • यह एक योजना बनाता है: "आइए 2:00 से 2:30 तक का वीडियो रखें और सवाल को काटने (chopping) पर केंद्रित करने के लिए बदल दें।"
    • उपमा: यह एक जासूस की तरह है जो अपराध स्थल पर जाने से पहले संदिग्ध का स्केच बनाता है।
  2. वैलिडेटर (The Inspector - निरीक्षक):

    • यह एजेंट जांचता है कि लॉन्चर की योजना वास्तव में काम करती है या नहीं।
    • यह एक हेल्पर से उस विशिष्ट वीडियो सेगमेंट को देखने के लिए कहता है।
    • यदि योजना विफल हो जाती है (जैसे, "रुको, व्यक्ति 2:15 तक प्याज नहीं काट रहा है!"), तो वैलिडेटर लॉन्चर को फिर से प्रयास करने के लिए योजना वापस भेज देता है।
    • उपमा: यह एक क्वालिटी कंट्रोल मैनेजर की तरह है जो कपड़े सिलने से पहले यह जांचता है कि कटा हुआ कपड़ा सही आकार का है या नहीं।
  3. व्यूअर (The Eyes - आँखें):

    • यह एजेंट वास्तव में वीडियो के फ्रेम्स को देखता है ताकि पुष्टि की जा सके कि क्या हो रहा है। यह एक विशिष्ट खंड को "स्कैन" कर सकता है या किसी विशिष्ट वस्तु को खोजने के लिए "ज़ूम इन" कर सकता है।
    • उपमा: यह उस जासूस की तरह है जो वास्तव में कमरे में जाकर देखता है कि वहां क्या है।

"एंडोमॉर्फिक" क्यों? (दर्पण की अवधारणा)

पेपर एक फैंसी शब्द का उपयोग करता है: एंडोमॉर्फिक (Endomorphic)

  • सरल अर्थ: आउटपुट बिल्कुल इनपुट जैसा ही दिखता है।
  • रूपक (Metaphor): कल्पना कीजिए कि आपके पास एक पहेली (puzzle) है। अधिकांश संपीड़न (compression) विधियाँ पहेली के टुकड़ों को लेती हैं, उन्हें प्लास्टिक के एक छोटे से ढेर (एक "लेटेंट कोड") में पिघला देती हैं, और उम्मीद करती हैं कि AI उस ढेर से तस्वीर को समझ लेगा।
  • EMC का दृष्टिकोण: पहेली को पिघलाने के बजाय, EMC बस अतिरिक्त टुकड़ों को हटा देता है और शेष टुकड़ों को पुनर्व्यवस्थित करता है। परिणाम अभी भी एक पहेली ही है। AI को इसे समझने के लिए कोई नई भाषा सीखने की आवश्यकता नहीं है; यह बस उसी पहेली का एक छोटा, साफ संस्करण देखता है।

परिणाम: यह क्यों मायने रखता है

लेखकों ने एक नए बेंचमार्क पर इसका परीक्षण किया जिसे उन्होंने बनाया है—EMCompress (खाना पकाने के वीडियो और सवालों का एक डेटासेट)।

  • बेहतर सटीकता: जब उन्होंने इस "काटने और फिर से लिखने" के तरीके का उपयोग किया, तो AI सवालों के जवाब देने में काफी बेहतर हो गया (कुछ मामलों में 33% तक बेहतर)।
  • कम शोर (Less Noise): वीडियो के उबाऊ हिस्सों को हटाकर, AI अप्रासंगिक विवरणों से भ्रमित होना बंद कर देता है।
  • तेज़ प्रशिक्षण (Faster Training): AI को सिखाते समय, इन "साफ" वीडियो क्लिप्स का उपयोग करने से AI तेजी से सीख पाता है क्योंकि वह बेकार डेटा से विचलित नहीं होता है।

सारांश

पेपर का तर्क है कि लंबे वीडियो को समझने में AI को बेहतर बनाने के लिए, हमें केवल AI को "अधिक बुद्धिमान" नहीं बनाना चाहिए। इसके बजाय, हमें उसे बेहतर, छोटा और अधिक केंद्रित इनपुट देना चाहिए।

वीडियो टाइमलाइन को स्क्रब करके अच्छे हिस्सों को खोजने वाले एक इंसान की तरह काम करके, EMCompress सिस्टम AI मॉडल्स को उस साक्ष्य (evidence) पर ध्यान केंद्रित करने में मदद करता है जो वास्तव में मायने रखता है, जिससे स्मार्ट उत्तर मिलते हैं और प्रयास कम बर्बाद होता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →