← नवीनतम पेपर
💻 computer science

Not All Modalities Are Equal: Instruction-Aware Gating for Multimodal Videos

यह शोध पत्र UniMVU को प्रस्तुत करता है, जो एक एकीकृत मल्टीमॉडल वीडियो समझ ढांचा (unified multimodal video understanding framework) है, जो विविध इनपुट स्ट्रीम्स के बीच गतिशील रूप से संतुलन बनाने और हस्तक्षेप को कम करने के लिए आंतरिक-मोडैलिटी (inner-modality) और मोडैलिटी स्तरों पर निर्देश-जागरूक गेटिंग तंत्र (instruction-aware gating mechanisms) का उपयोग करता है, जिससे यह स्टैटिक फ्यूजन बेसलाइन्स की तुलना में छह बेंचमार्क में महत्वपूर्ण प्रदर्शन सुधार प्राप्त करता है।

मूल लेखक: Bonan Ding, Umair Nawaz, Ufaq Khan, Abdelrahman M. Shaker, Muhammad Haris Khan, Jiale Cao, Jin Xie, Fahad Shahbaz Khan

प्रकाशित 2026-05-27
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Bonan Ding, Umair Nawaz, Ufaq Khan, Abdelrahman M. Shaker, Muhammad Haris Khan, Jiale Cao, Jin Xie, Fahad Shahbaz Khan

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रहस्य को सुलझाने की कोशिश कर रहे हैं, लेकिन आपके पास चार अलग-अलग जासूसों की एक टीम है: एक जो केवल चित्रों को देखता है, एक जो केवल ध्वनियों को सुनता है, एक जो वस्तुओं के आकार (3D गहराई) को महसूस करता है, और एक जो पूरी घटना का एक सुपर-फास्ट, हाई-स्पीड रीप्ले देखता है।

अतीत में, जब AI मॉडल वीडियो संबंधी प्रश्नों को हल करने की कोशिश करते थे, तो वे इन चारों जासूसों को समान रूप से देखते थे। वे बस उन सभी की रिपोर्टों को एक ढेर में डाल देते थे और "चीफ" (लार्ज लैंग्वेज मॉडल) से उत्तर figuring out करने के लिए कहते थे। समस्या क्या थी? यदि प्रश्न ध्वनि के बारे में था (जैसे, "कौन सा वाद्य यंत्र बज रहा है?"), तो चीफ चित्र वाले जासूस की रिपोर्ट से विचलित हो जाता था जो रंगों के बारे में बता रहा था। यदि प्रश्न स्थान के बारे में था (जैसे, "कुर्सी कहाँ है?"), तो ध्वनि वाले जासूस की संगीत के बारे में रिपोर्ट केवल शोर बन जाती थी। इसे मोडैलिटी इंटरफेरेंस (modality interference) कहा जाता है—गलत सुराग सही सुरागों को दबा देते हैं।

यह पेपर UniMVU (यूनिफाइड मल्टीमॉडल वीडियो अंडरस्टैंडिंग) नामक एक नया सिस्टम पेश करता है जो इस टीम के लिए एक स्मार्ट ट्रैफिक कंट्रोलर या कंडक्टर की तरह काम करता है।

यह कैसे काम करता है, सरल उपमाओं का उपयोग करते हुए यहाँ दिया गया है:

1. "इंस्ट्रक्शन-अवेयर" कंडक्टर (निर्देश-जागरूक संचालक)

मुख्य विचार यह है कि पूछे गए विशिष्ट प्रश्न के आधार पर प्रत्येक जासूस का महत्व बदल जाता है।

  • पुराना तरीका (यूनिफॉर्म फ्यूजन): कंडक्टर सभी चार जासूसों को निर्देश देता है कि वे सवाल की परवाह किए बिना अपने सुरागों को एक ही वॉल्यूम (तेजी) पर चिल्लाएं।
  • UniMVU का तरीका: कंडक्टर पहले प्रश्न पढ़ता है।
    • यदि प्रश्न है "कुत्ता किस पर भौंक रहा है?", तो कंडक्टर ऑडियो जासूस की वॉल्यूम को 100% तक बढ़ा देता है और डेप्थ (गहराई) जासूस की वॉल्यूम को फुसफुसाहट तक कम कर देता है।
    • यदि प्रश्न है "कमरे में कितनी मेजें हैं?", तो वह 3D/डेप्थ जासूस को बढ़ावा देता है और ऑडियो वाले को धीमा कर देता है।

इस पेपर में इसे इंस्ट्रक्शन-अवेयर गेटिंग (Instruction-Aware Gating) कहा गया है। यह हर प्रकार की जानकारी के लिए एक स्मार्ट डिमर स्विच की तरह है, जो आपके द्वारा पूछे गए विशिष्ट प्रश्न द्वारा नियंत्रित होता है।

2. नियंत्रण के दो स्तर

UniMVU केवल पूरी टीम के लिए वॉल्यूम ऊपर या नीचे नहीं करता है; यह दो चतुर चरणों में काम करता है:

  • स्तर 1: "स्पॉटलाइट" (इनर-मोडैलिटी गेटिंग)
    कल्पना कीजिए कि ऑडियो जासूस के पास एक पार्टी की 10 मिनट की रिकॉर्डिंग है। इसमें से अधिकांश केवल बैकग्राउंड की बातचीत है, लेकिन 5 सेकंड के लिए, कोई कुछ कहता है।
    UniMVU का पहला काम उन 5 सेकंड के ऑडियो पर एक स्पॉटलाइट डालना और बाकी को अनदेखा करना है। यह एक ही प्रकार के सुराग के भीतर "शोर" को छानकर उसे आगे भेजने से पहले फ़िल्टर करता है।

  • स्तर 2: "वॉल्यूम नॉब" (मोडैलिटी-लेवल गेटिंग)
    प्रत्येक जासूस की रिपोर्ट के सबसे अच्छे हिस्सों को स्पॉटलाइट करने के बाद, UniMVU यह तय करता है कि दूसरों की तुलना में प्रत्येक जासूस कितना तेज होना चाहिए। यह एक विशेष "कंट्रोल टोकन" (सोचिए एक मूड रिंग या स्कोरकार्ड के रूप में) का उपयोग करता है जिसे देखकर चीफ यह निर्णय लेता है कि, "ठीक है, आज ऑडियो जासूस सबसे महत्वपूर्ण है, इसलिए मैं उन्हें पहले सुनूँगा।"

3. यह बेहतर क्यों है?

इस पेपर ने संगीत, 3D कमरे और लंबी वीडियो से जुड़े छह अलग-अलग "मिस्ट्री गेम्स" (बेंचमार्क) पर इस सिस्टम का परीक्षण किया।

  • परिणाम: UniMVU ने पुराने तरीकों की तुलना में लगातार अधिक पहेलियों को सही ढंग से सुलझाया। कुछ मामलों में, इसने स्कोर में भारी सुधार किया (एक विशिष्ट स्कोरिंग मेट्रिक में 13.5 अंक तक)।
  • "क्यों": पेपर दिखाता है कि यह सिस्टम वास्तव में मानवीय तर्क की नकल करना सीखता है। जब ध्वनि के बारे में पूछा जाता है, तो यह स्वाभाविक रूप से ध्वनि पर ध्यान केंद्रित करता है। जब 3D स्थान के बारे में पूछा जाता है, तो यह डेप्थ पर ध्यान केंद्रित करता है। यह अप्रासंगिक सुरागों से भ्रमित नहीं होता है।

4. "वन-साइज़-फिट्स-ऑल" शेफ (एक ही आकार के लिए उपयुक्त रसोइया)

आमतौर पर, संगीत के प्रश्नों में अच्छा होने के लिए, आपको एक ऐसे शेफ की आवश्यकता होती है जो केवल संगीत पर प्रशिक्षित हो। 3D प्रश्नों में अच्छा होने के लिए, आपको एक अलग शेफ की आवश्यकता होती है।
UniMVU एक मास्टर शेफ की तरह है जो कोई भी व्यंजन बना सकता है। आप इसे ध्वनि वाला वीडियो, 3D डेप्थ वाला वीडियो, या केवल चित्रों वाला वीडियो दे सकते हैं, और यह पता लगाने के लिए कि उस विशिष्ट व्यंजन (प्रश्न) के लिए किन सामग्रियों (सुरागों) की आवश्यकता है, उसी "गेटिंग" रेसिपी का उपयोग करता है। आपको हर प्रकार के वीडियो के लिए अलग शेफ की आवश्यकता नहीं है।

सारांश

संक्षेप में, UniMVU एक ऐसा सिस्टम है जो AI को बहुत अधिक जानकारी से अभिभूत होने से रोकता है। सभी कुछ एक साथ सुनने के बजाय, यह AI को सिखाता है कि सही समय पर सही चीज़ को कैसे सुनना है, जो पूछे गए प्रश्न पर आधारित है। यह शोर को फ़िल्टर करता है, प्रासंगिक सुरागों को उजागर करता है, और AI को बहुत उच्च सटीकता के साथ उत्तर देने की अनुमति देता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →