← नवीनतम पेपर
🤖 AI

VEN-VL: A Visual Ensemble MoE Framework for Effective and Efficient Multi-Modal Understanding

VEN-VL एक विजुअल एनसेंबल मिक्सचर-ऑफ-एक्सपर्ट्स फ्रेमवर्क है जो मल्टी-परस्पेक्टिव यूनिफिकेशन के माध्यम से विजुअल इंफॉर्मेशन कैपेसिटी को समृद्ध करके और फिर एडेप्टिव रूटिंग एवं एक्सप्लिसिट विजुअल सुपरविजन के माध्यम से इसे प्रोग्रेसिव रूप से कॉम्पैक्ट करके मल्टीमॉडल अंडरस्टैंडिंग में प्रदर्शन और दक्षता के बीच के अंतर को पाटता है।

मूल लेखक: Yinghao Wu, Zhuoyan Luo, Yiyao Yu, Zhaojian Yu, Yujiu Yang, Xiao-Ping Zhang

प्रकाशित 2026-05-26
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yinghao Wu, Zhuoyan Luo, Yiyao Yu, Zhaojian Yu, Yujiu Yang, Xiao-Ping Zhang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक व्यस्त मित्र को एक जटिल पेंटिंग के बारे में समझाने की कोशिश कर रहे हैं जो केवल एक संक्षिप्त सारांश सुन सकता है।

समस्या:
अधिकांश वर्तमान AI मॉडल (जिन्हें लार्ज विजुअल-लैंग्वेज मॉडल्स कहा जाता है) छवियों को समझने के लिए हर एक पिक्सेल को देखने की कोशिश करते हैं, जैसे कि किताब के हर शब्द को पढ़ना। यह धीमा और महंगा है। इसे ठीक करने के लिए, अन्य शोधकर्ताओं ने छवि को "प्रून" (छंटनी) करने की कोशिश की है—उन हिस्सों को हटा देना जिन्हें वे महत्वहीन समझते हैं।

हालाँकि, यह पेपर तर्क देता है कि मौजूदा विधियाँ एक अनाड़ी संपादक की तरह हैं जो पूरे पैराग्राफ को सिर्फ इसलिए काट देते हैं क्योंकि वे लंबे दिखते हैं। वे बहुत अधिक विवरण हटा देते हैं, या गलत विवरणों को रख लेते हैं, जिससे AI "बड़ी तस्वीर" (big picture) खो देता है या छोटे, महत्वपूर्ण सुरागों (जैसे पृष्ठभूमि में एक छोटा सा साइन बोर्ड) को मिस कर देता है। परिणाम यह होता है कि AI तेज़ तो होता है लेकिन बहुत बुद्धिमान नहीं होता।

समाधान: VEN-VL
लेखक एक नया सिस्टम प्रस्तावित करते हैं जिसे VEN-VL कहा जाता है। वे अपने दृष्टिकोण को एक सरल सिद्धांत के साथ वर्णित करते हैं: "समृद्ध करें, फिर संकुचित करें" (Enrich, then Compact)। इसे एक व्यस्त अतिथि के लिए स्वादिष्ट भोजन तैयार करने जैसा समझें: पहले आप सबसे अच्छे सामग्रियां और स्वाद इकट्ठा करते हैं (Enrich/समृद्ध करना), और फिर आप उन्हें सावधानी से एक छोटे, उच्च गुणवत्ता वाले लंचबॉक्स में पैक करते हैं (Compact/संकुचित करना) ताकि कुछ भी खो न जाए, लेकिन उसे ले जाना आसान हो।

यहाँ वे इसे तीन रचनात्मक चरणों में विभाजित करते हैं:

1. "मल्टी-एस्पेक्ट नॉलेज एनसेंबल" (MKE) – विशेषज्ञ पैनल

केवल एक जोड़ी चश्मे (जैसे एक मानक कैमरा) के माध्यम से चित्र को देखने के बजाय, VEN-VL एक ही समय में चित्र को देखने के लिए दो अलग-अलग विशेषज्ञों का उपयोग करता है।

  • विशेषज्ञ A बड़ी तस्वीर और सामान्य अर्थ को देखता है (जैसे "यह एक पार्क है")।
  • विशेषज्ञ B सूक्ष्म विवरणों और बनावट (textures) को देखता है (जैसे "पत्तियां भूरी हो रही हैं")।

आमतौर पर, इन दोनों दृश्यों को मिलाने से डेटा की एक बड़ी और अव्यवस्थित मात्रा बन जाती है। लेकिन, VEN-VL एक विशेष "विलय" (merge) तकनीक का उपयोग करता है। यह दोनों विशेषज्ञों के नोट्स से सबसे अच्छे वाक्यों को लेने और उन्हें एक पूर्ण, संक्षिप्त कहानी में बुनने वाले एक कुशल संपादक की तरह है। यह सुनिश्चित करता है कि AI के पास एक समृद्ध समझ (अधिक "सूचना क्षमता") हो, बिना किसी शोर (noise) के।

2. "हाइरार्किकल टोकन एनसेंबल" (HTE) – स्मार्ट फ़िल्टर

अब जब AI के पास यह समृद्ध कहानी है, तो इसे भाषा मॉडल के "मस्तिष्क" में फिट होने के लिए छोटा करने की आवश्यकता है।

  • पुरानी विधियाँ एक कुंद फ़िल्टर का उपयोग करती हैं: "यदि इस छवि का यह हिस्सा अभी बहुत ध्यान आकर्षित नहीं कर रहा है, तो इसे हटा दें।" यह अक्सर अनजाने में महत्वपूर्ण लेकिन सूक्ष्म विवरणों को भी हटा देती है।
  • VEN-VL का तरीका एक मिक्सचर ऑफ एक्सपर्ट्स (MoE) प्रणाली का उपयोग करता है। विशेषज्ञ जासूसों की एक टीम की कल्पना करें। जैसे-जैसे AI प्रत्येक परत (layer) के माध्यम से छवि को प्रोसेस करता है, एक "राउटर" (मैनेजर) पूछता है: "इस विशिष्ट सुराग के लिए सबसे अच्छा जासूस कौन है?"
    • यदि कोई टोकन (छवि का एक टुकड़ा) किसी विशिष्ट बनावट (texture) के बारे में है, तो वह "टेक्सचर डिटेक्टिव" के पास जाता है।
    • यदि वह किसी सामान्य आकार के बारे में है, तो वह "शेप डिटेक्टिव" के पास जाता है।

सिस्टम केवल उन्हीं टोकन को रखता है जिन्हें विशेषज्ञ वास्तव में महत्वपूर्ण पाते हैं। यह एक सघन (denser) सारांश बनाता है। यह केवल एक छोटी सूची नहीं है; यह एक ऐसी सूची है जहाँ प्रत्येक वस्तु उच्च-मूल्य वाली जानकारी से भरी हुई है।

3. "स्ट्रक्चर इंफॉर्मेशन प्रिजर्वेशन" (SIP) – सुरक्षा जाल

जब आप 90% डेटा फेंक देते हैं, तो आप संरचना (चीजें एक-दूसरे से कैसे संबंधित हैं) को खोने का जोखिम उठाते हैं।

  • नवाचार: VEN-VL, AI को एक "पुनर्निर्माण की सुपरपावर" देता है। छवि के किसी टुकड़े को हटाने से पहले, यह शेष टुकड़ों से पूछता है: "क्या आप याद कर सकते हैं कि यह गायब हुआ टुकड़ा कैसा दिखता था?"
  • यह एक पर्यवेक्षण (supervision) ट्रिक का उपयोग करता है (एक शिक्षक द्वारा होमवर्क चेक करने की तरह) ताकि यह सुनिश्चित किया जा सके कि छवि के सिकुड़ने के बाद भी, AI अपने मन में मूल आकार और संबंधों को फिर से "पुनर्निर्मित" (reconstruct) कर सके। यह इस बात को रोकता है कि AI चित्र में चीजों के स्थान को लेकर भ्रमित हो जाए।

परिणाम

पेपर का दावा है कि इस "समृद्ध करें फिर संकुचित करें" रणनीति का उपयोग करके, VEN-VL सामान्य मॉडलों की तुलना में केवल लगभग 7.5% से 10% विजुअल टोकन (डेटा के छोटे टुकड़े) का उपयोग करके जटिल छवियों को समझ सकता है।

इतने कम डेटा का उपयोग करने के बावजूद, यह छवियों के भीतर टेक्स्ट पढ़ने या दृश्यों के बारे में जटिल प्रश्न पूछने जैसे कठिन कार्यों पर अन्य तेज़ मॉडलों की तुलना में बेहतर प्रदर्शन करता है। यह तेज़ (कुशल) होने और बुद्धिमान (प्रभावी) होने के बीच के अंतर को पाटता है, यह साबित करते हुए कि सब कुछ समझने के लिए आपको सब कुछ देखने की आवश्यकता नहीं है, जब तक कि आप सही चीजों को सही तरीके से देखते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →