← नवीनतम पेपर
💬 NLP

Rethinking the Mixture of Vision Encoders Paradigm for Enhanced Visual Understanding in Multimodal LLMs

यह शोध पत्र LEO को प्रस्तुत करता है, जो एक सुव्यवस्थित मल्टीमॉडल लार्ज लैंग्वेज मॉडल आर्किटेक्चर है जो विविध बेंचमार्क और स्वायत्त ड्राइविंग जैसे विशिष्ट डोमेन में विजुअल अंडरस्टैंडिंग को महत्वपूर्ण रूप से बढ़ाने के लिए पोस्ट-एडेप्टेशन प्रोजेक्टर्स, टाइल-लेवल सीक्वेंस इंटरलीविंग और डायनेमिक टिलिंग की एक लाइटवेट फ्यूजन रणनीति का उपयोग करता है।

मूल लेखक: Mozhgan Nasr Azadani, James Riddell, Sean Sedwards, Krzysztof Czarnecki

प्रकाशित 2026-03-09
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Mozhgan Nasr Azadani, James Riddell, Sean Sedwards, Krzysztof Czarnecki

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान रोबोट (एक लार्ज लैंग्वेज मॉडल) को दुनिया को "देखना" और समझना सिखाने की कोशिश कर रहे हैं, न कि केवल टेक्स्ट पढ़ना। यह रोबोट बातचीत करने में माहिर है, लेकिन जब आप इसे कोई जटिल चित्र दिखाते हैं—जैसे कि भीड़भाड़ वाली सड़क का दृश्य, कोई विस्तृत मेडिकल चार्ट, या बारीक लिखावट वाला कोई दस्तावेज़—तो यह अक्सर भ्रमित हो जाता है या बारीकियों को छोड़ देता है।

यह पेपर एक नए रोबोट Leo का परिचय देता है और बताता है कि शोधकर्ताओं ने इसके लिए एक बेहतर "आँख" कैसे बनाई।

यह उनकी सफलता की कहानी है, जिसे सरल उपमाओं (analogies) के माध्यम से समझाया गया है।

समस्या: एक आँख काफी नहीं है

इससे पहले, ये रोबोट एक एकल "विज़न एक्सपर्ट" (एक प्री-ट्रेंड कंप्यूटर प्रोग्राम) का उपयोग करते थे जो छवियों को देखता था। यह एक सामान्य डॉक्टर से एक साथ हार्ट सर्जरी करने, कानूनी अनुबंध पढ़ने और उंगलियों के निशान का विश्लेषण करने के लिए कहने जैसा है। वे अच्छे हैं, लेकिन वे सूक्ष्म विवरणों को चूक जाते हैं।

इसे ठीक करने के लिए, अन्य शोधकर्ताओं ने कई विशेषज्ञों (एक "मिक्सचर ऑफ विजन एनकोडर्स") का उपयोग करने की कोशिश की। कल्पना कीजिए कि आपने एक टीम को काम पर रखा है: त्वचा के लिए एक डर्मेटोलॉजिस्ट, आँखों के लिए एक ऑप्टोमेट्रिस्ट, और हृदय के लिए एक कार्डियोलॉजिस्ट। लेकिन समस्या यह थी: आप इन विशेषज्ञों को एक-दूसरे से बात करने के लिए कैसे प्रेरित करेंगे?

  • क्या आप उन्हें एक-दूसरे के ऊपर चिल्लाकर अपनी खोज बताने के लिए कहेंगे?
  • क्या आप उनसे एक लंबी रिपोर्ट लिखने और उन्हें एक साथ जोड़ने के लिए कहेंगे?
  • क्या आप उन्हें एक घेरे में बिठाकर हर एक विवरण पर चर्चा करने के लिए कहेंगे?

अधिकांश पिछले तरीके अव्यवस्थित, धीमे थे या प्रक्रिया के दौरान महत्वपूर्ण विवरण खो देते थे।

समाधान: "Leo" की रेसिपी

शोधकर्ता Mozhgan और उनकी टीम ने विशेषज्ञों को मिलाने का सही तरीका खोजने के लिए प्रयोगों की एक श्रृंखला चलाई। उन्होंने एक "लाइटवेट रेसिपी" की खोज की जो जादू की तरह काम करती है। वे अपने नए रोबोट को Leo कहते हैं।

यहाँ Leo की सफलता के तीन गुप्त सामग्रियां (ingredients) दी गई हैं:

1. "पज़ल पीस" रणनीति (डायनामिक टाइलिंग)

पुराना तरीका: एक विशाल, हाई-रिज़ॉल्यूशन फोटो (जैसे 4K मूवी पोस्टर) को एक साथ देखने की कोशिश करना एक ही बार में पूरा तरबूज निगलने जैसा है। आप या तो अटक जाएंगे, या उसके बीज मिस कर देंगे।
Leo का तरीका: Leo चित्र के आकार के आधार पर छवि को पज़ल के टुकड़ों (टाइल्स) में काट देता है। यदि छवि एक ऊँची गगनचुंबी इमारत है, तो वह उसे लंबे स्ट्रिप्स में काटेगा। यदि यह एक चौड़ा परिदृश्य (landscape) है, तो वह उसे चौड़े स्लाइस में काटेगा।

  • उपमा: पूरे जंगल को एक साथ देखने के बजाय, Leo एक पेड़ को देखता है, फिर दूसरे को, फिर अगले को, लेकिन वह पूरे जंगल की एक छोटी "थंबनेल" फोटो भी अपनी जेब में रखता है ताकि वह कभी ट्रैक न खोए। इससे वह बिना अभिभूत हुए (overwhelmed) सूक्ष्म विवरणों (जैसे शाखा पर बैठे पक्षी) को देख सकता है।

2. "गूंथी हुई चोटी" की रणनीति (टोकन इंटरलीविंग)

पुराना तरीका: जब विशेषज्ञ (विज़न एनकोडर्स) रोबोट के मस्तिष्क को अपने नोट्स भेजते हैं, तो पिछले तरीकों में वे उन्हें बस एक के ऊपर एक रख देते थे। विशेषज्ञ A एक लंबी सूची लिखता है, फिर विशेषज्ञ B एक लंबी सूची लिखता है। मस्तिष्क को B के बिंदु को समझने से पहले A की पूरी सूची पढ़नी पड़ती है। यह दो अलग-अलग किताबें पढ़ने और दोनों को खत्म करने के बाद ही उनकी तुलना करने जैसा है।
Leo का तरीका: Leo विशेषज्ञ A और विशेषज्ञ B के नोट्स लेता है और उन्हें बालों की तरह आपस में गूंथ (braid) देता है।

  • उपमा: "विशेषज्ञ A कहता है X, Y, Z... फिर विशेषज्ञ B कहता है 1, 2, 3..." के बजाय, Leo कहता है "विशेषकर A कहता है X, विशेषज्ञ B कहता है 1, विशेषज्ञ A कहता है Y, विशेषज्ञ B कहता है 2।"
  • यह क्यों काम करता है: यह रोबोट के मस्तिष्क को छवि के हर हिस्से के लिए दोनों विशेषज्ञों के विचारों की तुरंत अगल-बगल तुलना करने की अनुमति देता है। यह एक बहुत अधिक समृद्ध और संतुलित समझ बनाता है।

3. "विशेष अनुवादक" की रणनीति (पोस्ट-अडैप्टेशन फ्यूजन)

पुराना तरीका: कल्पना कीजिए कि विशेषज्ञ A "मेडिकल" बोलता है और विशेषज्ञ B "लीगल" बोलता है। पुराने सिस्टम में, आप उन्हें एक-दूसरे से बात करने से पहले अपने विचारों को "रोबोट भाषा" में अनुवाद करने के लिए मजबूर करते थे। इससे अक्सर वे अपनी अनूठी शब्दावली खो देते थे।
Leo का तरीका: Leo प्रत्येक विशेषज्ञ को अपना व्यक्तिगत अनुवादक देता है।

  • उपमा: विशेषज्ञ A अपने "मेडिकल" नोट्स को पूरी तरह से "रोबोट भाषा" में अनुवाद करता है। विशेषज्ञ B अपने "लीगल" नोट्स को पूरी तरह से "रोबोट भाषा" में अनुवाद करता है। उसके बाद ही Leo उन्हें अपने नोट्स मिलाने की अनुमति देता है।
  • यह क्यों काम करता है: यह सुनिश्चित करता है कि मिश्रण होने से पहले प्रत्येक विशेषज्ञ का अनूठा, विशिष्ट ज्ञान सुरक्षित रहे। यह दो शेफ द्वारा अपनी सामग्री को अंतिम व्यंजन में मिलाने से पहले उन्हें पूरी तरह से तैयार करने जैसा है, बजाय इसके कि पहले कच्ची सामग्री को मिला दिया जाए और फिर बेहतर परिणाम की उम्मीद की जाए।

परिणाम: Leo एक सुपर-स्टूडेंट है

शोधकर्ताओं ने Leo का परीक्षण 11 अलग-अलग चुनौतियों पर किया, जिसमें लाइसेंस प्लेट पर छोटे टेक्स्ट (OCR) को पढ़ने से लेकर जटिल गणितीय चार्ट और यहाँ तक कि कार चलाने तक शामिल है।

  • बाकियों से बेहतर: Leo ने लगभग हर उस रोबोट को पछाड़ दिया जो कई विज़न विशेषज्ञों का उपयोग करता है, भले ही Leo को प्रशिक्षित करने के लिए कम डेटा और कम कंप्यूटर संसाधनों की आवश्यकता पड़ी।
  • "ड्राइवर" टेस्ट: उन्होंने ऑटोनामस ड्राइविंग की दुनिया में भी Leo का परीक्षण किया। कोड की एक भी लाइन बदले बिना, Leo सड़क को देख सकता था, एक पैदल यात्री को पहचान सकता था, और निर्णय ले सकता था, "मुझे रुकना चाहिए।" इसने साबित कर दिया कि Leo केवल एक लैब प्रयोग नहीं है; यह वास्तविक दुनिया की अव्यवस्थित स्थितियों को संभाल सकता है।

मुख्य निष्कर्ष

यह पेपर हमें सिखाता है कि बेहतर देखने के लिए आपको एक विशाल, महंगी और जटिल रोबोट बनाने की आवश्यकता नहीं है। कभी-कभी, आपको बस अपनी टीम को बेहतर ढंग से व्यवस्थित करने की आवश्यकता होती है।

छवियों को स्मार्ट पज़ल टुकड़ों में काटकर, विशेषज्ञों के विचारों को आपस में गूंथकर, और उन्हें मिलाने से पहले अपने विचारों को अनुवाद करने देकर, Leo दृश्य समझ (visual understanding) का मास्टर बन गया। यह एक याद दिलाता है कि AI में, आप जानकारी को कैसे जोड़ते हैं, यह अक्सर इस बात से अधिक महत्वपूर्ण होता है कि आपके पास कितनी जानकारी है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →