← नवीनतम पेपर
🤖 AI

MoDA: Modulation Adapter for Fine-Grained Visual Grounding in Instructional MLLMs

यह शोध पत्र MoDA का प्रस्ताव करता है, जो एक हल्का मॉड्यूलेशन एडेप्टर है जो विजुअल फीचर्स पर इंस्ट्रक्शन-गाइडेड चैनल-वाइज मल्टीप्लिकेटिव मॉड्यूलेशन लागू करके मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स में फाइन-ग्रेन्ड विजुअल ग्राउंडिंग को बढ़ाता है, जिससे न्यूनतम कम्प्यूटेशनल ओवरहेड के साथ कई आर्किटेक्चर और बेंचमार्क पर निरंतर प्रदर्शन सुधार प्राप्त होता है।

मूल लेखक: Wayner Barrios, Andrés Villa, Juan León Alcázar, SouYoung Jin, Bernard Ghanem

प्रकाशित 2026-06-08
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Wayner Barrios, Andrés Villa, Juan León Alcázar, SouYoung Jin, Bernard Ghanem

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ शोध पत्र MoDA: Modulation Adapter for Fine-Grained Visual Understanding का सरल भाषा और रचनात्मक उपमाओं के साथ विवरण दिया गया है।

समस्या: AI विज़न में "गंदा पानी" (Muddy Water)

कल्पना कीजिए कि आप एक सोते हुए फ्रेंच बुलडॉग की फोटो देख रहे हैं जो अपने पास एक आलीशान खिलौने के साथ बिस्तर पर लेटा हुआ है। आप यह सवाल पूछना चाहते हैं: "कुत्ते के कान का रंग क्या है?"

एक इंसान के लिए, यह आसान है। आप कान को देखते हैं और बिस्तर और खिलौने को अनदेखा कर देते हैं।

लेकिन कई वर्तमान AI मॉडलों (जिन्हें मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स या MLLMs कहा जाता है) के लिए, छवि एक पूरी तस्वीर के रूप में नहीं देखी जाती है। इसके बजाय, AI छवि को छोटे चौकोर टाइल्स (जिन्हें "पैच" कहा जाता है) में काट देता है। समस्या यह है कि ये टाइल्स अक्सर अस्त-व्यस्त होते हैं। एक टाइल में कुत्ते के फर का एक हिस्सा, लकड़ी के फर्श का एक हिस्सा और खिलौने का एक हिस्सा हो सकता है।

इसे एक ऑर्केस्ट्रा में एक विशिष्ट वाद्य यंत्र को सुनने की कोशिश करने जैसा समझें, लेकिन माइक्रोफ़ोन वायलिन, सेलो और दर्शकों के खांसने की आवाज़ों को एक साथ पकड़ रहा है। इसे ही लेखक "सिमेंटिक एंटैंगलमेंट" (semantic entanglement) कहते हैं। AI भ्रमित हो जाता है क्योंकि विजुअल डेटा "गंदा" (muddy) है—यह विभिन्न वस्तुओं को आपस में मिला देता है, जिससे विशिष्ट विवरण पर ध्यान केंद्रित करना कठिन हो जाता है जिसके बारे में प्रश्न पूछा गया है। यह अक्सर "हैलुसिनेशन" (hallucinations) की ओर ले जाता है, जहाँ AI आत्मविश्वास के साथ कुछ ऐसा कह देता है जो वास्तव में चित्र में मौजूद ही नहीं है।

समाधान: MoDA (एक "इंस्ट्रक्शन-गाइडेड फ़िल्टर")

लेखक एक नया, हल्का टूल प्रस्तावित करते हैं जिसे MoDA (मॉड्यूलेशन एडेप्टर) कहा जाता है।

यदि मानक AI एडेप्टर एक अनुवादक की तरह है जो छवि को शब्दों में बदलता है, तो MoDA उस अनुवादक के पीछे खड़ा एक स्मार्ट स्पॉटलाइट ऑपरेटर की तरह है।

यह इस प्रकार काम करता है:

  1. इनपुट: AI ने पहले ही छवि को देख लिया है और एक मोटा विवरण (अलाइन्ड फीचर्स) तैयार कर लिया है।
  2. प्रश्न: आप एक विशिष्ट प्रश्न पूछते हैं, जैसे "खिलौना बिस्तर पर है या फर्श पर?"
  3. मॉड्यूलेशन: MoDA आपके प्रश्न को सुनता है। फिर यह एक "मास्क" या फ़िल्टर बनाता है। यह पूरे डेटा को फेंक नहीं देता; इसके बजाय, यह उन हिस्सों को धीमा (dim) कर देता है जो प्रासंगिक नहीं हैं (जैसे बैकग्राउंड का शोर) और उन हिस्सों को चमकीला (brighten) कर देता है जो प्रासंगिक हैं (जैसे खिलौना और फर्श)।

उपमा:
कल्पना कीजिए कि आप किसी एक विशिष्ट तथ्य को खोजने के लिए एक घनी पाठ्यपुस्तक पढ़ रहे हैं।

  • MoDA के बिना: आपको पेज के हर एक शब्द को पढ़ना होगा, जिसमें फुटनोट्स, विज्ञापन और चैप्टर समरी भी शामिल है, ताकि आप घास के ढेर में सुई ढूंढ सकें।
  • MoDA के साथ: एक मित्र केवल उन वाक्यों को हाईलाइट करता है जो आपके विशिष्ट प्रश्न का उत्तर देते हैं और बाकी पेज को धुंधला कर देता है। अब आप तुरंत उसी पर ध्यान केंद्रित कर सकते हैं जो महत्वपूर्ण है।

यह अलग क्यों है?

मौजूदा अधिकांश तरीके इस समस्या को ठीक करने की कोशिश करते हैं:

  • अधिक जटिल कैमरे (मल्टीपल विजुअल एनकोडर) जोड़कर।
  • पूरी किताब को फिर से लिखकर (पूरे मॉडल को रिट्रेन करके)।
  • पूरे पैराग्राफ को अनदेखा करने के लिए चुनकर (टोकन-लेवल सिलेक्शन)।

MoDA अलग है क्योंकि:

  1. यह सूक्ष्म (Granular) है: यह केवल पूरे शब्दों या वाक्यों को अनदेखा नहीं करता है; यह डेटा के भीतर विशिष्ट विवरणों के "वॉल्यूम" को एडजस्ट करता है (चैनल-वाइज मॉड्यूलेशन)।
  2. यह हल्का (Lightweight) है: यह एक छोटा सा एड-ऑन मॉड्यूल है। यह गणना लागत (FLOPs) में 1% से भी कम और पैरामीटर्स में केवल 3.7% की वृद्धि करता है। यह एक नई लाइब्रेरी खरीदने के बजाय एक किताब में एक छोटा सा बुकमार्क लगाने जैसा है।
  3. यह इंस्ट्रक्शन-गाइडेड है: यह अपने फोकस को इस आधार पर बदलता है कि आप क्या पूछ रहे हैं। यदि आप कुत्ते के कान के बारे में पूछते हैं, तो यह कान पर ध्यान केंद्रित करता है। यदि आप खिलौने के बारे में पूछते हैं, तो यह खिलौने पर ध्यान केंद्रित करता है।

परिणाम: क्या यह काम करता है?

लेखकों ने तीन अलग-अलग AI आर्किटेक्चर (LLaVA-1.5, LLaVA-MoRE, और Qwen3-VL) पर 12 अलग-अलग परीक्षणों के माध्यम से MoDA का परीक्षण किया। परिणाम बहुत सकारात्मक रहे:

  • बेहतर सटीकता: एक टेस्ट पर, जिसे MM-VP कहा जाता है (जो हैलुसिनेशन की जांच करता है), MoDA ने एक मॉडल फैमिली के लिए स्कोर में 12 अंकों का सुधार किया। यह एक बहुत बड़ी छलांग है।
  • बेहतर तर्क (Reasoning): विज्ञान और तर्क संबंधी प्रश्नों (ScienceQA) पर, इसने लगभग 5 अंकों का सुधार किया।
  • हर जगह काम करता है: यह केवल एक प्रकार के AI के लिए नहीं था। यह CLIP (एक सामान्य विजुअल एनकोडर) पर आधारित मॉडलों और Qwen3-VL जैसे नए मॉडलों, जो अलग तकनीक का उपयोग करते हैं, दोनों के लिए काम करता है।
  • कोई अतिरिक्त डेटा नहीं चाहिए: उन्हें इसे प्रशिक्षित करने के लिए AI को लाखों नई छवियां खिलाने की आवश्यकता नहीं थी। इसने मौजूदा प्रशिक्षण डेटा का अधिक प्रभावी ढंग से उपयोग करके बेहतर बनना सीखा।

सारांश

संक्षेप में, MoDA AI मॉडलों को "एक साथ सब कुछ देखने" के बजाय "उस चीज़ को देखने" में मदद करता है जिसके बारे में आप पूछ रहे हैं। एक स्मार्ट फ़िल्टर के रूप में कार्य करके जो आपके प्रश्न के आधार पर अप्रासंगिक विजुअल शोर को कम करता है और प्रासंगिक विवरणों को उभारता है, यह AI मॉडलों को अधिक सटीक, हैलुसिनेशन (गलत जानकारी देने) से मुक्त और कुशल बनाता है, और वह भी बिना मूल सिस्टम को बड़े अपग्रेड की आवश्यकता के।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →