← नवीनतम पेपर
💻 computer science

Latent Noise Mask for Reducing Visual Redundancy in Multimodal Large Language Models

यह शोध पत्र Lens का प्रस्ताव करता है, जो एक हल्का, प्रश्न-आधारित ढांचा (framework) है जो अप्रासंगिक इमेज टोकन में अनुकूल रूप से लेटेंट नॉइज़ (latent noise) इंजेक्ट करके मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स में विजुअल रेडंडेंसी को कम करता है, जिससे मॉडल बैकबोन को संशोधित किए बिना फाइन-ग्रेन्ड रीजनिंग और ग्राउंडिंग प्रदर्शन में महत्वपूर्ण सुधार होता है।

मूल लेखक: Kai Jiang, Ruishu Zhu, Siqi Huang, Hongyuan Zhang, Xuelong Li

प्रकाशित 2026-06-30
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Kai Jiang, Ruishu Zhu, Siqi Huang, Hongyuan Zhang, Xuelong Li

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक पहेली सुलझाने की कोशिश कर रहे हैं, लेकिन किसी ने आपके ज़रूरी टुकड़ों के ऊपर ढेर सारे अतिरिक्त, असंबंधित पहेली के टुकड़े डाल दिए हैं। यह अनिवार्य रूप से वह समस्या है जिसका सामना मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स (MLLMs) तब करते हैं जब वे किसी चित्र को देखते हैं।

ये मॉडल पढ़ने और बात करने में अविश्वसनीय रूप से स्मार्ट हैं, लेकिन जब वे किसी तस्वीर को देखते हैं, तो वे सब कुछ छोटे-छोटे टुकड़ों (टोकन) की एक लंबी सूची के रूप में देखते हैं। यदि आप पूछते हैं, "आसमान में कितने हवाई जहाज हैं?", तो मॉडल हवाई जहाजों को तो देखता है, लेकिन वह बादलों, पक्षियों, पृष्ठभूमि में पेड़ों और घास की बनावट को भी देखता है। ये सभी "डिस्ट्रैक्टर" (भटकाने वाले) टुकड़े आपस में मिल जाते हैं, जिससे मॉडल के लिए आपके प्रश्न का उत्तर देने के लिए आवश्यक विशिष्ट सुरागों पर ध्यान केंद्रित करना कठिन हो जाता है।

अधिकांश वर्तमान समाधान मॉडल को अधिक "कठोरता से" या "लंबे समय तक" सोचने में मदद करने की कोशिश करते हैं, जैसे कि उसकी तर्क प्रक्रिया में अधिक चरण जोड़ देते हैं। यह एक भ्रमित जासूस को यह कहने जैसा है, "बस जो कुछ भी आप देखते हैं उसके बारे में एक लंबी रिपोर्ट लिखें।" लेकिन शोध पत्र का तर्क है कि यह अच्छी तरह से काम नहीं करता है क्योंकि जासूस अभी भी अप्रासंगिक विवरणों में डूब रहा है।

पेश है LENS (लेटेंट नॉइज़ मास्क - Latent Noise Mask)।

LENS को मॉडल की आँखों के लिए एक उपकरण के रूप में न देखें जो अधिक जानकारी जोड़ता है, बल्कि इसे एक स्मार्ट नॉइज़-कैंसलिंग हेडफ़ोन के रूप में देखें।

यह एक सरल उपमा का उपयोग करके कैसे काम करता है, यहाँ दिया गया है:

1. "लेंस एविडेंस टोकन" (द स्मार्ट स्पॉटर)

कल्पना कीजिए कि मॉडल के पास एक छोटा, अस्थायी सहायक (जिसे लेंस एविडेंस टोकन या LET कहा जाता है) है जो चित्र और प्रश्न दोनों को एक साथ देखता है।

  • कार्य: यह सहायक तेज़ी से चित्र को स्कैन करता है और चित्र के हर एक टुकड़े पर एक स्कोर लगाता है।
  • परिणाम: यदि चित्र का एक हिस्सा हवाई जहाज है (और आपने हवाई जहाजों के बारे में पूछा है), तो सहायक उसे उच्च स्कोर (एक हरा सिग्नल) देता है। यदि कोई हिस्सा बादल या पेड़ है, तो वह उसे कम स्कोर (एक लाल सिग्नल) देता है।
  • महत्वपूर्ण बिंदु: यह सहायक चित्र को बदलता नहीं है; यह केवल आपके द्वारा पूछे गए प्रश्न के आधार पर टुकड़ों को रैंक करता है।

2. "लेटेंट नॉइज़ मास्क" (द वॉल्यूम नॉब)

एक बार जब सहायक ने टुकड़ों को रैंक कर दिया, तो LENS "कम स्कोर" वाले टुकड़ों को फेंक नहीं देता है। चीजों को फेंकना जोखिम भरा है; यदि सहायक कोई गलती करता है, तो मॉडल एक महत्वपूर्ण सुराग खो सकता है। इसके बजाय, LENS एक वॉल्यूम नॉब का उपयोग करता है।

  • उच्च स्कोर वाले टुकड़े (साक्ष्य/एविडेंस): इन्हें अकेला छोड़ दिया जाता है। वे स्पष्ट और तेज़ होते हैं।
  • कम स्कोर वाले टुकड़े (डिस्ट्रैक्टर्स): LENS इन टुकड़ों में एक विशेष प्रकार का "स्टैटिक" या "नॉइज़" (शोर) जोड़ देता है। यह उन्हें हटाता नहीं है, बल्कि उन्हें धुंधला और अविश्वसनीय बना देता है। यह बैकग्राउंड की बातचीत की आवाज़ को कम करने जैसा है ताकि मॉडल केवल महत्वपूर्ण आवाज़ को ही सुन सके।

यह बेहतर क्यों है?

शोध पत्र का दावा है कि मॉडल को "लंबे समय तक सोचने" (जो अधिक अव्यवस्था जोड़ता है) सिखाने के बजाय, यह जो वह पहले से देख रहा है उसे साफ करने के बारे में है।

  • कोई सर्जरी नहीं: मॉडल का मस्तिष्क (इसका बैकबोन) बिल्कुल वैसा ही रहता है। हम चित्र के हिस्सों को काट नहीं रहे हैं या मॉडल के निर्माण को नहीं बदल रहे हैं।
  • सॉफ्ट सप्रेशन (कोमल दमन): चित्र के हिस्सों को आक्रामक रूप से हटाने के बजाय (जो मॉडल को खराब कर सकता है यदि वह गलत अनुमान लगाता है), LENS विचलनों को धीरे से "म्यूट" कर देता है।
  • दक्षता: यह केवल थोड़ा सा अतिरिक्त काम जोड़ता है, जैसे कि सहायक की एक त्वरित नज़र, लेकिन इसका परिणाम मॉडल के लिए एक बहुत ही स्पष्ट चित्र होता है जिससे वह समस्या हल कर सके।

परिणाम

जब शोधकर्ताओं ने विभिन्न कार्यों पर इस "नॉइज़-कैंसलिंग" दृष्टिकोण का परीक्षण किया:

  • विजुअल क्वेश्चन अनसरिंग (VQA): मॉडल विशिष्ट प्रश्नों के उत्तर देने में (जैसे वस्तुओं की गिनती करना या चित्र में टेक्स्ट पढ़ना) काफी बेहतर हो गए क्योंकि वे बैकग्राउंड से भ्रमित होना बंद कर दिए।
  • ग्राउंडिंग (Grounding): मॉडल चित्र में किसी वस्तु की सटीक स्थिति बताने में बहुत बेहतर हो गए, क्योंकि पास के समान दिखने वाले अन्य ऑब्जेक्ट्स से होने वाला "नॉइज़" शांत हो गया था।

संक्षेप में: शोध पत्र सुझाव देता है कि AI को देखने में स्मार्ट बनाने के लिए, हमें उसे केवल अधिक समय तक सोचने के लिए नहीं देना चाहिए; हमें उसे शोर को अनदेखा करने में मदद करनी चाहिए ताकि वह सिग्नल पर ध्यान केंद्रित कर सके। LENS वह टूल है जो चित्र के अप्रासंगिक हिस्सों की आवाज़ को कम कर देता है, जिससे मॉडल को उत्तर स्पष्ट रूप से सुनाई देता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →