← नवीनतम पेपर
🤖 machine learning

Instruction Lens Score: Your Instruction Contributes a Powerful Object Hallucination Detector for Multimodal Large Language Models

यह शोध पत्र इंस्ट्रक्शन लेंस स्कोर (InsLen) को प्रस्तुत करता है, जो मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स के लिए एक प्लग-एंड-प्ले ऑब्जेक्ट हैलुसिनेशन डिटेक्टर है, जो सहायक मॉडल्स या अतिरिक्त प्रशिक्षण की आवश्यकता के बिना इंस्ट्रक्शन टोकन एम्बेडिंग्स का लाभ उठाकर मौजूदा तरीकों से बेहतर प्रदर्शन करता है।

मूल लेखक: Runhe Lai, Xinhua Lu, Yanqi Wu, Jinlun Ye, Weijiang Yu, Ruixuan Wang

प्रकाशित 2026-05-13
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Runhe Lai, Xinhua Lu, Yanqi Wu, Jinlun Ye, Weijiang Yu, Ruixuan Wang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक बहुत ही स्मार्ट रोबोटिक सहायक (एक मल्टीमॉडल लार्ज लैंग्वेज मॉडल) है जो चित्रों को देख सकता है और उनका विस्तार से वर्णन कर सकता है। आप उससे पूछते हैं, "तुम्हें क्या दिख रहा है?" और वह बोलना शुरू कर देता है। लेकिन कभी-कभी, यह रोबोट थोड़ा अधिक कल्पनाशील हो जाता है। यह बर्फ से भरे पहाड़ और स्कीयरों (skiers) की एक तस्वीर देख सकता है और आत्मविश्वास से कह सकता है, "मुझे स्कीयर पर एक लाल बैग दिखाई दे रहा है," भले ही चित्र में कोई बैग न हो। इसे ऑब्जेक्ट हैलुसिनेशन (Object Hallucination) कहा जाता है।

यह शोध पत्र एक नया टूल पेश करता है जिसे इंस्ट्रक्शन लेंस स्कोर (Instruction Lens Score - InsLen) कहा जाता है ताकि इन झूठों को पकड़ा जा सके। यह कैसे काम करता है, इसके लिए सरल उपमाओं का उपयोग किया गया है:

समस्या: "शोर वाला कैमरा" बनाम "स्मार्ट गाइड"

रोबोट की दृष्टि प्रणाली (vision system) को एक ऐसे कैमरे के रूप में सोचें जो खराब रोशनी या प्रतिबिंबों (reflections) के कारण कभी-कभी भ्रमित हो जाता है। यह एक छाया देख सकता है जो बैग जैसी दिखती है और रोबोट के मस्तिष्क को बता सकता है, "हे, वहाँ एक बैग है!"

आमतौर पर, अन्य विधियाँ रोबोट के उत्तर की जाँच करने के लिए कैमरे के कच्चे डेटा (विजुअल एम्बेडिंग्स) को देखने का प्रयास करती हैं। लेकिन यदि कैमरा भ्रमित है, तो यह जाँच विफल हो जाती है।

शोधकर्ताओं ने कुछ आश्चर्यजनक खोजा: रोबलेट के निर्देश (instructions) (वह टेक्स्ट जो आप टाइप करते हैं, जैसे "कृपया चित्र का वर्णन करें") एक स्मार्ट गाइड की तरह कार्य करते हैं। भले ही कैमरा शोर भरा हो, स्मार्ट गाइड के पास इस शोर को फ़िल्टर करने का एक तरीका होता है। जब रोबोट आपके निर्देश को पढ़ता है, तो वह अंतर्निहित रूप से "जानता" है कि चित्र में वास्तव में क्या है और वह भ्रमित कैमरे से आने वाले नकली "बैग" के संकेत को अनदेखा कर सकता है।

समाधान: "इंस्ट्रक्शन लेंस"

शोधकर्ताओं ने एक डिटेक्टर बनाया है जिसे InsLen कहा जाता है, जो कैमरे के बजाय विशेष रूप से स्मार्ट गाइड के विचारों पर केंद्रित एक आवर्धक लेंस (magnifying glass) की तरह कार्य करता है।

वे इसे दो मुख्य जाँचों में विभाजित करते हैं:

1. "रियलिटी चेक" (कैलिब्रेटेड लोकल स्कोर)

  • उपमा: कल्पना कीजिए कि एक जासूस (कैमरा) को एक सुराग मिलता है जो बैग जैसा दिखता है। लेकिन एक बुद्धिमान न्यायाधीश (निर्देश) उसी सुराग को देखता है और कहता है, "मुझे नहीं लगता कि यह बैग है; यह सिर्फ एक छाया है।"
  • यह कैसे काम करता है: यह विधि उस विश्वास (confidence) को लेती है जो रोबोट को बैग देखने में हो रहा है। यदि कैमरा बैग को लेकर उत्साहित है, लेकिन "स्मार्ट गाइड" (निर्देश) बहुत संशय में है और उसे कम संभावना (low probability) देता है, तो सिस्टम उस विश्वास को कैलिब्रेट (कम) करने का निर्णय लेता है। यह प्रभावी रूप से कहता है, "कैमरा झूठ बोल रहा है; गाइड बेहतर जानता है।"

2. "कॉन्टेक्स्ट चेक" (कॉन्टेक्स्ट कंसिस्टेंसी स्कोर)

  • उपमा: कल्पना कीजिए कि आप भीड़ में किसी व्यक्ति की पहचान करने की कोशिश कर रहे हैं।
    • लोकल चेक: आप पिक्सेल के एक धुंधले हिस्से को देखते हैं जो चेहरे जैसा दिखता है।
    • कॉन्टेक्स्ट चेक: आप "स्मार्ट गाइड" से पूछते हैं, "क्या यह व्यक्ति पूरे दृश्य की कहानी में फिट बैठता है?" यदि दृश्य एक स्की ढलान (ski slope) है, तो गाइड जानता है कि वहां स्कीयर और बर्फ होनी चाहिए, लेकिन हवा में तैरता हुआ कोई "बैग" नहीं होना चाहिए।
  • यह कैसे काम करता है: यह विधि पूरे दृश्य की "स्मार्ट गाइड" की समझ को देखती है। यह जाँचती है कि रोबोट जिसे देखने का दावा करता है (जैसे "बैग"), वह उस वैश्विक कहानी (global story) के साथ मेल खाता है जो गाइड बता रहा है। यदि गाइड की कहानी बैग के अस्तित्व का समर्थन नहीं करती है, तो सिस्टम इसे हैलुसिनेशन के रूप में चिह्नित करता है।

यह बेहतर क्यों है?

अधिकांश पिछली विधियों ने रोबोट को ठीक करने के लिए अधिक भारी मशीनरी जोड़ने (जैसे कि काम की जाँच करने के लिए दूसरे, बहुत महंगे AI का उपयोग करना) या रोबोट को पूर्ण बनाने के लिए प्रशिक्षित करने (जिसमें बहुत समय लगता है) का प्रयास किया।

InsLen अलग है क्योंकि:

  • यह "प्लग-एंड-प्ले" है: आपको रोबोट को फिर से प्रशिक्षित करने या नए महंगे उपकरण जोड़ने की आवश्यकता नहीं है। आप बस रोबोट के अपने आंतरिक "स्मार्ट गाइड" विचारों का उपयोग करके उसके काम की जाँच करते हैं।
  • यह तेज़ है: यह रोबोट की सोचने की प्रक्रिया में लगभग कोई अतिरिक्त समय नहीं जोड़ता है।
  • यह सटीक है: अपने परीक्षणों में, इस पद्धति ने अन्य सभी विधियों की तुलना में अधिक झूठ पकड़े, यहाँ तक कि जब रोबोट चुनौतीपूर्ण चित्रों को देख रहा था जहाँ वास्तविक वस्तुएं और नकली वस्तुएं बहुत समान दिख रही थीं (जैसे चम्मच और चाकू)।

सारांश

शोध पत्र का दावा है कि रोबोट की आंखों (कैमरे) के बजाय रोबोट के निर्देशों (स्मार्ट गाइड) को सुनकर, हम प्रभावी रूप से नकली वस्तुओं को फ़िल्टर कर सकते हैं। इंस्ट्रक्शन लेंस स्कोर एक "रियलिटी चेक" (कैमरे के विश्वास को कैलिब्रेट करना) को "कॉन्टेक्स्ट चेक" (यह सुनिश्चित करना कि वस्तु कहानी में फिट बैठती है) के साथ जोड़ता है ताकि AI इमेज विवरणों के लिए एक अत्यधिक विश्वसनीय झूठ पकड़ने वाला यंत्र बनाया जा सके।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →