← नवीनतम पेपर
💻 computer science

VLM-UQBench: A Benchmark for Modality-Specific and Cross-Modality Uncertainties in Vision Language Models

यह शोधपत्र VLM-UQBench प्रस्तुत करता है, जो विज़न-लैंग्वेज मॉडल्स में मोडैलिटी-विशिष्ट और क्रॉस-मोडल अनिश्चितता का मूल्यांकन करने के लिए डिज़ाइन किया गया एक नया बेंचमार्क है, जो यह प्रकट करता है कि वर्तमान अनिश्चितता मात्रा निर्धारण (अनसर्टेन्टी क्वांटिफिकेशन) विधियाँ सूक्ष्म, इंस्टेंस-लेवल अस्पष्टताओं का पता लगाने में संघर्ष करती हैं और मतिभ्रम (हैलुसिनेशन) का पता लगाने के लिए असंगत संकेत प्रदान करती हैं।

मूल लेखक: Chenyu Wang, Tianle Chen, H. M. Sabbir Ahmad, Kayhan Batmanghelich, Wenchao Li

प्रकाशित 2026-02-11
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Chenyu Wang, Tianle Chen, H. M. Sabbir Ahmad, Kayhan Batmanghelich, Wenchao Li

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप दुनिया में राह दिखाने के लिए एक व्यक्तिगत सहायक (personal assistant) को काम पर रख रहे हैं। आप चाहते हैं कि वे बुद्धिमान हों, लेकिन उससे भी महत्वपूर्ण बात यह है कि आप चाहते हैं कि वे ईमानदार हों। यदि वे किसी सड़क के संकेत को स्पष्ट रूप से नहीं देख पा रहे हैं क्योंकि वह धुंधला है, या यदि आप बिना इशारा किए एक भ्रमित करने वाला प्रश्न पूछते हैं जैसे, "वहाँ उस चीज़ का रंग क्या है?" तो आप नहीं चाहते कि वे केवल अनुमान लगाएं और आपको गलत उत्तर दें। आप चाहते हैं कि वे कहें, "मुझे यकीन नहीं है—क्या छवि बहुत धुंधली है, या आपका प्रश्न बहुत अस्पष्ट था?"

आर्टिफिशियल इंटेलिजेंस की दुनिया में, इन "सहायकों" को विज़न-लैंग्वेज मॉडल्स (VLMs) कहा जाता है। वे प्रश्नों का उत्तर देने के लिए चित्रों को देखते हैं और टेक्स्ट को पढ़ते हैं। समस्या यह है कि वे अक्सर "हैलुसिनेटर्स" (hallucinators) होते हैं—वे अक्सर आत्मविश्वास के साथ कह देते हैं कि सोफे पर एक बिल्ली है जबकि वास्तव में वहां केवल एक तकिया होता है।

यह पेपर VLM-UQBench पेश करता है, जो एक उच्च-तकनीकी "ईमानदारी परीक्षण" है जिसे यह देखने के लिए डिज़ाइन किया गया है कि क्या ये AI मॉडल वास्तव में जानते हैं कि वे कब भ्रमित हैं और महत्वपूर्ण रूप से, वे क्यों भ्रमित हैं।

"क्यों" की समस्या: भ्रम के तीन स्रोत

अधिकांश परीक्षण केवल यह पूछते हैं, "क्या AI सही है या गलत?" यह पेपर कहता है कि यह पर्याप्त नहीं है। AI को ठीक करने के लिए, हमें यह जानने की आवश्यकता है कि गलती कहाँ से शुरू हुई। वे भ्रम को तीन श्रेणियों में विभाजित करते हैं:

  1. "खराब आँखें" की समस्या (विजुअल अनसर्टेन्टी/दृश्य अनिश्चितता): चित्र बहुत गहरा, धुंधला या पिक्सेलेटेड है। AI संघर्ष कर रहा है क्योंकि "आँखें" देख नहीं पा रही हैं।
  2. "खराब निर्देश" की समस्या (टेक्स्टुअल अनसर्टेन्टी/पाठ्य अनिश्चितता): इंसान ने एक भ्रमित करने वाला, टाइपो-युक्त या अत्यधिक व्यक्तिपरक प्रश्न पूछा है। AI संघर्ष कर रहा है क्योंकि "कानों" ने बात नहीं समझी।
  3. "अनुवाद में खो जाने" की समस्या (क्रॉस-मोडल अनसर्टेन्टी/क्रॉस-मोडल अनिश्चितता): चित्र स्पष्ट है और टेक्स्ट भी स्पष्ट है, लेकिन वे मेल नहीं खाते। उदाहरण के लिए, फोटो में तीन कारें होने पर पूछना "कार का रंग क्या है?" AI संघर्ष कर रहा है क्योंकि वह शब्दों को सही वस्तु से नहीं जोड़ पा रहा है।

"स्ट्रेस टेस्ट" पाइपलाइन

AI का परीक्षण करने के लिए, शोधकर्ताओं ने एक "डिजिटल टॉर्चर चैंबर" (एक परटर्बेशन पाइपलाइन) बनाया। वे एक बिल्कुल स्पष्ट फोटो और एक आदर्श प्रश्न लेते हैं, और फिर वे व्यवस्थित रूप से उन्हें बिगाड़ देते हैं:

  • वे फोटो को धुंधला कर देते हैं (Blur)।
  • वे टेक्स्ट में टाइपो जोड़ देते हैं (Typos)।
  • वे जानबूझकर प्रश्न और चित्र को आपस में टकराते हैं (Cross-modal)।

ऐसा करके, वे देख सकते हैं कि क्या AI का "अनसर्टेन्टी स्कोर" (उसका आंतरिक "मुझे यकीन नहीं है" वाला मीटर) चीजें खराब होने पर वास्तव में बढ़ जाता है।

आश्चर्यजनक परिणाम: "आत्मविश्वासी झूठा"

शोधकर्ताओं ने कई प्रसिद्ध AI मॉडलों (जैसे GPT-4o-mini और LLaVA) का परीक्षण किया, और परिणाम एक चेतावनी की तरह थे। उन्होंने तीन मुख्य मुद्दे पाए:

  • विशेषीकृत भ्रम (Specialized Confusion): कुछ AI मॉडल यह महसूस करने में अच्छे हैं कि प्रश्न खराब है, लेकिन वे यह जानने में पूरी तरह अंधे हैं कि चित्र धुंधला है। वे उस छात्र की तरह हैं जो जानता है कि उसने पाठ्यपुस्तक नहीं पढ़ी, लेकिन उसे यह एहसास नहीं है कि वह परीक्षा पर लिखावट नहीं पढ़ पा रहा है।
  • हैलुसिनेशन गैप (The Hallucination Gap): यह सबसे खतरनाक हिस्सा है। भले ही AI हैलुसिनेट करना (चीजें बनाना) शुरू कर दे, उसका "अनसर्टेन्टी मीटर" अक्सर कम ही रहता है। यह एक ऐसे व्यक्ति की तरह है जो आत्मविश्वास के साथ खाई में गिर जाता है क्योंकि उसे बहुत यकीन है कि पुल वहाँ मौजूद है।
  • "सूक्ष्म" विफलता (The "Subtle" Failure): AI मॉडल "स्पष्ट" भ्रम (जैसे कि पूरी तरह से काला चित्र) का पता लगाने में ठीक हैं, लेकिन वे "सूक्ष्म" भ्रम (जैसे कि एक छोटा सा टाइपो या एक थोड़ा अस्पष्ट संदर्भ) का पता लगाने में बहुत खराब हैं।

यह क्यों मायने रखता है

यदि हम अस्पतालों में AI का उपयोग करना चाहते हैं (एक्स-रे का विश्लेषण करने के लिए) या सेल्फ-ड्राइविंग कारों में, तो "ज्यादातर सही" होना काफी नहीं है। हमें ऐसे AI की आवश्यकता है जो कह सके, "रुकिए! मैं भ्रमित हूँ क्योंकि रोशनी खराब है," या "कृपया दोबारा कहें; मुझे नहीं पता कि आप किस वस्तु का अर्थ निकाल रहे हैं।"

VLM-UQBench उस तरह के विश्वसनीय, आत्म-जागरूक AI को बनाने के लिए एक रोडमैप प्रदान करता है। यह हमें केवल "स्मार्ट" मॉडल बनाने से हटाकर विश्वसनीय मॉडल बनाने की ओर ले जाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →