← नवीनतम पेपर
💻 computer science

FUSE: Quantifying Uncertainty in Vision-Language Models by Bayesian Fusing Epistemic and Aleatoric Uncertainty

यह शोध पत्र FUSE को प्रस्तुत करता है, जो एक बेयसियन ढांचा (Bayesian framework) है जो आउटपुट की शुद्धता को विश्वसनीय रूप से अनुमानित करने और विजन-लैंग्वेज मॉडल्स में अत्याधुनिक अंशांकन (state-of-the-art calibration) प्राप्त करने के लिए एलीटोरिक एम्बेडिंग-स्तरीय (aleatoric embedding-level) और एपिस्टेमिक मॉडल-स्तरीय (epistemic model-level) अनिश्चितताओं को विश्लेषणात्मक रूप से संलयित (fuse) करके एक स्केलर माप उत्पन्न करता है।

मूल लेखक: Harry Zhang, Luca Carlone

प्रकाशित 2026-06-16
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Harry Zhang, Luca Carlone

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान, लेकिन कभी-कभी अति-आत्मविश्वासी रोबोट सहायक से एक तस्वीर के बारे में सवाल पूछ रहे हैं। आप पूछते हैं, "बिल्ली की टोपी का रंग क्या है?" रोबोट तस्वीर देखता है और कहता है, "काला।" लेकिन क्या होगा अगर तस्वीर धुंधली हो, या टोपी वास्तव में नीली हो लेकिन छाया के कारण काली दिख रही हो? आपको कैसे पता चलेगा कि रोबोट केवल अनुमान लगा रहा है या वह वास्तव में पक्का है?

यही वह समस्या है जिसे FUSE पेपर हल करने की कोशिश करता है। यह रोबोट को गलत उत्तर देने से पहले यह कहने का एक तरीका देता है कि, "मुझे यकीन नहीं है।"

FUSE कैसे काम करता है, यहाँ सरल उपमाओं के माध्यम से समझाया गया है:

"पता नहीं" के दो प्रकार

लेखकों ने महसूस किया कि एक रोबोट दो बहुत ही अलग कारणों से अनिश्चित हो सकता है। FUSE दोनों को मापता है और उन्हें एक स्कोर में मिला देता है।

1. "अस्पष्ट इनपुट" की समस्या (Aleatoric Uncertainty)

  • उपमा: कल्पना कीजिए कि आप एक हाथ से लिखे नोट को पढ़ने की कोशिश कर रहे हैं, लेकिन स्याही फैल गई है, कागज मुड़ा हुआ है, और लिखावट बिखरी हुई है। भले ही आप एक विश्व-स्तरीय पाठक हों, लेकिन इनपुट स्वयं भ्रमित करने वाला है।
  • पेपर में: ऐसा तब होता है जब छवि या टेक्स्ट प्रश्न संदिग्ध होता है। शायद तस्वीर अंधेरी है, या प्रश्न अस्पष्ट है। FUSE कच्चे डेटा (छवि और टेक्स्ट) को देखता है और गणना करता है कि वह कितना "धुंधला" या संदिग्ध है। यदि डेटा अव्यवस्थित है, तो रोबोट इस संदेह के साथ शुरू करता है कि वह गलत हो सकता है।

2. "दिमागी धुंध" की समस्या (Epistemic Uncertainty)

  • उपमा: कल्पना कीजिए कि आप अपने एक मित्र से एक प्रश्न पूछते हैं। यदि वे आश्वस्त हैं, तो वे एक स्पष्ट उत्तर देते हैं। लेकिन यदि वे अनिश्चित हैं, तो वे कह सकते हैं, "खैर, यह एक कप हो सकता है, या शायद एक फूलदान, या शायद एक कंटेनर," और उनकी आवाज़ डगमगाती है। उनके उत्तरों की विविधता आपको बताती है कि वे सच नहीं जानते।
  • पेपर में: FUSE रोबोट से एक ही प्रश्न 50 बार पूछता है। यदि रोबोट 50 अलग-अलग उत्तर देता है (जैसे, "कप," "फूलदान," "डिब्बा"), तो यह दर्शाता है कि रोबोट भ्रमित है। यदि वह 50 समान उत्तर देता है, तो वह आश्वस्त है। FUSE मापता है कि रोबोट के उत्तर कितने "बिखरते" हैं या एक-दूसरे से कितने असहमत हैं।

जादुई ट्रिक: Bayesian Fusing

आमतौर पर, लोग केवल मेसी इनपुट (अस्पष्ट इनपुट) या बिखरे हुए उत्तरों को देख सकते हैं। FUSE कुछ अधिक स्मार्ट करता है: यह उन्हें Bayesian Fusion नामक एक गणितीय रेसिपी का उपयोग करके जोड़ता है।

  • उपमा: एक जासूस के बारे में सोचें जो अपराध की गुत्थी सुलझा रहा है।
    • सुराग A (इनपुट): अपराध स्थल बहुत धुंधला है (अस्पष्ट इनपुट)। यह जासूस को संदेह कराता है कि मामला कठिन है।
    • सुराग B (उत्तर): गवाह बार-बार अपनी बात बदल रहा है (बिखरे हुए उत्तर)। यह जासूस को संदेह कराता है कि गवाह झूठ बोल रहा है या भ्रमित है।
    • फैसला: FUSE दोनों सुरागों को लेता है और एक एकल "कॉन्फिडेंस स्कोर" (विश्वास स्कोर) की गणना करता है। यदि दृश्य धुंधला है और गवाह अपनी बात बदल रहा है, तो स्कोर कहता है, "उच्च अनिश्चितता! इस उत्तर पर भरोसा न करें।" यदि दृश्य स्पष्ट है और गवाह सुसंगत है, तो स्कोर कहता है, "कम अनिश्चितता! यह संभवतः सही है।"

यह क्यों महत्वपूर्ण है

पेपर दिखाता है कि FUSE झूठ पकड़ने (Hallucinations) में पिछले तरीकों की तुलना में बहुत बेहतर है।

  • पुराने तरीके: कभी-कभी, एक रोबोट बहुत आत्मविश्वासी हो सकता है लेकिन गलत हो सकता है। वह 99% विश्वास के साथ "काला" कह सकता है भले ही टोपी वास्तव में नीली हो, सिर्फ इसलिए क्योंकि रोबोट अति-आत्मविश्वासी है।
  • FUSE: तस्वीर के "धुंधलेपन" और उत्तरों की "निरंतरता" दोनों की जांच करके, FUSE इन गलतियों को पकड़ सकता है।

परिणाम: एक "स्टॉप" साइन

अंतिम आउटपुट एक संख्या (एक स्कोर) है।

  • कम स्कोर: "मैं आश्वस्त हूँ। मेरा उत्तर उपयोग करें।"
  • उच्च स्कोर: "मैं भ्रमित हूँ। तस्वीर कठिन है, और मेरे उत्तर इधर-उधर बिखरे हुए हैं। कृपया इस मामले में मुझ पर भरोसा न करें।"

पेपर ने इसका परीक्षण कई विजुअल क्वेश्चन-आन्सरिंग डेटासेट्स (जैसे छवियों के बारे में प्रश्न पूछना) पर किया और पाया कि FUSE यह जानने में सबसे अच्छा है कि कब "मुझे नहीं पता" कहना है और कब सही उत्तर देना है। यह AI को सुरक्षित और अधिक विश्वसनीय बनाने में मदद करता है, विशेष रूप से उन स्थितियों में जहाँ गलत उत्तर देना एक बड़ी समस्या बन सकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →