Visual Semantic Entropy: Do Vision Language Models Recognize Visual Ambiguity?
यह शोध पत्र विज़ुअल सिमेंटिक एंट्रॉपी (VSE) का प्रस्ताव करता है, जो एक नवीन अनिश्चितता अनुमान पद्धति है जो टेक्स्ट क्वेरीज़ को स्थिर रखते हुए केवल इमेज इनपुट्स को बाधित करके विज़ुअल अस्पष्टता को अलग करती है, जिससे मौजूदा एंट्रॉपी-आधारित दृष्टिकोणों की सीमाओं को दूर किया जा सके जो अत्यधिक आत्मविश्वासी विज़ुअल एम्बेडिंग्स द्वारा विकृत या टेक्स्टुअल विविधताओं द्वारा प्रभावित होते हैं।