Does It Fail to See or Fail to Know? Attributing Errors in Vision-Language Models
यह शोध पत्र एक एकीकृत ढांचे का प्रस्ताव करता है जो विज़ुअल-टोकन रिप्रजेंटेशन और प्रॉम्प्ट-कंडीशन्ड हिडन स्टेट्स से प्री-जनरेशन सिग्नल्स का उपयोग करके यह अनुमान लगाने और अलग करने के लिए है कि विज़न-लैंग्वेज मॉडल की त्रुटियां धारणा/पहचान संबंधी बाधाओं (perception/recognition bottlenecks) से उत्पन्न होती हैं या ज्ञान प्राप्ति की विफलताओं (knowledge retrieval failures) से, जिससे उत्तर जनरेशन से पहले लक्षित हस्तक्षेप सक्षम हो सके।