Seeing without Looking: Do Vision-Language Benchmarks Really Test Vision?
यह शोध पत्र प्रकट करता है कि वर्तमान विजन-लैंग्वेज बेंचमार्क सूक्ष्म-स्तरीय विजुअल ग्राउंडिंग का विश्वसनीय रूप से मूल्यांकन करने में विफल रहते हैं क्योंकि ओपन-सोर्स मॉडल विजुअल डिग्रेडेशन के प्रति आश्चर्यजनक रूप से कम संवेदनशीलता प्रदर्शित करते हैं और मानक सटीकता मेट्रिक्स द्वारा सुझाए गए स्तर की तुलना में दृश्य साक्ष्यों पर कम निर्भर करते हैं, एक ऐसी घटना जिसका कारण नेटवर्क की गहरी परतों में विजुअल टोकन के बीच बढ़ती समानता को माना गया है।