Evolution of Accuracy and Visual-Cognitive Errors in a Decade of Vision-Language AI Models
यह शोध पत्र एक दशक के विजन-लैंग्वेज मॉडल्स का मूल्यांकन करने के लिए कॉम्प्लेक्स सोशल बिहेवियर (CSB) डेटासेट प्रस्तुत करता है, जो यह प्रकट करता है कि हालांकि मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स (MLLMs) ने अधिकांश त्रुटि प्रकारों को काफी हद तक समाप्त करके जटिल सामाजिक दृश्यों पर मानव-स्तर की सटीकता प्राप्त कर ली है, फिर भी वे स्थानिक निर्भरता (spatial dependence) में कभी-कभी मनुष्यों से भिन्न होते हैं।