Seeing Isn't Believing: Uncovering Blind Spots in Evaluator Vision-Language Models
تقيم هذه الورقة بشكل منهجي موثوقية نماذج الرؤية واللغة المستخدمة كمقيمين لمهام تحويل الصور إلى نصوص والنصوص إلى صور، كاشفةً عن وجود نقاط عمياء كبيرة لديها — لا سيما في اكتشاف الهلوسة، والأخطاء المكانية، والتناقضات الواقعية — حيث تفشل غالباً في تحديد الاضطرابات المسببة لتدهور الجودة في أكثر من 50% من الحالات.