VLM Judges Can Rank but Cannot Score: Task-Dependent Uncertainty in Multimodal Evaluation
تقدم هذه المساهمة إطار عمل للتنبؤ المطابق لقياس موثوقية أحكام نماذج الرؤية واللغة عبر تحويل التقديرات النقطية إلى فترات مُعايرة، وتُظهر أن عدم اليقين في التقييم يعتمد بشكل كبير على المهمة، وتكشف عن نمط فشل حرج يتمثل في "انفصال التصنيف عن التقييم"، حيث يمكن للنماذج ترتيب الاستجابات بشكل صحيح ولكنها تفشل في تقديم درجات مطلقة موثوقة.