More Than Meets the Eye: Measuring the Semiotic Gap in Vision-Language Models via Semantic Anchorage
تقدم هذه الورقة معيار DIVA ومقياس فجوة المحاذاة الدلالية (Semantic Alignment Gap) لإثبات أن نماذج الرؤية واللغة تظهر تحيزاً متسقاً نحو التفسير الحرفي، حيث يفشل تعزيز الدقة البصرية وحجم النموذج في حل الصعوبات المتعلقة بالمعاني الاصطلاحية المجردة، مما يشير إلى أن التجريد الأيقوني ضروري لتحسين الفهم التركيبي.