Metonymy in vision models undermines attention-based interpretability
تكشف هذه الورقة أن نماذج المحولات الرؤية المسبقة التدريب الحديثة تنتهك فرضية الموضعية من خلال إظهار "تسرب داخل الكائن" (الكناية البصرية)، مما يقوض موثوقية أساليب التفسير القائمة على الانتباه في الاستدلال القائم على الأجزاء، وتثبت أن نهجاً ذا مرحلتين يمكنه بفعالية تخفيف هذه المشكلة لتحسين اكتشاف الأجزاء المدفوع بالسمات.