Blind to Position, Biased in Language: Probing Mid-Layer Representational Bias in Vision-Language Encoders for Zero-Shot Language-Grounded Spatial Understanding
تكشف هذه الورقة أن تمثيلات الطبقة النهائية لمشفرات الرؤية واللغة تعاني من عدم الحساسية الموضعية والانزياحات الهندسية المعتمدة على اللغة، مما استدعى اقتراح طريقة لسبر التحيز التمثيلي في الطبقات المتوسطة، والتي حسنت بشكل كبير أداء تقسيم الصور بالإشارة (zero-shot referring image segmentation) واسترجاع الصور من النصوص (text-to-image retrieval).