Birds of a Feather Flock Together: Background-Invariant Representations via Linear Structure in VLMs
تقدم هذه الورقة طريقة للتدريب المسبق تستفيد من خاصية الإضافة الخطية لفضاءات تضمين نماذج الرؤية واللغة لتفكيك تمثيلات المشهد إلى مكونات المقدمة والخلفية، مما يتيح بناء تمثيلات ثابتة تجاه الخلفية تحقق دقة قياسية في أسوأ حالات المجموعات على مجموعة بيانات "Waterbirds" دون الحاجة إلى بيانات واقعية غير منحازة.