BEAT: Visual Backdoor Attacks on VLM-based Embodied Agents via Contrastive Trigger Learning
تقدم هذه الورقة BEAT، وهو إطار عمل مبتكر يقوم بحقن أبواب خلفية بصرية في الوكلاء المجسدين القائمين على نماذج اللغة والرؤية (VLM) من خلال الاستفراد من محفزات الأشياء ومخطط تدريب ثنائي المرحلة يتميز بتعلم المحفز التبايني لتحقيق معدلات نجاح هجوم عالية مع الحفاظ على أداء المهام الحميدة.