Breaking the weakest link to evade vision language models
تقترح هذه الورقة طريقة هجوم قائمة على التدرج وذات كفاءة حوسبية، تستهدف فقط مشفر الرؤية في النماذج اللغوية البصرية (VLMs) لتوليد اضطرابات عدائية غير محسوسة قادرة على تعطيل أو اختطاف التفسيرات النصية للنماذج، مما يكشف عن ثغرات أمنية كبيرة في الأنظمة الحالية للذكاء الاصطناł متعدد الوسائط.