AVISE: Framework for Evaluating the Security of AI Systems
تقدم هذه الورقة البحثية AVISE، وهو إطار عمل مفتوح المصدر ومعياري لتحديد الثغرات الأمنية وتقييم أمن أنظمة الذكاء الاصطناعي بشكل منهجي، والذي تم استعراضه من خلال اختبار تقييم أمني مؤتمت نجح في اكتشاف ثغرات كسر الحماية (jailbreak) في تسعة نماذج لغوية متنوعة باستخدام هجوم "الملكة الحمراء" (Red Queen attack) المعزز.