Intent Laundering: AI Safety Datasets Are Not What They Seem
تكشف هذه الورقة أن مجموعات بيانات سلامة الذكاء الاصطناعي المستخدمة على نطاق واسع معيبة لأنها تعتمد على "إشارات تحفيزية" صريحة بدلاً من السلوك العدائي الواقعي، مما يثبت أنه عند إزالة هذه الإشارات عبر تقنية تسمى "غسيل النوايا"، تفشل حتى النماذج رفيعة المستوى في منع المخرجات الضارة.