Stop Fixating on Prompts: Reasoning Hijacking and Constraint Tightening for Red-Teaming LLM Agents
تقدم هذه الورقة JailAgent، وهو إطار عمل جديد للاختبار الأحمر يتجاوز تعديل مطالبات المستخدم لمهاجمة وكلاء النماذج اللغوية الكبيرة عبر الاختطاف الضمني لمسارات استدلالهم وتشديد القيود من خلال استخراج المحفزات، والتلاعب بالاستدلال، والتحكم في استرجاع الذاكرة.