A Systematic Investigation of The RL-Jailbreaker in LLMs
تقدم هذه الورقة أول تفكيك منهجي لعمليات كسر الحماية القائمة على التعلم المعزز، كاشفةً أن عوامل صياغة البيئة — وتحديداً المكافآت الكثيفة وأطوال الحلقات الممتدة — هي المحركات الرئيسية لهجمات ناجحة ضد جميع النماذج اللغوية الكبيرة المستهدفة وضماناتها.