Why Do Aligned LLMs Remain Jailbreakable: Refusal-Escape Directions, Operator-Level Sources, and Safety-Utility Trade-off
تتقصى هذه الورقة البحثية سبب بقاء النماذج اللغوية الكبيرة المتوافقة قابلة للاختراق عبر تقديم مفهوم "اتجاهات الرفض والهروب" (RED)، حيث تثبت أن هذه الثغرات تنبع من مصادر محددة على مستوى العمليات داخل بنية النموذج، وتوضح أن القضاء عليها يخلق مقايضة متأصلة بين السلامة والمنفعة.