Triggers Hijack Language Circuits: A Mechanistic Analysis of Backdoor Behaviors in Large Language Models
تقدم هذه الورقة أول تحليل ميكانيكي للأبواب الخلفية لتبديل اللغات في النماذج اللغوية الكبيرة، كاشفةً أن رؤوس الانتباه التي يتم تفعيلها بواسطة المحفز تتداخل بشكل كبير مع دوائر معالجة اللغة الطبيعية، مما يشير إلى أن الأبواب الخلفية تستولي على مكونات النموذج الموجودة بدلاً من تشكيل آليات معزولة.