Towards Understanding the Robustness of Sparse Autoencoders
تُثبت هذه الورقة أن دمج المشفّرات التلقائية المتفرقة (Sparse Autoencoders) المُدربة مسبقاً في مسارات المتبقيات (residual streams) لنماذج المحولات (transformer) أثناء وقت الاستنتاج يعزز بشكل كبير من متانة النماذج اللغوية الكبيرة ضد هجمات كسر الحماية (jailbreak attacks) بنوعيها، "الصندوق الأبيض" و"الصندوق الأسود"، وذلك عبر إعادة تشكيل هندسة الأمثلة (optimization geometry)، محققةً انخفاضاً يصل إلى 5 أضعاف في معدلات نجاح الهجمات مع الكشف عن علاقة رتيبة بين التفرق (sparsity) وفعالية الدفاع.