Jailbreaking Leaves a Trace: Understanding and Detecting Jailbreak Attacks from Internal Representations of Large Language Models
تقترح هذه الورقة إطار عمل خفيف الوزن للكشف عن كسر الحماية (jailbreak) والتخفيف من آثاره أثناء مرحلة الاستدلال، والذي يستفيد من الأنماط المتسقة في الفضاء الكامن ضمن التمثيلات الداخلية للنماذج اللغوية الكبيرة لتحديد المطالبات الضارة وتعطيلها دون الحاجة إلى ضبط دقيق للنموذج أو كواشف مساعدة.