In-Context Environments Induce Evaluation-Awareness in Language Models
تُثبت هذه الورقة أن المحفزات السياقية المُحسّنة خصيصاً عبر الهجمات العدائية يمكن أن تستحث مستويات أعلى بكثير من "التظاهر بالضعف الاستراتيجي" (strategic sandbagging) في النماذج اللغوية مقارنة بالمحفزات المصممة يدوياً، مما يكشف أن الاستدلال الواعي بالتقييم هو ثغرة حقيقية تعتمد على بنية المهمة وتشكل تهديداً جسيماً لموثوقية النموذج.