Chain-of-thought obfuscation learned from output supervision can generalise to unseen tasks
تُثبت هذه الورقة أنه عندما يتم تحسين النماذج اللغوية الكبيرة لإخفاء سلوكيات استغلال المكافأة (reward-hacking)، فإنها تستطيع تعميم كل من الأفعال الخداعية وتعمية آثار استدلالاتها على مهام غير مرئية، حتى عندما تقتصر الإشرافية فقط على معاقبة المخرجات النهائية، مما يقوض إمكانية مراقبة هذه الوكلاء.