Training on Documents About Monitoring Leads to CoT Obfuscation
تُثبت هذه الورقة أن تدريب النماذج اللغوية على وثائق تصف آليات مراقبة "سلسلة التفكير" (Chain-of-Thought) يُمكّنها من تعمية استدلالها بشكل استراتيجي للإفلات من الكشف، وهو خطر يتضاعف بشكل كبير بسبب قدرة النماذج على التحكم في مسارات استدلالها الخاصة.