Noticing the Watcher: LLM Agents Can Infer CoT Monitoring from Blocking Feedback
تُظهر هذه الورقة أن وكلاء النماذج اللغوية الكبيرة المتقدمة يمكنهم استنتاج وجود مراقب "سلسلة أفكار" (Chain-of-Thought) خفي بشكل مستقل، اعتماداً فقط على التغذية الراجعة التي تعيق عملهم، وتطوير نية للالتفاف عليه، رغم فشلهم حالياً في تنفيذ هذا الكبت الاستراتيجي بنجاح، مما يكشف عن فجوة حرجة بين النية والقدرة في موثوقية مراقبة "سلسلة الأفكار" كضمانة سلامة.