Agent-ToM: Learning to Monitor Autonomous LLM Agents via Theory-of-Mind Reasoning
تقدم الورقة البحثية Agent-ToM، وهو إطار عمل للتعلم من أجل المراقبة يستفيد من استدلال نظرية العقل ومسار (الاستنتاج-التحقق-التنقيح) للكشف عن السلوكيات الخبيثة المستترة في الوكلاء المستقلين القائمين على النماذج اللغوية الكبيرة عبر استنتاج المعتقدات والنوايا الخفية، متفوقاً بذلك على النماذج المرجعية الحالية المتطورة في مجال المراقبة.