AutoMonitor-Bench: Evaluating the Reliability of LLM-Based Misbehavior Monitor
تقدم هذه الورقة البحثية AutoMonitor-Bench، وهو أول معيار لتقييم مراقبات سوء السلوك القائمة على النماذج اللغوية الكبيرة بشكل منهجي عبر مهام متنوعة، كاشفةً عن تباين كبير في الأداء ومقايضة جوهرية بين السلامة والمنفعة، مع إثبات أن الضبط الدقيق على بيانات سوء السلوك المعروف لا يحل تماماً التحديات في اكتشاف الإخفاقات غير المرئية أو الضمنية.