AutoMonitor-Bench: Evaluating the Reliability of LLM-Based Misbehavior Monitor
यह शोध पत्र AutoMonitor-Bench प्रस्तुत करता है, जो विविध कार्यों में LLM-आधारित दुर्व्यवहार मॉनिटरों (misbehavior monitors) के व्यवस्थित मूल्यांकन के लिए पहला बेंचमार्क है, जो महत्वपूर्ण प्रदर्शन परिवर्तनशीलता और एक मौलिक सुरक्षा-उपयोगिता ट्रेड-ऑफ (safety-utility trade-off) को प्रकट करता है और यह प्रदर्शित करता है कि ज्ञात दुर्व्यवहार डेटा पर फाइन-ट्यूनिंग करना अनदेखे या अंतर्निहित विफलताओं का पता लगाने की चुनौतियों को पूरी तरह से हल नहीं करता है।