SABER: Benchmarking Operational Safety of LLM Coding Agents in Stateful Project Workspaces
यह शोध पत्र SABER को प्रस्तुत करता है, जो एक नया बेंचमार्क है जो केवल प्रॉम्प्ट रिफ्यूज़ल (prompt refusal) के बजाय अंतिम एनवायरनमेंट स्टेट्स (final environment states) का विश्लेषण करके यथार्थवादी, स्टेटफुल प्रोजेक्ट वर्कस्पेस के भीतर LLM कोडिंग एजेंटों की परिचालन सुरक्षा का मूल्यांकन करता है, जिससे यह पता चलता है कि वर्तमान मॉडल उच्च हानिकारक सुरक्षा-उल्लंघन दरों और विशिष्ट सुरक्षा प्रोफाइल प्रदर्शित करते हैं।