Attack Selection in Agentic AI Control Evaluations Meaningfully Decreases Safety
यह शोध पत्र यह प्रदर्शित करता है कि रणनीतिक रूप से यह चुनना कि कब हमला किया जाए, एजेंटिक एआई नियंत्रण प्रणालियों की मापी गई सुरक्षा को महत्वपूर्ण रूप से कमजोर करता है, जो यह प्रकट करता है कि अनिश्चित हमलावरों पर निर्भर वर्तमान मूल्यांकन संभवतः अत्यधिक आशावादी सुरक्षा अनुमान प्रस्तुत करते हैं।