Beyond single-channel agentic benchmarking
यह शोध पत्र तर्क देता है कि एजेंटिक एआई सुरक्षा बेंचमार्क को पृथक एजेंट सटीकता के मूल्यांकन से हटकर मानव-एआई युग्मों (human-AI dyads) की विश्वसनीयता के आकलन की ओर स्थानांतरित होना चाहिए, जो इस बात पर जोर देता है कि कैसे अपूर्ण एआई सिस्टम ज्ञात मानवीय विफलताओं के विरुद्ध रेडंडेंट (redundant), असंबंधित त्रुटि मोड प्रदान करके समग्र सुरक्षा को बढ़ा सकते हैं।