Consistency as a Testable Property: Statistical Methods to Evaluate AI Agent Reliability
यह शोध पत्र U-सांख्यिकी (U-statistics) और कर्नेल-आधारित मेट्रिक्स का उपयोग करते हुए एक कठोर सांख्यिकीय ढांचे को प्रस्तुत करता है जो एक एआई एजेंट की मूल क्षमताओं और उसकी निष्पादन सुदृढ़ता (execution robustness) के बीच अंतर करता है, यह प्रदर्शित करते हुए कि उच्च-जोखिम वाले वातावरण में विश्वसनीयता संबंधी समस्याओं की पहचान करने के लिए प्रक्षेपवक्र-स्तरीय निरंतरता (trajectory-level consistency) माप पारंपरिक pass@1 दरों की तुलना में बेहतर नैदानिक संवेदनशीलता प्रदान करते हैं।