What AI Red-Team Evaluations Can and Cannot Prove
यह शोध पत्र AI रेड-टीम मूल्यांकन के लिए एक गणनीय "साक्ष्यगत सीमा" (evidential ceiling) स्थापित करता है, जो यह प्रदर्शित करता है कि जबकि वर्तमान बेंचमार्क उच्च-आवृत्ति वाले नुकसानों के लिए सुरक्षा को प्रभावी ढंग से प्रमाणित कर सकते हैं, वे अंतर्निहित सांख्यिकीय सीमाओं के कारण दुर्लभ, विनाशकारी जोखिमों की सुरक्षा सिद्ध करने के लिए मौलिक रूप से अपर्याप्त हैं।