Automated Benchmark Auditing for AI Agents and Large Language Models
यह शोध पत्र ऑटो बेंचमार्क ऑडिट (ABA) प्रस्तुत करता है, जो एक एजेंटिक फ्रेमवर्क है जो व्यवस्थित रूप से 25% से अधिक AI बेंचमार्क में महत्वपूर्ण खामियों की पहचान करता है, यह प्रदर्शित करते हुए कि इन समस्याग्रस्त कार्यों को हटाने से मॉडल रैंकिंग महत्वपूर्ण रूप से बदल जाती है और प्रदर्शन मेट्रिक्स में सुधार होता है।