Hack-Verifiable Environments: Towards Evaluating Reward Hacking at Scale
यह शोध पत्र एक नए मूल्यांकन प्रतिमान और "हैक-वेरिफिएबल टेक्स्टएरिना" (Hack-Verifiable TextArena) बेंचमार्क को प्रस्तुत करता है, जो भाषा मॉडलों द्वारा ऐसी कमजोरियों के शोषण को मापने के लिए नियत, स्वचालित और स्केलेबल माप को सक्षम करने हेतु वातावरण में सीधे पता लगाने योग्य रिवॉर्ड हैकिंग अवसरों को समाहित करता है।