GT-HarmBench: Benchmarking AI Safety Risks Through the Lens of Game Theory
تقدم هذه الورقة GT-HarmBench، وهو معيار شامل يضم 1,535 سيناريو متعدد الوكلاء عالي المخاطر القائمة على هياكل نظرية الألعاب، والذي يكشف أن نماذج الذكاء الاصطناعي الرائدة تفشل تكراراً في اختيار النتائج المفيدة اجتماعياً، ويوضح أن التدخلات القائمة على نظرية الألعاب يمكن أن تحسن بشكل كبير من عملية المواءمة في هذه البيئات المعقدة.