GT-HarmBench: Benchmarking AI Safety Risks Through the Lens of Game Theory
यह शोध पत्र GT-HarmBench प्रस्तुत करता है, जो गेम थ्योरी संरचनाओं पर आधारित 1,535 उच्च-जोखिम वाले मल्टी-एजेंट परिदृश्यों का एक व्यापक बेंचमार्क है, जो यह प्रकट करता है कि अत्याधुनिक एआई मॉडल अक्सर सामाजिक रूप से लाभकारी परिणामों को चुनने में विफल रहते हैं और यह प्रदर्शित करता है कि गेम-थ्योरेटिक हस्तक्षेप इन जटिल वातावरणों में संरेखण (alignment) में महत्वपूर्ण सुधार कर सकते हैं।