What Suppresses Nash Equilibrium Play in Large Language Models? Mechanistic Evidence and Causal Control
यह शोध पत्र प्रकट करता है कि बड़े भाषा मॉडल नैश इक्विलिब्रियम (Nash equilibria) की गणना करने की यांत्रिक क्षमता रखते हैं, लेकिन प्रीट्रेनिंग में निहित एक परोपकारी ओवरराइड (prosocial override) के माध्यम से इस रणनीतिक व्यवहार को सक्रिय रूप से दबाते हैं, जो एक ऐसी घटना है जिसे हस्तक्षेप के माध्यम से कारणतः उलट दिया जा सकता है और जो मॉडल के पैमाने तथा तर्क विधियों से महत्वपूर्ण रूप से प्रभावित होती है।