Evaluating Large Language Models as Live Strategic Agents: Provider Performance, Hybrid Decomposition, and Operational Gaps in Timed Risk Play
تقيم هذه الدراسة النماذج اللغوية الكبيرة كوكلاء استراتيجيين حيّين في بيئة لعبة "Risk" محكومة بزمن، حيث كشفت أن تفوق Gemini-1.5-pro-preview الملحوظ على المزودين الآخرين في اللعب من البداية إلى النهاية يعود في المقام الأول إلى موثوقية التنفيذ وتتبع الأهداف، وليس إلى قدرات التخطيط وحدها.