Reasoning Capabilities of Large Language Models. Lessons Learned from General Game Playing
यह शोध पत्र जनरल गेम प्लेइंग परिवेश के भीतर चार लार्ज लैंग्वेज मॉडल्स की औपचारिक तर्क क्षमताओं का मूल्यांकन करता है, जिससे यह पता चलता है कि हालांकि वर्तमान मॉडल्स ने महत्वपूर्ण प्रगति दिखाई है, लेकिन कार्य की जटिलता और स्टेप डेप्थ बढ़ने के साथ उनका प्रदर्शन घट जाता है, जो अक्सर काल्पनिक नियमों (hallucinated rules) और सिंटैक्टिक गलतियों जैसी विशिष्ट तर्क संबंधी त्रुटियों के कारण होता है।