Comparing Exploration-Exploitation Strategies of LLMs and Humans: Insights from Standard Multi-armed Bandit Experiments
यह अध्ययन मल्टी-आर्म्ड बैंडिट कार्यों में लार्ज लैंग्वेज मॉडल्स, मनुष्यों और एल्गोरिदम की एक्सप्लोरेशन-एक्सप्लोइटेशन रणनीतियों की तुलना करता है और पाता है कि जबकि "सोचने" (thinking) को सक्षम करने से लार्ज लैंग्वेज मॉडल्स स्थिर वातावरण में अधिक मानव-समान हो जाते हैं, वे फिर भी जटिल, गैर-स्थिर वातावरण में मानवीय अनुकूलन क्षमता और निर्देशित अन्वेषण (directed exploration) प्राप्त करने में संघर्ष करते हैं।