Evaluating Large Language Models as Live Strategic Agents: Provider Performance, Hybrid Decomposition, and Operational Gaps in Timed Risk Play
यह अध्ययन एक समयबद्ध रिस्क (Risk) वातावरण में लाइव रणनीतिक एजेंटों के रूप में लार्ज लैंग्वेज मॉडल्स का मूल्यांकन करता है, जिससे यह पता चलता है कि हालांकि Gemini-3.1-pro-preview ने एंड-टू-एंड गेमप्ले में अन्य प्रदाताओं की तुलना में काफी बेहतर प्रदर्शन किया, लेकिन प्रदर्शन का यह अंतर मुख्य रूप से केवल नियोजन क्षमताओं के बजाय निष्पादन विश्वसनीयता और उद्देश्य ट्रैकिंग से उपजा है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप शतरंज के ग्रैंडमास्टर्स की एक टीम को टूर्नामेंट खेलने के लिए काम पर रख रहे हैं। आमतौर पर, जब हम AI मॉडल (शतरंज के खिलाड़ियों) का परीक्षण करते हैं, तो हम उनसे एक एकल प्रश्न पूछते हैं, जैसे "यहाँ सबसे अच्छी चाल क्या है?" और उनके उत्तर का मूल्यांकन करते हैं। यह एक लिखित परीक्षा की तरह है।
लेकिन वास्तविक दुनिया में, AI केवल परीक्षा नहीं देता; उसे पूरा खेल खेलना होता है, सैकड़ों चालें चलनी होती हैं, समय की सीमाओं से निपटना होता है, और बिना रुके अपनी गलतियों को सुधारना होता है। यह शोध पत्र पूछता है: क्या होता है जब हम AI का परीक्षण लिखित परीक्षाओं के बजाय एक लाइव, समय-बद्ध टूर्नामेंट के साथ करना शुरू कर देते है?
शोधकर्ताओं ने एक क्लासिक बोर्ड गेम रिस्क (Risk) (जहाँ आप सेनाओं को हिलाकर दुनिया जीतने की कोशिश करते हैं) का उपयोग अपने परीक्षण क्षेत्र के रूप में किया। उन्होंने एक "चैंपियनशिप" आयोजित की जहाँ विभिन्न AI मॉडलों को वास्तविक समय में, सख्त नियमों और समय सीमा के साथ एक-दूसरे के खिलाफ खेलना था।
यहाँ उन्होंने जो पाया, उसका सरल विवरण दिया गया है:
1. लिखित परीक्षा बनाम लाइव गेम
उस बड़ी 32-गेम की टूर्नामेंट में, एक AI मॉडल, जेमिनी (Gemini), ने 32 में से 20 गेम जीते। उसने अन्य प्रसिद्ध मॉडलों जैसे GPT, Claude और Kimi को हराकर प्रतियोगिता को कुचल दिया।
आश्चर्य: जब शोधकर्ताओं ने देखा कि "सबसे नए" या "सबसे महंगे" मॉडल कौन से थे, तो वे हमेशा नहीं जीते। कभी-कभी, एक थोड़ा पुराना या सस्ता मॉडल चमकदार नए फ्लैगशिप मॉडल की तुलना में लाइव गेम में बेहतर प्रदर्शन करता था।
- उपमा: इसे एक रेस कार की तरह समझें। सबसे महंगी, हाई-टेक कार (नया मॉडल) शोरूम में (बेंचमार्क में) अद्भुत लग सकती है, लेकिन अगर इसमें एक नाजुक इंजन है जो 5 मिनट के बाद गर्म होकर बंद हो जाता है, तो यह एक लंबी एंड्योरेंस रेस हार जाएगी। विजेता सबसे चमकदार कार नहीं थी; बल्कि वह थी जो पूरे रेस के दौरान लगातार चलती रह सकी।
2. गुप्त मंत्र: योजना बनाना बनाम चलाना (Planning vs. Driving)
शोधकर्ता यह जानना चाहते थे कि जेमिनी क्यों जीता। क्या इसलिए क्योंकि वह योजना बनाने (रणनीति के बारे में सोचने) में जीनियस था, या इसलिए क्योंकि वह चलाने (बोर्ड पर मोहरों को वास्तव में चलाने) में अच्छा था?
यह पता लगाने के लिए, उन्होंने एक "हाइब्रिड" प्रयोग चलाया। उन्होंने सभी अलग-अलग मॉडलों के मस्तिष्क (योजना बनाने वाले हिस्से) को लिया और उन्हें मोहरों को चलाने के लिए एक ही सस्ते, तेज़ शरीर (निष्पादन/एग्जीक्यूशन वाले हिस्से) का उपयोग करने के लिए मजबूर किया।
परिणाम: जब उन्होंने ऐसा किया, तो मॉडलों के बीच का अंतर लगभग समाप्त हो गया। "प्रतिभाशाली" मॉडल और "औसत" मॉडल लगभग एक जैसा प्रदर्शन करने लगे।
- उपमा: कल्पना करें कि आपके पास एक बहुत ही बुद्धिमान शतरंज कोच (योजनाकार) और एक अनाड़ी सहायक (निष्पादक) है। यदि आप बुद्धिमान कोच को एक अनाड़ी सहायक देते हैं, तो कोच जीत नहीं सकता। लेकिन यदि आप प्रत्येक कोच को एक ही अनाड़ी सहायक देते हैं, तो उनकी रणनीति में अंतर उतना मायने नहीं रखता।
- सबक: जेमिनी के बड़े टूर्नामेंट जीतने का कारण केवल यह नहीं था कि वह बेहतर सोचता था; बल्कि यह था कि उसका पूरा सिस्टम (सोचना + करना) सुचारू रूप से एक साथ काम करता था। अन्य मॉडलों के पास "अनाड़ी सहायक" थे जिन्होंने उनकी शानदार योजनाओं को बिगाड़ दिया।
3. जेमिनी वास्तव में कैसे जीता
जब उन्होंने गेम लॉग्स को करीब से देखा, तो उन्हें दो विशिष्ट आदतें मिलीं जिन्होंने जेमिनी को चैंपियन बनाया:
- वह लक्ष्य को कभी नहीं भूला: जबकि अन्य मॉडल छोटी बारीकियों में भटक गए, जेमिनी खुद को लगातार याद दिलाता रहा, "मुझे जीतने के लिए बोर्ड के 65% हिस्से को नियंत्रित करने की आवश्यकता है।" जैसे-जैसे खेल अंत के करीब आया, उसने अंतिम लक्ष्य पर और भी अधिक ध्यान केंद्रित किया।
- उपमा: यह एक मैराथन धावक की तरह है जो लगातार फिनिश लाइन के साइन को देखता रहता है। अन्य धावक पेड़ों या बादलों को देख रहे थे, लेकिन जेमिनी ने अपनी नज़रें फिनिश लाइन पर रखीं।
- उसने गहरी चालें चलीं: जब जेमिनी ने हमला करने का फैसला किया, तो उसने केवल एक छोटी सी चाल नहीं चली। उसने हमलों की लंबी श्रृंखलाओं की योजना बनाई जिसने एक ही टर्न में जमीन के बड़े हिस्सों पर कब्जा कर लिया।
- उपमा: अन्य मॉडल एक गुब्बारे में छेद करने वाले व्यक्ति की तरह थे। जेमिनी पूरे गुब्बारे को एक झटके में फोड़ने वाले व्यक्ति की तरह था।
4. "सस्ता बेहतर है" की खोज
शोधकर्ताओं ने एक "हाइब्रिड" रणनीति का भी परीक्षण किया: क्या होगा यदि आप एक सुपर-स्मार्ट (लेकिन महंगे) मॉडल का उपयोग केवल योजना बनाने के लिए करें, और एक सस्ते, तेज़ मॉडल का उपयोग केवल काम करने के लिए करें?
परिणाम: इस हाइब्रिड टीम ने लगभग उतनी ही बार जीत हासिल की जितनी कि सुपर-महंगी टीम ने, लेकिन इसे चलाने में आधे से भी कम पैसा खर्च हुआ।
- उपमा: यह एक प्रसिद्ध, महंगे वास्तुकार (architect) को ब्लूप्रिंट बनाने के लिए काम पर रखने जैसा है, लेकिन फिर घर बनाने के लिए एक सामान्य, किफायती निर्माण दल को काम पर रखना है। आपको हर कील ठोकने के लिए वास्तुकार की प्रति घंटा दर दिए बिना शानदार डिज़ाइन मिल जाता है।
मुख्य निष्कर्ष
यह शोध पत्र हमें सिखाता है कि AI को इस आधार पर आंकना कि वह एक एकल प्रश्न का उत्तर कितनी अच्छी तरह देता है, भ्रामक है। वास्तविक दुनिया के AI को एक विश्वसनीय कार्यकर्ता होने की आवश्यकता है, न कि केवल एक स्मार्ट वक्ता होने की।
- केवल IQ स्कोर न देखें: देखें कि मॉडल समय सीमा, गलतियों और लंबे कार्यों को कैसे संभालता है।
- पूरा सिस्टम मायने रखता है: एक स्मार्ट दिमाग बेकार है यदि हाथ (निष्पादन) अनाड़ी हों।
- हाइब्रिड ही भविष्य है: आप अक्सर काम को विभाजित करके पैसे बचा सकते हैं और बेहतर परिणाम प्राप्त कर सकते हैं: सोचने के लिए एक स्मार्ट मॉडल का उपयोग करें और करने के लिए एक सस्ते मॉडल का।
संक्षेप में: वास्तविक दुनिया में, निरंतरता और निष्पादन अकेले कच्ची बुद्धिमत्ता (raw intelligence) को हरा देते हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।