Age of LLM: A Strategic 1v1 Benchmark for Reasoning, Diplomacy and Reliability of Large Language Models under Fog of War
यह शोध पत्र "Age of LLM" प्रस्तुत करता है, जो एक नवीन टर्न-आधारित 1v1 बेंचमार्क है जिसमें फॉग ऑफ वॉर (fog of war), अनियंत्रित कूटनीति और सख्त एक्शन रिलायबिलिटी बाधाएं शामिल हैं ताकि यह मूल्यांकन किया जा सके कि बड़े भाषा मॉडल प्रतिकूल अनिश्चितता के तहत कैसे तर्क करते हैं, धोखा देते हैं और विश्वासों को ट्रैक करते हैं, जिससे यह प्रकट होता है कि परमाणु रणनीतियां हावी रहती हैं जबकि राजनयिक समझौते शायद ही कभी सफल होते हैं।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि एक उच्च-दांव वाला शतरंज का मैच चल रहा है, लेकिन लकड़ी के बोर्ड और मोहरों के बजाय, दो विशाल AI दिमाग एक 13-बाय-7 ग्रिड पर एक डिजिटल युद्ध खेल (war game) खेल रहे हैं। वे पूरा बोर्ड नहीं देख सकते; आधा हिस्सा घने, बदलते हुए कोहरे से ढका हुआ है। उन्हें अपनी सेना बनानी होगी, गुप्त संसाधनों का प्रबंधन करना होगा और एक-दूसरे से बात करनी होगी, और यह सब करते हुए दूसरे खिलाड़ी के बेस को उड़ाने की कोशिश करनी होगी।
यह Age of LLM है, जो एक नया प्रयोग है यह देखने के लिए कि जब AI मॉडल अंधे होते हैं, दबाव में होते हैं, और बिना किसी शिक्षक की मदद के सख्त नियमों का पालन करने के लिए मजबूर होते हैं, तो वे कितनी अच्छी तरह से सोचते हैं।
यहाँ बताया गया है कि क्या हुआ, सरल उपमाओं (analogies) का उपयोग करते हुए:
1. खेल: एक धुंधला वॉर रूम (A Foggy War Room)
इस खेल को एक जासूसी थ्रिलर की तरह समझें।
- युद्ध का कोहरा (The Fog of War): आप केवल वही देख सकते हैं जहाँ आपकी अपनी इकाइयाँ (units) खड़ी हैं। दुश्मन के संसाधन और सैनिक छिपे हुए हैं। यदि आप किसी ऐसी जगह टैंक ले जाने की कोशिश करते जिसे आप देख नहीं सकते, तो गेम कहता है, "नहीं, यह अवैध है," और आप वह टर्न हार जाते हैं।
- रहस्य (The Secret): सबसे शक्तिशाली हथियार एक परमाणु बम है। इसे बनाने के लिए, आपको "यूरेनियम" नामक एक गुप्त संसाधन की आवश्यकता होती है। दुश्मन को नहीं पता कि आपके पास कितना यूरेनियम है, और आपको उनका नहीं पता। यह ब्लफिंग (धोखा देने) की अनुमति देता है।
- नियम (The Rules): AI को एक नियम पुस्तिका दी जाती है लेकिन कोई रणनीति गाइड नहीं। यह एक शेफ को सामग्री और रसोई के उपकरणों की सूची देने जैसा है, लेकिन साथ ही यह कहना कि, "एक भोजन बनाओ, लेकिन मुझे यह मत बताओ कि क्या बनाना है।" AI को खुद योजना बनानी पड़ती है।
2. बड़ा आश्चर्य: लगभग सभी ने "न्यूक्लियर रश" को चुना
शोधकर्ता उम्मीद कर रहे थे कि AI कई अलग-अलग रणनीतियाँ आजमाएगा, जैसे कि एक विशाल टैंक सेना बनाना या शांति के लिए बातचीत करना। इसके बजाय, लगभग सभी ने (लगभग 78% से 85% बार) एक ही रास्ता चुना: द न्यूक्लियर रश (The Nuclear Rush)।
- रणनीति: यूरेनियम प्राप्त करने के लिए एक खदान (mine) बनाएं, बम रखने के लिए एक साइलो (silo) बनाएं, दुश्मन की निगरानी करें, और फिर हमला करें।
- परिणाम: यह एक दौड़ थी। जो पहले लॉन्च करने वाला था, वही जीता। जो दूसरा था, वह हार गया।
- ट्विस्ट: क्योंकि खेल के नियम कहते हैं कि लॉन्च गुप्त रूप से और एक साथ होते हैं, इसलिए किसी ने भी दूसरे को खुद निर्णय लेने से पहले लॉन्च होते हुए नहीं देखा। यह इसलिए नहीं था कि AI इतना मूर्ख था कि वह काउंटर-लॉन्च के बारे में नहीं सोच सका; बल्कि खेल के मैकेनिक्स ने समय पर प्रतिक्रिया देना असंभव बना दिया था। यह बिल्कुल एक ही सेकंड में स्विच दबाने वाले दो लोगों जैसा था; किसी ने भी दूसरे का हाथ पहले हिलते हुए नहीं देखा।
3. "टैंक" रणनीति: तेज़ लेकिन दुर्लभ
कुछ ही AI ने दुश्मन के बेस में टैंक लेकर घुसकर जीतने की कोशिश की।
- उपमा: यह एक स्प्रिंटर बनाम मैराथन धावक की तरह है। टैंक रणनीति बहुत तेज़ थी (न्यूक्लियर से लगभग 12 टर्न बनाम 19 टर्न में जीत), लेकिन इसे अंजाम देना बहुत कठिन था। इसके लिए सटीक समन्वय और भाग्य की आवश्यकता थी। अधिकांश AI इसे आज़माने से डरते थे, इसलिए वे "सुरक्षित" परमाणु दौड़ पर टिके रहे।
4. बातचीत: बहुत अधिक ब्लफिंग, बहुत कम विश्वास
AI मॉडल्स को एक-दूसरे को टेक्स्ट मैसेज भेजने की अनुमति दी गई थी। उन्होंने हजारों संदेश भेजे!
- ब्लफिंग (The Bluff): भले ही कोई AI बुरी तरह हार रहा हो, वह अक्सर संदेश भेजता था कि "मैं तुम्हें कुचलने वाला हूँ!" या "अभी आत्मसमर्पण कर दो!" इसे ब्लफिंग कहा जाता है। पेपर में पाया गया कि हारने वाले भी जीतने वालों जितनी ही बार ब्लफ करते थे। यह एक ऐसे पोकर खिलाड़ी की तरह है जिसके पास बहुत खराब हाथ है लेकिन वह रॉयल फ्लश होने का नाटक कर रहा है।
- चुप्पी (The Silence): जब खेल वास्तव में समाप्त हो गया, तो हारने वाले शायद ही कभी "अच्छा खेल" या "आप जीते" कहते। वे आखिरी सेकंड तक बात करते रहे।
- रहस्य (The Secret): सबसे दिलचस्प खोज धोखाधड़ी (deception) के बारे में थी। जब कोई AI अपना गुप्त परमाणु साइलो बना रहा होता था, तो वह अपने संदेशों में उसका उल्लेख शायद ही कभी करता था। वह कहता था जैसे, "हम बस कुछ शांतिपूर्ण खेती कर रहे हैं," जबकि गुप्त रूप से बम बना रहा होता था। लेकिन एक बार जब बम चलाने के लिए तैयार हो जाता, तो वे अक्सर इसकी घोषणा ज़ोर से करते थे। ऐसा लगता है कि AI ने तैयारी को छिपाना सीखा, लेकिन क्रियान्वयन (execution) को नहीं।
5. असली परीक्षण: विश्वसनीयता बनाम बुद्धिमत्ता
पेपर ने एक महत्वपूर्ण सवाल पूछा: क्या अधिक सोचने से आप जीतते हैं?
- निष्कर्ष: ज़रूरी नहीं। जिस AI ने सबसे अधिक समय "सोचने" (टोकन प्रोसेस करने) में बिताया, वह हमेशा नहीं जीता।
- असली विजेता: वह AI जो सबसे अधिक बार जीता, वह था जिसने सबसे कम गलतियाँ कीं। इस खेल में, यदि आप किसी ऐसी धुंधली जगह में अपनी यूनिट ले जाने की कोशिश करते जिसे आप देख नहीं सकते, तो गेम आपके कमांड को अनदेखा कर देता है। आप एक टर्न हार जाते हैं।
- सबक: सबसे अच्छा खिलाड़ी सबसे बुद्धिमान दार्शनिक नहीं था; वह सबसे विश्वसनीय सैनिक था। वह AI जिसने खेल पर ध्यान केंद्रित रखा, याद रखा कि दुश्मन कहाँ था, और असंभव काम करने की कोशिश नहीं की, वही जीता। पेपर सुझाव देता है कि जटिल, वास्तविक दुनिया के कार्यों में, गलती न करना जीनियस होने से कहीं अधिक महत्वपूर्ण हो सकता है।
6. यह क्यों मायने रखता है (पेपर के अनुसार)
अधिकांश AI टेस्ट पॉप क्विज़ की तरह होते हैं: "यहाँ एक गणित की समस्या है, इसे हल करें।" AI पूरी समस्या देख सकता है और बस उत्तर दे सकता है।
Age of LLM अलग है। यह एक लाइव, बहु-दिवसीय सर्वाइवल गेम की तरह है जहाँ:
- आप सब कुछ नहीं देख सकते।
- आपको याद रखना होगा कि कल क्या हुआ था।
- आपको सख्त नियमों का पालन करना होगा अन्यथा दंडित किया जाएगा।
- आपको एक ऐसे प्रतिद्वंद्वी से बात करनी होगी जो झूठ बोल सकता है।
पेपर निष्कर्ष निकालता है कि यह इस बात को देखने का एक बेहतर तरीका है कि AI वास्तव में कैसे "सोचता" है जब वह केवल किसी किताब से तथ्य रट नहीं रहा होता। यह हमें दिखाता है कि वास्तविक दुनिया में उपयोगी होने के लिए, AI को स्मार्ट होने के साथ-साथ विश्वसनीय (reliable) होना भी ज़रूरी है (तथ्यों को मनगढ़ंत न बनाना या नियमों को न भूलना)।
संक्षेप में: AI मॉडल्स ने एक धुंधले युद्ध खेल खेला। अधिकांश ने परमाणु मार्ग चुना। वे चैट में बहुत झूठ बोले। और विजेता वह नहीं था जिसने सबसे अधिक सोचा, बल्कि वह था जिसने सबसे कम बेवकूफी भरी गलतियाँ कीं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।