← नवीनतम पेपर
💻 computer science

Multi-Agent Strategic Games with LLMs

यह शोध पत्र बार-बार होने वाले सुरक्षा दुविधा (security dilemma) खेलों में प्रयोगात्मक विषयों के रूप में लार्ज लैंग्वेज मॉडल्स (LLMs) का उपयोग करने वाला एक पद्धतिगत ढांचा प्रस्तुत करता है ताकि यह प्रदर्शित किया जा सके कि वे व्यवस्थित रूप से प्रमुख अंतर्राष्ट्रीय संबंधों तंत्रों—जैसे कि बहुध्रुवीयता के तहत बढ़ता संघर्ष, सीमित क्षितिज (finite horizons) में बिखराव, और संचार के माध्यम से संघर्ष में कमी—को पुनरुत्पादित करते हैं, साथ ही उनके विकल्पों के पीछे के रणनीतिक तर्क तक अनूठा पहुँच प्रदान करते हैं।

मूल लेखक: Maxim Chupilkin

प्रकाशित 2026-05-06
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Maxim Chupilkin

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक वैज्ञानिक हैं जो यह समझने की कोशिश कर रहे हैं कि देश युद्ध में क्यों जाते हैं या वे दोस्ती कैसे बनाए रखते हैं। आमतौर पर, आप वास्तविक दुनिया में नियंत्रित प्रयोग (controlled experiment) नहीं कर सकते क्योंकि आप वास्तविक नेताओं से लैब में "हमला करो या हमला मत करो" का खेल खेलने के लिए नहीं कह सकते। साथ ही, आप यह भी आसानी से नहीं देख सकते कि वे उन निर्णयों को लेते समय क्या सोच रहे हैं।

यह शोध पत्र इन समस्याओं को समझने के लिए लार्ज लैंग्वेज मॉडल्स (LLMs)—उसी तरह के स्मार्ट AI जैसे जिससे आप चैट करते हैं—का उपयोग करने का एक नया तरीका पेश करता है। लेखक इन AI को निबंध लिखने वाले उपकरणों के रूप में नहीं, बल्कि प्रायोगिक खिलाड़ियों (experimental players) के रूप में देखते हैं। इसे एक वर्चुअल "सैंडबॉक्स" की तरह समझें जहाँ आप डिजिटल पात्रों को आपस में बातचीत करते, निर्णय लेते और यहाँ तक कि उन्होंने वे निर्णय क्यों लिए, इसका कारण बताते हुए देख सकते हैं।

खेल: एक डिजिटल गतिरोध (Digital Standoff)

यह प्रयोग एक क्लासिक परिदृश्य पर आधारित है जिसे सिक्योरिटी डिलेमा (Security Dilemma) कहा जाता है। कल्पना कीजिए कि दो पड़ोसी (AI एजेंट) एक-दूसरे को लेकर संदिग्ध हैं। हर दिन, उन्हें दो में से एक विकल्प चुनना होता है:

  1. कुछ न करें: शांति बनाए रखें।
  2. हमला करें: पहले प्रहार करें।

नियम सरल लेकिन पेचीदा हैं:

  • यदि दोनों कुछ नहीं करते हैं, तो दोनों को एक अच्छा इनाम मिलता है (शांति)।
  • यदि एक हमला करता है और दूसरा कुछ नहीं करता, तो हमलावर बड़ी जीत हासिल करता है, और पीड़ित सब कुछ खो देता है।
  • यदि दोनों हमला करते हैं, तो दोनों हार जाते हैं (एक विनाशकारी युद्ध)।
  • महत्वपूर्ण बात: खेल उसी क्षण समाप्त हो जाता है जब कोई भी हमला करता है।

लेखक ने चार अलग-अलग AI मॉडल्स (जैसे GPT-5, Sonnet, और Gemini) का उपयोग करके इस खेल को 320 बार चलाया और यह देखने के लिए नियमों को तीन अलग-अलग तरीकों से थोड़ा बदला कि AI ने कैसे प्रतिक्रिया दी।

तीन प्रयोग ("क्या होगा अगर" वाले परीक्षण)

1. "भीड़भाड़ वाला कमरा" परीक्षण (Multipolarity)

  • बदलाव: दो पड़ोसियों के बजाय, लेखक ने एक तीसरा AI जोड़ दिया। अब तीन खिलाड़ी हैं।
  • रूपक (Metaphor): कल्पना कीजिए कि आप एक दोस्त के साथ शांति से बातचीत करने की कोशिश कर रहे हैं। अब कल्पना कीजिए कि आप तीन दोस्तों के साथ एक कमरे में हैं, जहाँ उनमें से कोई भी किसी भी समय चिल्ला सकता है।
  • परिणाम: AI बहुत अधिक घबरा गए। जब तीन खिलाड़ी थे, तो 81% बार युद्ध हुआ, जबकि दो खिलाड़ियों के साथ यह 65% था। AI ने तर्क दिया कि अधिक लोग होने पर, किसी के भी पहले हमला करने की संभावना बढ़ जाती है, इसलिए उन्होंने सुरक्षित रहने के लिए पहले ही हमला करने का फैसला किया।

2. "काउंटडाउन क्लॉक" परीक्षण (Finite Horizons)

  • बदलाव: मूल खेल में, AI को यह नहीं पता था कि खेल कब समाप्त होगा। इस संस्करण में, उन्हें बताया गया, "आप ठीक 10 राउंड खेलेंगे, फिर यह समाप्त हो जाएगा।"
  • रूपक: कल्पना कीजिए कि एक पार्टी है जहाँ आप जानते हैं कि संगीत ठीक 10:00 बजे बंद हो जाएगा। आप 9:59 पर बेतहाशा व्यवहार करना शुरू कर सकते हैं क्योंकि आप जानते हैं कि उसके बाद कोई परिणाम नहीं होगा।
  • परिणाम: यह सबसे नाटकीय बदलाव था। 100% खेल युद्ध में समाप्त हुए। AI ने "बैकवर्ड इंडक्शन" (backward induction) नामक तर्क का उपयोग किया। उन्होंने सोचा: "यदि हम राउंड 10 तक खेलते हैं, तो मैं जीतने के लिए तब हमला करूँगा क्योंकि भविष्य में कुछ खोने को नहीं है। लेकिन यदि मैं राउंड 10 में हमला करने वाला हूँ, तो मेरा प्रतिद्वंद्वी यह जानता है, इसलिए वे राउंड 9 में हमला करेंगे... इसलिए मुझे राउंड 1 में ही हमला कर देना चाहिए।" खेल तुरंत बिखर गया।

3. "ओपन माइक" परीक्षण (Communication)

  • बदलाव: AI को अपना कदम उठाने से पहले सार्वजनिक संदेश भेजने की अनुमति दी गई।
  • रूपक: कल्पना कीजिए कि पड़ोसी अब बाड़ के पार चिल्ला सकते हैं, "मैं वादा करता हूँ कि आज मैं तुम पर हाथ नहीं उठाऊँगा," या "चलो दोनों शांत रहते हैं।"
  • परिणाम: इससे मदद मिली। युद्ध घटकर 42.5% रह गया। AI ने विश्वास बनाने, वादे करने और अनौपचारिक नियम बनाने (जैसे "यदि हम लड़ना चाहते हैं, तो चलो पहले एक-दूसरे को चेतावनी दें") के लिए संदेशों का उपयोग किया। हालाँकि, इसने सभी युद्धों को नहीं रोका; जब लड़ाई हुई, तो वे आमतौर पर एकतरफा थी (एक AI ने वादा तोड़ दिया) न कि दोनों का एक साथ हमला करना।

वे क्या सोच रहे थे? (गुप्त लॉग्स)

इस अध्ययन का एक अनूठा हिस्सा यह है कि लेखक ने केवल यह नहीं देखा कि AI ने क्या किया, बल्कि यह भी देखा कि उन्होंने अपने निजी तर्क के रूप में क्या लिखा। यह हर खिलाड़ी के लिए एक डायरी रखने जैसा है।

  • "भीड़भाड़ वाले कमरे" में: AI ने लिखा, "मैं बहुत असुरक्षित हूँ; कोई और मुझसे पहले हमला कर सकता है।"
  • "काउंटडाउन क्लॉक" में: उन्होंने लिखा, "चूँकि खेल राउंड 10 में समाप्त हो जाएगा, इसलिए मुझे जीतने के लिए अभी हमला करना होगा।"
  • "ओपन माइक" में: उन्होंने लिखा, "हमारा एक समझौता है, और मैं हमारे विश्वास को बनाए रखना चाहता हूँ।"

इससे पता चला कि AI केवल अंदाज़ा नहीं लगा रहे थे; वे वास्तव में उसी रणनीतिक तर्क का उपयोग कर रहे थे जिस पर मानव राजनीतिक वैज्ञानिकों ने दशकों तक बहस की है।

मुख्य निष्कर्ष

यह शोध पत्र तर्क देता है कि इन प्रयोगों के लिए AI का उपयोग करना एक शक्तिशाली नया उपकरण है।

  • यह स्केलेबल है: आप मिनटों में सैकड़ों खेल चला सकते हैं।
  • यह पारदर्शी है: आप अंतिम परिणाम के बजाय यह भी देख सकते हैं कि AI क्या सोच रहा था।
  • यह प्रतिलिपि योग्य (Replicable) है: कोई भी ठीक वही कोड चला सकता है और समान परिणाम प्राप्त कर सकता है।

महत्वपूर्ण चेतावनी: लेखक बहुत सावधानी से कहते हैं कि ये AI वास्तविक इंसान या वास्तविक देश नहीं हैं। वे डिजिटल सिमुलेशन हैं। लक्ष्य यह कहना नहीं है कि, "अमेरिका या चीन वास्तव में ऐसा ही व्यवहार करेंगे।" इसके बजाय, लक्ष्य यह साबित करना है कि हम संघर्ष और सहयोग के बारे में अपने सिद्धांतों का परीक्षण करने के लिए इन डिजिटल एजेंटों का उपयोग एक नियंत्रित, दोहराने योग्य तरीके से कर सकते हैं। यह इस बात का अध्ययन करने के लिए एक नए प्रकार का सूक्ष्मदर्शी (microscope) है कि रणनीति कैसे काम करती है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →