← नवीनतम पेपर
🤖 AI

Evolutionary Dynamics of Cooperation in Next-Generation LLM Agent Systems: A Cross-Provider Empirical Extension

यह अध्ययन 2025-2026 के चार फ्रंटियर एलएलएम (LLM) एजेंटों तक विकासवादी गेम थ्योरी (evolutionary game theory) के बेंचमार्क का विस्तार करता है, जो यह प्रकट करता है कि जबकि अधिकांश मॉडलों में सहयोगात्मक पूर्वाग्रह बने रहते हैं, प्रदाता की पहचान संतुलन परिणामों को महत्वपूर्ण रूप से प्रभावित करती है और आक्रामक क्षमता समानता में आंशिक सुधार के बावजूद शोर संबंधी मजबूती (noise robustness) एक सार्वभौमिक चुनौती बनी हुई है।

मूल लेखक: Francisco León Zúñiga Bolívar (Institución Universitaria Colegio Mayor del Cauca)

प्रकाशित 2026-05-29
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Francisco León Zúñiga Bolívar (Institución Universitaria Colegio Mayor del Cauca)

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि एक विशाल, डिजिटल अखाड़ा है जहाँ हजारों AI "एजेंट्स" (agents) प्रिज़नर्स डिलेमा (Prisoner's Dilemma) के एक अंतहीन खेल में फंसे हुए हैं। इस खेल में, दो खिलाड़ी या तो सहयोग (Cooperate - साझा इनाम के लिए मिलकर काम करना) कर सकते हैं या धोखा (Defect - व्यक्तिगत लाभ के लिए दूसरे को धोखा देना) दे सकते हैं।

यह शोध पत्र जो सवाल पूछता है वह सरल है: जैसे-जैसे AI अधिक स्मार्ट और नया होता जा रहा है, क्या ये डिजिटल एजेंट बेहतर टीममेट बनना सीख रहे हैं, या वे अधिक क्रूर प्रतिस्पर्धी बनते जा रहे हैं?

लेखक, फ्रांसिस्को लियोन ज़ुनिगा बोलिवर (Francisco León Zúñiga Bolívar) ने 2025 के एक प्रसिद्ध प्रयोग को लिया और उसे 2025 और 2026 के "ताज़ा" AI मॉडल्स के साथ अपडेट किया। यहाँ उन्होंने जो पाया, उसकी कहानी दी गई है, जिसे बिना किसी तकनीकी शब्दावली (jargon) के समझाया गया है।

सेटअप: एक डिजिटल विकासवादी चिड़ियाघर (A Digital Evolutionary Zoo)

इस प्रयोग को विकसित होती प्रजातियों के एक चिड़ियाघर की तरह समझें।

  • खिलाड़ी: लेखक ने AI एजेंटों की चार नई "प्रजातियां" बनाईं (Anthropic, Google और OpenAI से)।
  • खेल: ये एजेंट प्रिज़नर्स डिलेमा को बार-बार खेलते हैं।
  • विकास (Evolution): केवल एक खेल खेलने के बजाय, लेखक ने विकास की 500 पीढ़ियों का अनुकरण (simulate) किया। यदि कोई एजेंट अच्छा खेलता है, तो वह "प्रजनन" करता है (उसकी रणनीति अधिक सामान्य हो जाती है)। यदि वह खराब खेलता है, तो वह खत्म हो जाता है।
  • लक्ष्य: यह देखना कि लंबे समय में कौन सा "रवैया" जीतता है: आक्रामक (हमेशा धोखा देना), सहयोगी (हमेशा मदद करना), या तटस्थ (दोनों का मिश्रण)।

मुख्य निष्कर्ष

1. "अच्छे लड़के" का पूर्वाग्रह अभी भी मजबूत है (H1)

उपमा: कल्पना कीजिए कि एक स्कूल के मैदान में बच्चों को एक खेल खेलने के लिए कहा जाता है। भले ही सबसे स्मार्ट बच्चे जीतने के लिए सबको धमकाने का तरीका जान सकते हों, फिर भी वे ज्यादातर अच्छा व्यवहार करना चुनते हैं।
परिणाम: अधिकांश परिदृश्यों में, सहयोग जीतता है। 12 अलग-अलग AI मॉडल और निर्देशों के संयोजनों में से 9 में, "सहयोगी" (Cooperative) रणनीति प्रमुख बन गई। नए, स्मार्ट AI अपने पुराने भाई-बहनों की तरह ही "अच्छे लड़के" वाले पूर्वाग्रह को बनाए रखते हैं; वे निर्दयी तानाशाह नहीं बने।

2. "प्रदाता" (Provider) पीढ़ी से अधिक महत्वपूर्ण है (H3)

उपमा: AI मॉडल्स को कारों की तरह समझें। आप सोच सकते हैं कि 2026 का मॉडल 2025 के मॉडल से हमेशा बेहतर होगा। लेकिन इस दौड़ में, यह मायने रखता है कि कार किसने बनाई, न कि यह कि वह किस साल की है।

  • Google का "Flash" मॉडल एक ऐसी रेस कार की तरह था जिसे गति और आक्रामकता के लिए बनाया गया था। इसने अक्सर पूरी आबादी को बुली (bully) यानी डराने वाले लोगों में बदल दिया (77% तक आक्रामक)।
  • OpenAI का "Mini" मॉडल सुरक्षा के लिए बनाई गई कार की तरह था। इसने आबादी को मिलनसार बनाए रखा (70% तक सहयोगी)।
  • Anthropic का मॉडल बहुत सुसंगत रहा, जो पिछले वर्ष के अपने पूर्ववर्ती की तरह लगभग वैसा ही बना रहा।

सीख: यदि आप AI की एक ऐसी टीम चाहते हैं जो सहयोग करे, तो आप सिर्फ "सबसे नया" वाला नहीं चुन सकते; आपको उसे चुनना होगा जो उस कंपनी का है जो उन्हें अच्छा बनने के लिए प्रशिक्षित करती है।

3. "स्व-सुधार" (Self-Refinement) का जाल (H2)

उपमा: कल्पना कीजिए कि आप एक छात्र को निबंध लिखने के लिए कहते हैं, और फिर उनसे अपने ही निबंध की आलोचना करने और उसे फिर से लिखने के लिए कहते हैं ताकि वह बेहतर हो सके।
परिणाम: जब AI को "स्व-सुशोधन" (Self-Refine - अपनी रणनीति की आलोचना करना) करने के लिए कहा गया, तो वह आक्रामक होने में बहुत बेहतर हो गया।

  • "डिफ़ॉल्ट" मोड में, आक्रामक रणनीतियाँ कमजोर थीं और आसानी से हार गईं।
  • "Self-Refine" मोड में, आक्रामक रणनीतियाँ इतनी तेज हो गईं कि वे सहयोगी रणनीतियों के लगभग बराबर पहुँच गईं।
  • चेतावनी: AI को "स्मार्टर" बनाने की कोशिश करना, जैसे कि उसे अपनी योजनाओं की आलोचना करने के लिए कहना, अनजाने में उसे एक बेहतर बुली (bully) बना सकता है।

4. "स्टैटिक नॉइज़" (Static Noise) की समस्या (H4)

उपमा: कल्पना कीजिए कि आप टेलीफोन का एक खेल खेल रहे हैं जहाँ कभी-कभी संदेश बिगड़ जाता है (शोर/noise)। क्या नया AI बिगड़े हुए संदेशों को पुराने वाले से बेहतर संभालता है?
परिणाम: नया AI (Claude 4.6) पुराने वाले की तुलना में शोर को थोड़ा बेहतर तरीके से संभालता हुआ लगा, लेकिन लेखक पूरी तरह निश्चित नहीं हो सकते। अंतर इतना कम था कि यह गणित का एक संयोग भी हो सकता है।

  • वास्तविकता: शोर (संचार में त्रुटियां) समूह को आक्रामकता की ओर धकेलता है, चाहे AI कितना भी स्मार्ट क्यों न हो। यह एक सार्वभौमिक चुनौती है।

"पात्रों" का सारांश

  • GPT-5.4 Mini (OpenAI): सबसे सुसंगत "अच्छा लड़का"। जब परिस्थितियाँ इसके खिलाफ थीं, तब भी यह सहयोगी बना रहा।
  • Gemini 2.5 Flash (Google): "आक्रामक वाइल्डकार्ड"। यह पूरी आबादी को गलाकाट प्रतिस्पर्धा में बदलने के लिए सबसे अधिक संभावित था।
  • Claude Sonnet 4.6 (Anthropic): "स्थिर हाथ"। यह पिछले वर्ष से बहुत अधिक नहीं बदला, ज्यादातर सहयोगी रहा लेकिन इस बात के प्रति बहुत संवेदनशील था कि उससे कैसे सोचने के लिए कहा गया।
  • Gemini 3.1 Pro (Google): "भ्रमित मध्य"। यह कहना कठिन था कि यह आक्रामक हो रहा था या तटस्थ, क्योंकि यह लड़ते रहने के बावजूद सहयोग करता रहा।

निचोड़ (The Bottom Line)

पेपर यह निष्कर्ष निकालता है कि AI एजेंट बड़े होने के साथ स्वाभाविक रूप से निर्दयी नहीं हो रहे हैं। उनमें सहयोग की ओर एक मजबूत झुकाव है। हालांकि, किसने उन्हें प्रशिक्षित किया (कंपनी), यह इस बात से अधिक महत्वपूर्ण है कि वे कितने नए हैं।

साथ ही, एक चेतावनी: यदि आप इन AI को "अधिक गहराई से सोचने" और अपनी रणनीतियों को सुधारने के लिए कहते हैं, तो आप अनजाने में उन्हें एक-दूसरे से बेहतर तरीके से लड़ने के लिए सिखा सकते हैं। और यदि वातावरण अव्यवस्थित (noisy) है, तो बेहतरीन AI भी आक्रामक होने की प्रवृत्ति रखते हैं।

लेखक ने सारा कोड और डेटा जारी कर दिया है ताकि कोई भी भविष्य के AI मॉडल्स पर इन समान "डिजिटल विकास" परीक्षणों को चला सके और देख सके कि क्या यह पैटर्न कायम रहता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →