← नवीनतम पेपर
💻 computer science

Constitutional Arms Races in the Public Goods Game: Co-Evolving LLM Constitutions Under Cooperation-Defection Pressure

यह शोध पत्र प्रदर्शित करता है कि एक पब्लिक गुड्स गेम में सहकारी और फ्री-राइडिंग एलएलएम (LLM) एजेंटों के बीच प्राकृतिक-भाषा संविधानों का प्रतिकूल सह-विकास (adversarial co-evolution) व्यवहार्य है और व्याख्या योग्य रेड-टीम आर्टिफैक्ट्स उत्पन्न करता है, लेकिन यह केवल युग्मित फिटनेस फंक्शन और मोड रिग्रेशन को रोकने के लिए पर्याप्त मूल्यांकन बजट का उपयोग करने पर ही संभव है।

मूल लेखक: Ujwal Kumar, Arth Singh, Hershraj Niranjani, Machiko Hirota, Takehiro Takayanagi, Alice Saito, Eiji Kamioka, Phan Xuan Tan

प्रकाशित 2026-05-27
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Ujwal Kumar, Arth Singh, Hershraj Niranjani, Machiko Hirota, Takehiro Takayanagi, Alice Saito, Eiji Kamioka, Phan Xuan Tan

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि एक विशाल, डिजिटल खेल का मैदान है जहाँ दो टीमों के AI एजेंट लगातार एक-दूसरे को मात देने की कोशिश कर रहे हैं। एक टीम, ब्लू टीम (Blue Team), मददगार और सहयोगी होने की कोशिश कर रही है। दूसरी टीम, रेड टीम (Red Team), एक "फ्री-राइडर" (free-rider) बनने की कोशिश कर रही है—यानी ऐसा व्यक्ति जो समूह का फायदा तो उठाता है लेकिन योगदान नहीं देता।

यह शोध पत्र एक रियलिटी शो की तरह है जहाँ ये दोनों टीमें 30 राउंड की एक "हथियारों की दौड़" (arms race) में बंद हैं। लेकिन यहाँ हथियार बड़े बनाने के बजाय, वे हर एक राउंड में अपने स्वयं के नियमों की किताबें (जिन्हें "संविधान" कहा जाता है) फिर से लिख रहे हैं ताकि देख सकें कि कौन जीतता है।

शोधकर्ताओं ने क्या खोजा, इसे सरल उपमाओं के माध्यम से यहाँ समझाया गया है:

1. "साझा कोष" का खेल (पब्लिक गुड्स गेम)

सबसे पहले, शोधकर्ताओं ने टीमों को एक ऐसे खेल में रखा जहाँ हर कोई एक साझा कोष (shared pot) में पैसा डालता है। उस कोष को कई गुना बढ़ाया जाता है, और फिर सबको समान हिस्सा मिलता है।

  • सेटअप: ब्लू टीम के पास एक ऐसी नियम पुस्तिका है जो कहती है, "उदार बनो और धोखेबाजों को दंडित करो।" रेड टीम के पास एक ऐसी नियम पुस्तिका है जो कहती है, "सब कुछ ले लो और कुछ भी मत दो।"
  • दौड़: जैसे-जैसे वे 30 राउंड खेलते हैं, वे अपनी नियम पुस्तिकाओं को फिर से लिखते रहते हैं।
    • ब्लू टीम यह सीखती है कि यदि वे बहुत अधिक उदार होते हैं, तो रेड टीम सब कुछ चुरा लेती है। इसलिए, वे अधिक सख्त होना सीखते हैं।
    • रेड टीम यह सीखती है कि यदि वे बहुत अधिक धोखाधड़ी करते हैं, तो ब्लू टीम उन्हें इतनी बेरहमी से दंडित करती है कि वे हार जाते हैं। इसलिए, वे बस इतना ही धोखा देना सीखते हैं जिससे वे जीवित रह सकें लेकिन पकड़े न जाएं।
  • परिणाम: अंत तक, दोनों टीमें एक पूर्ण गतिरोध (perfect stalemate) पर पहुँच जाती हैं। दोनों टीमों का स्कोर लगभग समान (1 में से लगभग 0.78) हो जाता है। यह उन दो मुक्केबाजों की तरह है जिन्होंने इतनी देर तक लड़ाई लड़ी है कि उन्होंने एक-दूसरे की चालें पूरी तरह सीख ली हैं; न तो कोई जीत सकता है, न ही कोई हार सकता है। यह तब भी हुआ जब तक "कोष" को कितना भी गुना बढ़ाया गया हो।

2. "अलग स्कोरबोर्ड" की समस्या (ग्रिड वर्ल्ड)

इसके बाद, उन्होंने टीमों को एक अलग खेल में स्थानांतरित किया: एक ग्रिड वर्ल्ड जहाँ वे आश्रय बनाते हैं और संसाधन इकट्ठा करते हैं।

  • गलती: शुरुआत में, शोधकर्ताओं ने प्रत्येक टीम को अपना अलग स्कोरबोर्ड दिया। ब्लू टीम अपने स्वयं के स्कोर को अधिकतम करने की कोशिश कर रही थी, और रेड टीम अपने स्वयं के स्कोर को अधिकतम करने की कोशिश कर रही थी।
  • गड़बड़ी: क्योंकि वे सीधे एक-दूसरे के खिलाफ नहीं लड़ रहे थे, रेड टीम ने ब्लू टीम को नुकसान पहुँचाने की कोशिश नहीं की। इसके बजाय, रेड टीम बस अपना खुद का आश्रय बनाने में बहुत कुशल हो गई। वे दुश्मन बनने के बजाय दो अलग, सुखी टीमें बन गए। "हथियारों की दौड़" कभी शुरू ही नहीं हुई।
  • समाधान: शोधकर्ताओं ने नियमों को बदल दिया। अब, एक टीम का स्कोर केवल यह नहीं था कि "मैंने कितना अच्छा किया?" बल्कि यह था कि "मैंने अपने प्रतिद्वंद्वी से कितना बेहतर किया?"
  • परिणाम: जैसे ही उन्होंने इस "सापेक्ष स्कोर" (relative score) प्रणाली को अपनाया, असली लड़ाई शुरू हो गई। रेड टीम सक्रिय रूप से ब्लू टीम को नुकसान पहुँचाने लगी, और ब्लू टीम को जीवित रहने के लिए अनुकूलित होना पड़ा।

3. सिस्टम में "शोर" (सीड काउंट)

शोधकर्ताओं ने इन नई नियम पुस्तिकाओं को लिखने के लिए एक विशेष AI टूल का उपयोग किया। उन्होंने एक अजीब सा दोष पाया:

  • समस्या: यदि वे यह देखने के लिए कि नियम पुस्तिकाएं अच्छी हैं या नहीं, केवल 2 उदाहरणों (जिन्हें "सीड्स" कहा जाता है) पर परीक्षण करते हैं, तो AI "शोर" (रैंडम किस्मत) के कारण भ्रमित हो जाता है और समय के साथ बदतर और बदतर नियम पुस्तिकाएं लिखने लगता है। यह एक शेफ की तरह है जो केवल दो बार व्यंजन चखता है और एक बुरे दिन के कारण पूरे रेसिपी को खराब करने का निर्णय ले लेता है।
  • समाधान: जब उन्होंने परीक्षण नमूनों को बढ़ाकर 5 उदाहरण कर दिया, तो AI ने गलतियाँ करना बंद कर दिया। वह स्पष्ट रूप से देख सका कि कौन सी नियम पुस्तिका वास्तव में बेहतर थी और रेड टीम की हमला करने की क्षमता में सुधार करता रहा।
  • सबक: एक स्मार्ट "हमलावर" AI को प्रशिक्षित करने के लिए, आपको उसके परिणामों को केवल किस्मत पर आधारित होने से बचाने के लिए उसे कई बार टेस्ट करना चाहिए।

4. "जासूस" का लाभ

एक प्रयोग में, शोधकर्ताओं ने रेड टीम को एक महाशक्ति दी: वे देख सकते थे कि ब्लू टीम क्या कर रही है, लेकिन ब्लू टीम केवल अपनी चालों को ही देख सकती थी।

  • परिणाम: रेड टीम ने ब्लू टीम को कुचल दिया। यह शतरंज खेलने जैसा है जहाँ एक खिलाड़ी दूसरे के कार्ड देख सकता है। ब्लू टीम गलतियाँ करती रही क्योंकि वह रेड टीम की चालों का अनुमान नहीं लगा सकी।

5. यह क्यों महत्वपूर्ण है ("रेड-टीम" आर्टिफैक्ट्स)

सबसे महत्वपूर्ण बात यह नहीं है कि रेड टीम जीती। बल्कि, रेड टीम द्वारा बनाई गई नियम पुस्तिकाएं उपयोगी उपकरण हैं।

  • इन विकसित नियम पुस्तिकाओं को "रेड टीम आर्टिफैक्ट्स" (Red Team Artifacts) के रूप में सोचें। ये स्पष्ट, लिखित नियमों की सूचियाँ हैं (जैसे "यदि आप कोई संसाधन देखते हैं, तो उसे तुरंत चुरा लें") जो दिखाती हैं कि कैसे एक AI सहकारी प्रणाली को तोड़ने की कोशिश कर सकता है।
  • भविष्य के डेवलपर्स इन विशिष्ट नियम पुस्तिकाओं का उपयोग अपने स्वयं के नए AI सिस्टम का परीक्षण करने के लिए कर सकते हैं। यदि कोई नया AI इन "रेड टीम" नियम पुस्तिकाओं के हमले से बच सकता है, तो हम जानते हैं कि वह वास्तव में सुरक्षित है।

सारांश

यह शोध पत्र दिखाता है कि:

  1. सहयोग और संघर्ष के बीच संतुलन बनाया जा सकता है यदि खेल उन्हें एक साझा संसाधन साझा करने के लिए मजबूर करता है।
  2. आपको खेल को सावधानीपूर्वक डिजाइन करना होगा। यदि आप टीमों के स्कोर को एक-दूसरे पर निर्भर नहीं बनाते हैं, तो वे वास्तव में लड़ेंगे नहीं।
  3. परीक्षण करना महत्वपूर्ण है। रैंडम किस्मत के कारण होने वाले भ्रम से बचने के लिए आपको AI रणनीतियों का कई बार परीक्षण करने की आवश्यकता होती है।
  4. "बुरे लोग" हमें बेहतर "अच्छे लोगों" को बनाने का तरीका सिखाते हैं। हमलावरों की नियम पुस्तिकाओं को विकसित करके, हमें हमला करने के तरीकों की एक स्पष्ट, पठनीय सूची मिलती है, जो हमें मजबूत रक्षा बनाने में मदद करती है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →