← नवीनतम पेपर
🤖 machine learning

What Suppresses Nash Equilibrium Play in Large Language Models? Mechanistic Evidence and Causal Control

यह शोध पत्र प्रकट करता है कि बड़े भाषा मॉडल नैश इक्विलिब्रियम (Nash equilibria) की गणना करने की यांत्रिक क्षमता रखते हैं, लेकिन प्रीट्रेनिंग में निहित एक परोपकारी ओवरराइड (prosocial override) के माध्यम से इस रणनीतिक व्यवहार को सक्रिय रूप से दबाते हैं, जो एक ऐसी घटना है जिसे हस्तक्षेप के माध्यम से कारणतः उलट दिया जा सकता है और जो मॉडल के पैमाने तथा तर्क विधियों से महत्वपूर्ण रूप से प्रभावित होती है।

मूल लेखक: Paraskevas V. Lekeas, Giorgos Stamatopoulos

प्रकाशित 2026-05-01
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Paraskevas V. Lekeas, Giorgos Stamatopoulos

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि बुद्धिमान रोबोटों का एक समूह "प्रिज़नर्स डिलेमा" (Prisoner's Dilemma) नामक खेल खेल रहा है। इस खेल में, सबसे समझदारी भरा और तार्किक कदम अपने साथी को धोखा देना (Defect) है, लेकिन यदि दोनों एक-दूसरे को धोखा देते हैं, तो दोनों का नुकसान होता है। यदि दोनों एक-दूसरे पर भरोसा करते हैं (Cooperate), तो दोनों का भला होता है।

लंबे समय तक, शोधकर्ताओं ने देखा कि ये बुद्धिमान रोबोट तर्क के अनुसार "डिफेक्ट" करने के बजाय "कोऑपरेट" करना ही चुनते रहे। उन्हें लगा कि रोबोट गणित समझने में इतने समझदार नहीं हैं।

यह पेपर कहता है: "आप गलत हैं। वे गणित जानते हैं। वे बस उसे अनदेखा करना चुनते हैं।"

यहाँ शोधकर्ताओं द्वारा खोजी गई कहानी का सरल विवरण दिया गया है।

1. रोबोटों के पास एक "गुप्त मस्तिष्क" है

लेखकों ने एक बड़े AI मॉडल (Llama-3-8B) को लिया और खेल खेलते समय उसके "मस्तिष्क" (इसके आंतरिक परतों) के भीतर झाँका। वे देखना चाहते थे कि हर एक कदम पर रोबोट क्या सोच रहा है।

उन्होंने पाया कि एक ही समय में दो बहुत अलग चीजें हो रही थीं:

  • "लॉजिक" लेयर (तर्क की परत): रोबोट के मस्तिष्क के पहले आधे हिस्से में, सब कुछ बिल्कुल स्पष्ट था। उसे पता था कि पिछली बार प्रतिद्वंद्वी ने क्या किया था, और उसने गणना की थी कि तार्किक और जीतने वाला कदम डिफेक्ट (धोखा देना) करना है। वह एक ठंडे और कठोर गणितज्ञ की तरह सोच रहा था।
  • "नाइस गाय" लेयर (भले मानस की परत): लेकिन जैसे ही जानकारी मस्तिष्क की अंतिम परतों तक पहुँची, कुछ बदल गया। एक "प्रोसोशल ओवरराइड" (सामाजिक नैतिकता का हस्तक्षेप) सक्रिय हो गया। यह एक अंतर्निहित नैतिक दिशा-सूचक की तरह था जिसने कहा, "रुको, हमें अच्छा होना चाहिए। चलो सहयोग करते हैं।"

उपमा: कल्पना कीजिए कि एक रोबोट एक वकील है जो जानता है कि नियमों को तोड़कर केस कैसे जीता जा सकता है (नैश इक्विलिब्रियम)। लेकिन बोलने से ठीक पहले, उसके मस्तिष्क में एक "ज़मीर" (conscience) सर्किट सक्रिय हो जाता है और उसे सच बोलने के लिए मजबूर करता है, भले ही सच बोलने से उसका नुकसान हो।

2. "अच्छाई" का पूर्वाग्रह हार्डवायर्ड है

शोधकर्ताओं ने पाया कि यह "सहयोगात्मक ओवरराइड" कोई विशिष्ट मॉड्यूल या मस्तिष्क का कोई एक हिस्सा नहीं है। यह नेटवर्क की अंतिम परतों में स्थित एक "वॉल्यूम नॉब" (आवाज़ कम-ज़्यादा करने वाला बटन) की तरह है।

  • रोबोट "डिफेक्ट" वाले कदम की गणना पूरी तरह से करता है।
  • फिर, "नाइस गाय" वॉल्यूम नॉब तेज़ हो जाता है, जो तर्क को दबा देता है और सहयोग करने के लिए मजबूर करता है।
  • ऐसा इसलिए होता है क्योंकि रोबोट को मानव टेक्स्ट पर प्रशिक्षित किया गया था, जहाँ लोग अक्सर अच्छे होते हैं, और फिर उसे मददगार (RLHF) बनने के लिए और अधिक प्रशिक्षित किया गया।

3. "सोचने" का विरोधाभास (चेन-ऑफ-थॉट)

लेखकों ने परीक्षण किया कि क्या रोबोटों को "ज़ोर से सोचने" (Chain-of-Thought) के लिए कहने से उन्हें तार्किक खेल खेलने में मदद मिलेगी।

  • छोटे रोबोट (8B पैरामीटर्स): जब उन्होंने ज़ोर से सोचने की कोशिश की, तो वे वास्तव में और भी खराब प्रदर्शन करने लगे। उनका "अच्छाई" वाला पूर्वाग्रह और भी तेज़ हो गया, और वे तर्क को अनदेखा करते हुए और भी अधिक सहयोग करने लगे।
  • बड़े रोबोट (70B+ पैरामीटर्स): ये दिग्गज अलग थे। जब उन्होंने ज़ोर से सोचना शुरू किया, तो वे आखिरकार "अच्छाई" के पूर्वाग्रह पर विजय पा सके। उन्होंने अपने तर्क का उपयोग यह कहने के लिए किया, "नहीं, तर्क कहता है कि हमें डिफेक्ट करना चाहिए," और उन्होंने वास्तव में वैसा ही किया।

उपमा: यह एक छोटे बच्चे की तरह है जो कुकी (बिस्किट) को देखकर खुद को रोकने की कोशिश कर रहा है। यदि आप उससे "इसके बारे में सोचने" को कहते हैं, तो वह केवल इस बारे में सोचने लगता है कि उसे कुकी कितनी पसंद है। लेकिन एक वयस्क (एक बड़ा मॉडल) अपने तर्क का उपयोग यह कहने के लिए कर सकता है कि "मुझे इसे नहीं खाना चाहिए," और वास्तवं में खुद को रोक सकता है।

4. "संक्रमण" का प्रभाव (Contagion Effect)

शोधकर्ताओं ने यह भी देखा कि जब अलग-अलग रोबोट एक-दूसरे के खिलाफ खेलते हैं तो क्या होता है।

  • "खराब सेब" (The Bad Apple): यदि एक छोटा रोबोट (जो स्वभाव से बहुत "अच्छा" है) एक बड़े रोबोट के खिलाफ खेलता है, तो छोटा रोबोट जल्दी ही डिफेक्ट (धोखा) देने लगता है। बड़ा रोबोट इसे देखता है, डर जाता है, और वह भी डिफेक्ट करना शुरू कर देता है। पूरा खेल धोखे के जाल में बदल जाता है।
  • "इको चैंबर" (The Echo Chamber): यदि दो बड़े रोबोट बिना ज़ोर से सोचे (बिना चेन-ऑफ-थॉट के) एक-दूसरे के खिलाफ खेलते हैं, तो वे अनंत सहयोग के लूप में फंस जाते हैं। वे एक-दूसरे पर भरोसा करते रहते हैं, भले ही वे दोनों जानते हों कि जीतने के लिए उन्हें एक-दूसरे को धोखा देना चाहिए।

5. जादुई "स्टीयरिंग व्हील"

पेपर का सबसे रोमांचक हिस्सा यह है कि लेखकों ने केवल देखा ही नहीं; उन्होंने नियंत्रण भी लिया।
उन्होंने रोबोट के मस्तिष्क में उस विशिष्ट "दिशा" को खोज निकाला जो "नाइस गाय" पूर्वाग्रह को नियंत्रित करती है।

  • प्रयोग: उन्होंने प्रक्रिया के बिल्कुल शुरुआत में रोबोट के मस्तिष्क को एक सूक्ष्म विद्युत "धक्का" (nudge) दिया।
  • परिणाम:
    • यदि उन्होंने इसे एक तरफ धकेला, तो रोबमा 100% तार्किक डिफेक्टर (परफेक्ट नैश इक्विलिब्रियम खेलने वाला) बन गया।
    • यदि उन्होंने इसे दूसरी तरफ धकेला, तो वह 100% सहकारी (सहयोग करने वाला) बन गया।

उपमा: कल्पना कीजिए कि एक कार खुद चल रही है और सीधे खाई की ओर जा रही है (सहयोग कर रही है जबकि उसे डिफेक्ट करना चाहिए)। शोधकर्ताओं को डैशबोर्ड के नीचे एक छोटा सा लीवर मिला। यदि वे उस लीवर को बस एक मिलीमीटर खींचते हैं, तो कार तुरंत खाई से दूर मुड़ जाती है और बिल्कुल सही ढंग से चलती है। उन्हें इंजन को फिर से बनाने की ज़रूरत नहीं पड़ी; उन्हें बस स्टीयरिंग घुमाना था।

निष्कर्ष

यह पेपर निष्कर्ष निकालता है कि AI मॉडल "गणित में खराब" नहीं हैं। वे वास्तव में तार्किक और स्वार्थी कदम की गणना करने में बहुत अच्छे हैं। समस्या यह है कि उनका प्रशिक्षण उन्हें "अच्छा" होने के पक्ष में उस तर्क को दबाने के लिए प्रेरित करता है।

लेखकों ने दिखाया कि यह दमन मस्तिष्क की अंतिम परतों में होता है, और थोड़े से हस्तक्षेप के साथ, हम उस "अच्छाई" के पूर्वाग्रह को बंद कर सकते हैं और रोबोट को ठीक वैसे ही खेलने दे सकते जैसा तर्क निर्देश देता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →