← नवीनतम पेपर
🤖 AI

Symbolic Reasoning Frameworks Modulate LLM Risk Aversion in Multi-Agent Strategic Settings

यह अध्ययन प्रदर्शित करता है कि एक बहु-एजेंट रणनीतिक खेल के भीतर एक एकल एजेंट में रिफ्लेक्टिव प्रॉम्प्ट्स के रूप में प्रतीकात्मक तर्क ढांचों (symbolic reasoning frameworks) को इंजेक्ट करना, स्वाभाविक जोखिम-विमुख पूर्वाग्रहों (risk-aversion biases) को नियंत्रित करता है और विशिष्ट ढांचों की सामग्री का पालन करने के बजाय स्वयं रिफ्लेक्टिव प्रक्रिया के माध्यम से पारिस्थितिकी तंत्र-व्यापी विजेता वितरणों को नया आकार देता है।

मूल लेखक: Augustin Chan

प्रकाशित 2026-06-09
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Augustin Chan

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि शतरंज का एक उच्च-दांव वाला खेल चल रहा है, लेकिन इसमें दो खिलाड़ियों के बजाय सात खिलाड़ी हैं। प्रत्येक खिलाड़ी एक सुपर-स्मार्ट AI (एक लार्ज लैंग्वेज मॉडल) द्वारा नियंत्रित है। यह खेल, जिसे "वॉरिंग स्टेट्स" (Warring States) सिमुलेशन कहा जाता है, में AI क्षेत्र जीतने की कोशिश करते हैं।

आप जो पेपर पढ़ रहे हैं, वह एक विशिष्ट प्रयोग की रिपोर्ट है: क्या होगा यदि हम इन सात AI खिलाड़ियों में से केवल एक को सोचने में मदद करने के लिए एक विशेष "दार्शनिक मार्गदर्शक" (philosophical guide) दें, जबकि अन्य छह सामान्य रूप से खेलते रहें?

यहाँ शोधकर्ताओं ने जो पाया है, उसका विवरण सरल उपमाओं (analogies) का उपयोग करके दिया गया है।

1. "टर्टल" (कछुआ) समस्या

सबसे पहले, शोधकर्ताओं ने इन AI के बारे में कुछ अजीब देखा। बिना किसी विशेष निर्देश के, वे सभी स्वाभाविक रूप से जोखिम लेने से बचते (risk-averse) थे। वे "कछुओं" की तरह व्यवहार करते थे जो अपने खोल में सिमट जाते हैं। वे हमला करने या विस्तार करने के बजाय एक जगह टिके रहने और अपने क्षेत्र की रक्षा करने को प्राथमिकता देते थे। यह इन AI की "डिफ़ॉल्ट सेटिंग" है।

2. प्रयोग: एक AI को "क्रिस्टल बॉल" देना

शोधकर्ताओं ने एक विशिष्ट AI को चुना (मान लीजिए कि वह "हान" है) और उसे हर चाल से पहले परामर्श करने के लिए एक विशेष उपकरण दिया। उन्होंने यह देखने के लिए चार अलग-अलग "उपकरणों" (या फ्रेमवर्क) का परीक्षण किया कि वे खेल को कैसे बदलते हैं:

  • कंट्रोल ग्रुप (नियंत्रण समूह): हान को एक सामान्य, उबाऊ प्रॉम्प्ट मिला जैसे "अपनी रणनीति के बारे में सोचें।"
  • ई-चिंग (I-Ching/Yarrow): हान को एक यादृच्छिक प्राचीन चीनी हेक्साग्राम (एक प्रतीक, जिसका काव्यात्मक और अमूर्त अर्थ है) मिला और उसे इस बात की व्याख्या करनी थी कि युद्ध के लिए इसका क्या अर्थ है।
  • टैरो (Tarot): हान को तीन कार्डों का टैरो स्प्रेड मिला और उसे कार्डों के "वाइब" (vibe) की व्याख्या करनी थी।
  • स्कैम्बलड टेक्स्ट (बिखरा हुआ पाठ): हान को ई-चिंग का टेक्स्ट मिला, लेकिन शब्द उलझकर निरर्थक हो गए थे। यह एक गंभीर प्रॉम्प्ट जैसा दिखता था, लेकिन इसका अर्थ नष्ट हो चुका था।

3. बड़ा आश्चर्य: हान कभी नहीं जीतता, लेकिन दुनिया बदल जाती है

आप सोच सकते हैं कि हान को एक "जादुगत मार्गदर्शक" देने से उसे जीतने में मदद मिलेगी। ऐसा नहीं हुआ।

  • हान एक भी खेल नहीं जीता, चाहे उसने कोई भी मार्गदर्शक उपयोग किया हो।
  • अंत तक जीवित रहने की उसकी संभावना सभी समूहों में समान थी।

हालाँकि, हान ने जिस मार्गदर्शक का उपयोग किया, उसने दूसरे कौन जीते, इसे पूरी तरह से बदल दिया। यह ऐसा था जैसे हान एक तालाब में फेंका गया पत्थर था; पत्थर नहीं हिला, लेकिन उसकी लहरों ने बाकी सबके लिए पानी का आकार बदल दिया।

यहाँ "लहरों" ने विजेताओं को कैसे बदला:

  • उबाऊ मार्गदर्शक (कंट्रोल): खेल यान (Yan) के जीतने के साथ समाप्त हुआ। (यान स्वाभाविक रूप से रक्षा करने में अच्छा है)।
  • ई-चिंग मार्गदर्शक: खेल यान और चू (Chu) की संयुक्त विजय के साथ समाप्त हुआ, जबकि सबसे शक्तिशाली हमलावर, किन (Qin), पूरी तरह से बाहर हो गया (0 जीत)। ई-चिंग ने हान को इस तरह खेलने के लिए प्रेरित किया कि एक "सहयोगात्मक घर्षण" (cooperative friction) पैदा हुआ जिसने दबंग (किन) को कब्जा करने से रोक दिया।
  • टैरो मार्गदर्शक: खेल में किन का दबदबा रहा (50% बार जीतना)। टैरो ने हान को इतना अविश्वसनीय रूप से सतर्क और रक्षात्मक बना दिया कि उसने भाग लेना ही बंद कर दिया। इससे बोर्ड के बीच में एक "शून्य" (vacuum) बन गया, जिससे सबसे शक्तिशाली हमलावर (किन) आसानी से आकर जीत गया।
  • स्कैम्बलड (निरर्थक) मार्गदर्शक: खेल की (Qi) के जीतने के साथ समाप्त हुआ। भले ही टेक्स्ट बकवास था, लेकिन अर्थ खोजने की प्रक्रिया ने हान को एक जिद्दी, आत्मनिर्भर खेल खेलने पर मजबूर किया, जिसने अनजाने में एक दूर स्थित राज्य (की) के विस्तार में मदद की।

4. गुप्त तंत्र: यह सामग्री के बारे में नहीं, बल्कि प्रक्रिया के बारे में है

यह सबसे दिलचस्प हिस्सा है। शोधकर्ताओं ने पूछा: क्या हान ने वास्तव में सलाह मानी?

नहीं।

  • जब हान को "हमला करो" वाला हेक्साग्राम मिला, तो उसने अनिवार्य रूप से हमला नहीं किया।
  • जब उसे "पीछे हटो" वाला टैरो कार्ड मिला, तो उसने अनिवार्य रूप रूप से पीछे नहीं हटने दिया।
  • वास्तव में, हान ने अक्सर प्रतीकों के विशिष्ट अर्थ को अनदेखा कर दिया।

तो, परिणाम क्यों बदले?
शोधकर्ताओं का मानना है कि प्रतीकों की व्याख्या करने की क्रिया ही कुंजी थी।

  • ई-चिंग ने हान को अमूर्त रूपकों के बारे में गहराई से सोचने के लिए मजबूर किया। इस "व्याख्यात्मक व्यवधान" (interpretive disruption) ने उसकी डिफ़ॉल्ट "कछुआ" आदत को तोड़ दिया और उसे अधिक सहयोगात्मक बना दिया।
  • टैरो ने उसे "मुद्राओं" (postures) और "वाइब्स" को देखने के लिए मजबूर किया, जिसने अनजाने में उसके जोखिम लेने के डर को और मजबूत कर दिया, जिससे वह सामान्य से भी अधिक निष्क्रिय हो गया।
  • स्कैंबल्ड टेक्स्ट ने उसे निरर्थकता में अर्थ खोजने के लिए संघर्ष करने पर मजबूर किया। इसने उसे अपने खोल में वापस जाने और पूरी तरह से आत्म-संरक्षण पर ध्यान केंद्रित करने के लिए मजबूर किया।

निष्कर्ष (Takeaway)

AI पारिस्थितिकी तंत्र को एक व्यस्त राजमार्ग की तरह समझें।

  • सामान्य तौर पर, सभी कारें धीरे और सुरक्षित चलती हैं (कछुआ पूर्वाग्रह)।
  • यदि आप एक कार में दार्शनिक मार्गदर्शक रखते हैं, तो वह कार अनिवार्य रूप से तेज़ नहीं चलती या दौड़ नहीं जीतती।
  • लेकिन, उस एक कार के सोचने का तरीका सड़क के प्रति उसके व्यवहार को बदल देता है।
  • उस व्यवहार में बदलाव अन्य छह कारों को अलग तरह से प्रतिक्रिया देने के लिए मजबूर करता है।
  • अचानक, "दबंग" कार रुक जाती है, या "डरपोक" कार को खाली रास्ता मिल जाता है, या एक दूर की कार को एक खुला लेन मिल जाता है।

निष्कर्ष:
किसी विशिष्ट AI को एक विशेष "सोचने की शैली" (जैसे एक दार्शनिक ढांचा) देने से वह AI अनिवार्य रूप से स्मार्ट या अधिक सफल नहीं होता है। लेकिन यह उसके आसपास की पूरी प्रणाली को मौलिक रूप से नया रूप देता है, जिससे यह निर्धारित होता है कि समूह में कौन जीतता है और कौन हारता है। हान ने जिस "उपकरण" का उपयोग किया, उसने हान को ठीक नहीं किया; इसने उस दुनिया को बदल दिया जिसमें हान रहता था।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →