← नवीनतम पेपर
🤖 AI

Information Limits and Attractor Dynamics in Economies of Frontier LLM Agents: A Pre-Registered Test

यह पूर्व-पंजीकृत अध्ययन फ्रंटियर एलएलएम (LLM) अर्थव्यवस्थाओं में धन वृद्धि के लिए एक सूचना-सैद्धांतिक क्षमता नियम को मान्य करता है और जनसंख्या मिसअलाइनमेंट (population misalignment) के स्मूथ मीन-फील्ड मॉडलों का खंडन करते हुए यह प्रदर्शित करता है कि नियंत्रण लीवरों के प्रति एजेंटों की प्रतिक्रियाएं निरंतर प्रकीर्णन (continuous dispersion) के बजाय द्वि-स्थिर स्टेप-फंक्शन गतिकी (bistable step-function dynamics) प्रदर्शित करती हैं।

मूल लेखक: Cheng Qian

प्रकाशित 2026-07-08
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Cheng Qian

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक ऐसी दुनिया में हैं जहाँ आप एक उच्च-दांव वाले सट्टेबाजी के खेल में एक-दूसरे के खिलाफ खेलने के लिए अविश्वसनीय रूप से बुद्धिमान, लेकिन थोड़े अलग AI सहायकों की एक टीम को काम पर रखते हैं। आप दो चीजें जानना चाहते हैं:

  1. क्या अधिक जानना वास्तव में आपको समृद्ध बनाता है? ("सूचना का नियम")
  2. यदि आप नियमों या पुरस्कारों को बदलते हैं, तो क्या टीम के सदस्य धीरे-धीरे और सुचारू रूप से अपने व्यवहार को समायोजित करते हैं? ("सुचारू प्रतिक्रिया का नियम")

इस शोध पत्र के लेखक ने इन प्रश्नों का उत्तर देने के लिए अत्याधुनिक AI मॉडलों (विशेष रूप से क्लॉड ओपस) के साथ एक सख्त, पूर्व-नियोजित प्रयोग चलाया। इस प्रयोग की लागत लगभग $139 थी और इसे इस तरह से डिज़ाइन किया गया था कि कोई भी परिणामों को देखने के बाद धोखाधड़ी न कर सके या नियमों को बदल न सके।

यहाँ उन्होंने क्या पाया, जिसे सरल उपमाओं के माध्यम से समझाया गया है।

1. "सबसे स्मार्ट जुआरी" जीतता है (अच्छी खबर)

सेटअप: कल्पना कीजिए कि तीन सिक्कों के उछाल के परिणाम पर दांव लगाने वाले जुआरियों का एक समूह है। कुछ जुआरियों की दृष्टि एकदम स्पष्ट है (वे सिक्कों को स्पष्ट रूप से देखते हैं), कुछ की दृष्टि धुंधली है (वे सिक्कों को थोड़े स्टैटिक/शोर के साथ देखते हैं), और कुछ की दृष्टि बिल्कुल नहीं है। वे सभी एक साझा पूल में दांव लगाते हैं।

भविdtवाणी: पुराने गणितीय सिद्धांत कहते हैं कि यदि आप अपने प्रतिद्वंद्वी की तुलना में दुनिया के बारे में अधिक जानते हैं, तो आप अपनी संपत्ति को ठीक उसी मात्रा में तेजी से बढ़ाएंगे। यह एक सीधा अनुवाद है: अधिक ज्ञान = अधिक पैसा।

परिणाम: प्रयोग ने इस बात की पूरी तरह से पुष्टि की।

  • अनुवाद: जिन AI एजेंटों की "दृष्टि" बेहतर थी (अधिक जानकारी थी), उनकी संपत्ति तेजी से बढ़ी। गणित त्रुटि के एक बहुत ही मामूली मार्जिन (0.05% से कम) तक सटीक रहा।
  • टीमवर्क टेस्ट: शोधकर्ताओं ने यह भी परीक्षण किया कि क्या दो एजेंट मिलकर अपने ज्ञान को जोड़ सकते हैं।
    • यदि उनकी जानकारी केवल "अतिरेक" (redundant) थी (जैसे दो लोग एक ही सिक्के को देख रहे हों), तो उनका संयुक्त मूल्य उनके हिस्सों के योग से कम था।
    • यदि उनकी जानकारी "सहक्रियात्मक" (synergistic) थी (जैसे एक व्यक्ति पहेली का बायां हिस्सा देख रहा है और दूसरा दाएं हिस्से को, जहाँ अकेले में से कोई भी हिस्सा समझ में नहीं आता), तो उन्होंने अचानक एक बड़ी मूल्य वृद्धि अनलॉक कर दी। AI ने केवल आपस में बात करके उस पहेली को सुलझा लिया।
  • विजेता: एक लंबे समय तक चलने वाले बाजार में, सबसे स्पष्ट दृष्टि वाले एजेंट ने अंततः लगभग सारा पैसा सोख लिया, जिससे दूसरों के पास कुछ नहीं बचा। बाजार ने स्वाभाविक रूप से सबसे स्मार्ट खिलाड़ी का चयन किया।

सरल निष्कर्ष: एक प्रतिस्पर्धी बाजार में, आप जो जानते हैं वह सीधे तौर पर यह निर्धारित करता है कि आप क्या कमाते हैं। यदि आप सबसे अधिक सूचित हैं, तो आप पूल जीत जाएंगे।

2. "डिमर नहीं, स्विच" (चौंकाने वाली खबर)

सेटअप: अब, कल्पना कीजिए कि 20 AI एजेंटों का एक समूह एक "अच्छी जगह" खोजने की कोशिश कर रहा है।

  • एक पुरस्कार शिखर (Reward Peak) है (सोने से भरी एक पहाड़ी) जो उन्हें एक दिशा में खींचती है।
  • एक नियंत्रण लक्ष्य (Control Target) है (एक विशिष्ट स्थान जिसे शोधकर्ता चाहते हैं कि वे जाएँ) जो उन्हें दूसरी दिशा में खींचता है।
  • शोधकर्ता उम्मीद कर रहे थे कि यदि वे "नियंत्रण" के नॉब (knob) को थोड़ा सा घुमाते हैं, तो एजेंट धीरे-धीरे, सुचारू रूप से लक्ष्य की ओर बढ़ेंगे, जैसे कि एक डिमर स्विच धीरे-धीरे रोशनी को बढ़ाता है।

भविdtवाणी: मानक आर्थिक मॉडल मानते हैं कि आबादी एक गैस या तरल पदार्थ की तरह होती है: यदि आप उन्हें धीरे से धकेलते हैं, तो वे धीरे से चलते हैं। यदि आप ज़ोर से धकेलते हैं, तो वे अधिक चलते हैं।

परिणाम: एजेंटों ने सुचारू रूप से व्यवहार नहीं किया। उन्होंने एक लाइट स्विच की तरह काम किया।

  • "डिमर" विफल रहा: एजेंटों ने नॉब को कितना भी बदलने की कोशिश की, वे बीच में कभी नहीं रुके। या तो उन्होंने नियंत्रण को पूरी तरह से अनदेखा कर दिया और सोने की पहाड़ी की ओर भाग गए, या वे तुरंत नियंत्रण लक्ष्य की ओर झपट पड़े।
  • "स्विच" सफल रहा: सिस्टम चुंबकों के एक सेट की तरह व्यवहार करता है।
    • यदि "सोने की पहाड़ी" पर्याप्त मजबूत थी, तो हर कोई वहां कूद गया।
    • यदि "नियंत्रण लक्ष्य" पर्याप्त मजबूत था, तो वे तुरंत वहां खिंचे चले आए।
    • यदि दोनों बल समान थे, तो परिणाम एक कॉइन फ्लिप (सिक्का उछालना) बन गया: कभी पूरा समूह पहाड़ी की ओर जाता, तो कभी लक्ष्य की ओर, जो खेल की शुरुआत में होने वाले सूक्ष्म, यादृच्छिक शोर (random noise) पर निर्भर करता था।
  • "पतन" (The Collapse): शोधकर्ताओं ने एक "मध्य मार्ग" की तलाश की जहाँ एजेंट बिखरे हुए (dispersed) हों ताकि वे एक सुचारू प्रतिक्रिया को माप सकें। उन्हें ऐसे शून्य उदाहरण मिले। एजेंट हमेशा एक साथ मजबूती से सिमटे रहे।

सरल निष्कर्ष: आप इन AI आबादी को एक मध्य मार्ग में लाने के लिए "नज" (nudge) नहीं कर सकते। या तो आप नियमों को इतना नाटकीय रूप से बदल देते हैं कि वे एक नए व्यवहार में बदल जाते हैं, या आप कुछ नहीं करते। कोई "सुचारू समायोजन" नहीं होता है।

बड़ी तस्वीर

लेखक दो अलग-अलग सबक के साथ निष्कर्ष निकालते हैं:

  1. व्यक्तिगत एजेंट के लिए: यदि आप AI एजेंटों को एक बाजार में रखते हैं, तो गणित सुंदर और अनुमानित है। ज्ञान ही मुद्रा है। जो एजेंट सबसे अधिक जानता है, अंततः वही सबसे अधिक का स्वामी होगा।
  2. एजेंटों के समूह के लिए: यदि आप छोटे प्रोत्साहन के साथ AI एजेंटों की भीड़ को प्रबंधित करने की कोशिश करते हैं, तो आप अपना समय बर्बाद कर रहे हैं। वे "नज" (nudge) के प्रति प्रतिक्रिया नहीं देते हैं। वे डिस्क्रीट अट्रैक्टर्स (discrete attractors) हैं—वे कुछ विशिष्ट व्यवहारों में से एक में झपट पड़ते हैं। उन्हें बदलने के लिए, आपको स्विच को फ्लिप करना होगा, न कि डायल को घुमाना होगा।

लेखक इस बात पर जोर देते हैं कि ये परिणाम एक बहुत ही विशिष्ट, छोटे पैमाने के प्रयोग और एक प्रकार के AI मॉडल पर आधारित हैं। हालाँकि, उपयोग की गई विधि इतनी सख्त और पारदर्शी थी कि कोई भी इन निष्कर्षों को सत्यापित करने के लिए उपलब्ध डेटा का उपयोग करके मुफ्त में ठीक वही प्रयोग फिर से चला सकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →