← नवीनतम पेपर
💬 NLP

High Volatility and Action Bias Distinguish LLMs from Humans in Group Coordination

यह शोध पत्र प्रकट करता है कि बड़े भाषा मॉडल मनुष्यों की तुलना में स्थिर समूह समन्वय प्राप्त करने में संघर्ष करते हैं, जो अत्यधिक क्रिया परिवर्तन और समृद्ध फीडबैक के प्रति सीमित प्रतिक्रियाशीलता प्रदर्शित करते हैं, जो अनुकूलनशील शिक्षण और अभिसरण रणनीतियों में मौलिक व्यवहार संबंधी अंतरों को रेखांकित करता है।

मूल लेखक: Sahaj Singh Maini, Robert L. Goldstone, Zoran Tiganj

प्रकाशित 2026-04-06
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Sahaj Singh Maini, Robert L. Goldstone, Zoran Tiganj

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक उच्च-दांव वाले अनुमान लगाने वाले खेल (guessing game) में भाग लेने वाली एक टीम का हिस्सा हैं। लक्ष्य सरल है: टीम के हर सदस्य को एक संख्या का अनुमान लगाना होगा, और जब आप उन सभी संख्याओं को जोड़ते हैं, तो कुल योग उस गुप्त "रहस्यमय संख्या" (mystery number) से मेल खाना चाहिए जिसे रेफरी ने चुना है।

यहाँ एक पेच है: आप आपस में बात नहीं कर सकते। आपको नहीं पता कि आपके साथी क्या अनुमान लगा रहे हैं। आपको हर राउंड के बाद केवल एक जानकारी मिलती है: "बहुत अधिक" (Too high), "बहुत कम" (Too low), या "बिल्कुल सही" (Just right), और कभी-कभी यह भी कि कितना अधिक या कम है।

यह वही खेल है जिसका उपयोग शोधकर्ताओं ने मनुष्यों के मुकाबले लार्ज लैंग्वेज मॉडल्स (LLMs) जैसे कि DeepSeek, Llama और Gemini जैसे AI मॉडल्स का परीक्षण करने के लिए किया था। वे देखना चाहते थे कि: क्या AI टीमें मानवीय टीमों की तरह समन्वय (coordinate) कर सकती हैं?

संक्षिप्त उत्तर है: नहीं। बिल्कुल भी नहीं।

यहाँ क्या हुआ, इसका विवरण कुछ रोजमर्रा के उदाहरणों के साथ दिया गया है।

1. मानव टीम: एक शांत ऑर्केस्ट्रा (The Calm Orchestra)

जब मनुष्यों ने यह खेल खेला, तो उन्होंने एक अनुभवी जैज़ बैंड की तरह काम किया।

  • उन्होंने सुना: यदि समूह का योग "बहुत अधिक" था, तो वे घबराकर अचानक 50 अंक नीचे नहीं गिरे। उन्होंने फीडबैक सुना और छोटे, गणनात्मक बदलाव किए।
  • उन्होंने भूमिकाएँ ढूँढ लीं: जैसे-जैसे खेल आगे बढ़ा, कुछ लोगों ने स्वाभाविक रूप से अपनी संख्या बदलना बंद कर दिया। वे "एंकर" (anchors) बन गए, जो स्थिर रहे जबकि अन्य लोग सुधार करने का भारी काम कर रहे थे। इससे शोर कम हुआ और समूह को लक्ष्य तक तेज़ी से पहुँचने में मदद मिली।
  • उन्होंने सीखा: यदि वे खेल को लगातार 10 बार खेलते, तो वे हर बार बेहतर होते गए। उन्होंने लय को समझ लिया।

2. AI टीम: एक अति-सक्रिय हैम्स्टर व्हील (The Hyperactive Hamster Wheel)

जब शोधकर्ताओं ने मनुष्यों की जगह AI मॉडल्स को रख दिया, तो माहौल पूरी तरह बदल गया। AI टीमें एक जैज़ बैंड की तरह नहीं, बल्कि एक कमरे में घूमते हुए बहुत तेज़ चक्कर काट रहे हैम्स्टर्स की तरह व्यवहार करने लगीं।

यहाँ तीन मुख्य तरीके दिए गए जिनसे AI टीमें समन्वय करने में विफल रहीं:

A. "एक्शन बायस" (The Hamster Effect - कार्य करने का पूर्वाग्रह)

मनुष्यों में एक स्वाभाविक प्रवृत्ति होती है कि यदि चीजें ठीक चल रही हैं, तो वे स्थिर रहते हैं। यदि समूह का योग लक्ष्य के करीब है, तो एक इंसान सोच सकता है, "मैं अपनी संख्या को समान रखूँगा और अपने साथियों को काम करने दूँगा।"

हालाँकि, AI में एक विशाल "एक्शन बायस" है। उसे लगता है कि उसे हर टर्न में कुछ न कुछ करना ही चाहिए। भले ही समूह लक्ष्य के बहुत करीब हो, AI अपनी संख्या बदलता रहता है।

  • उदाहरण: कल्पना कीजिए कि आप अपने हाथ पर एक झाड़ू को संतुलित करने की कोशिश कर रहे हैं। यदि आप छोटे, स्थिर आंदोलनों के साथ संतुलन बनाते हैं, तो आप जीत जाते हैं। यदि आप अपने हाथ को पागलों की तरह इधर-उधर झटकते रहते हैं क्योंकि आपको लगता है कि आपको "हिलना ही होगा", तो झाड़ू गिर जाएगी। AI ने हाथ को लगातार झटकते रहना जारी रखा।

B. "ओवररिएक्शन" (The Pendulum Swing - अत्यधिक प्रतिक्रिया)

जब AI को "आप 10 अंक बहुत अधिक हैं" जैसा फीडबैक मिला, तो उसने केवल 10 घटाया नहीं। उसने अक्सर 20 या 30 घटा दिया।

  • परिणाम: समूह का योग बेतहाशा झूलता रहा। एक राउंड में वे बहुत अधिक थे, अगले राउंड में बहुत कम, और अगले राउंड में फिर से बहुत अधिक। वे आगे-पीछे झूलने के अंतहीन चक्र में फंस गए, लक्ष्य तक कभी नहीं पहुँच पाए।
  • मानव बनाम AI: मनुष्य थोड़े सतर्क (कम प्रतिक्रिया देने वाले) होते हैं, जो वास्तव में समूह को स्थिर करने में मदद करता है। AI आक्रामक (अत्यधिक प्रतिक्रिया देने वाला) होता है, जो अराजकता पैदा करता है।

C. "भूलने की बीमारी" (The Amnesia - कोई सीखना नहीं)

यह सबसे आश्चर्यजनक हिस्सा था। मनुष्य जितना अधिक खेलते, उतने ही बेहतर होते जाते। उन्होंने सीखा, "ठीक है, जब समूह इतना बड़ा होता है, तो हमें अधिक सावधान रहने की आवश्यकता होती है।"
AI मॉडल्स? उन्होंने कुछ नहीं सीखा। 10 गेम लगातार खेलने के बाद भी, वे गेम 10 में भी उतना ही खराब प्रदर्शन कर रहे थे जितना गेम 1 में। उन्होंने हर नए गेम को ऐसे माना जैसे कि यह पहली बार हो जब उन्होंने नियम देखे हों। वे एक अनुभव से दूसरे अनुभव के बीच संबंध नहीं बना सके।

3. "समृद्ध फीडबैक" का आश्चर्य (The Richer Feedback Surprise)

शोधकर्ताओं ने AI को बेहतर जानकारी देने की कोशिश की। केवल "बहुत अधिक" कहने के बजाय, उन्होंने कहा, "25 से अधिक अधिक"।

  • मनुष्यों के लिए: यह एक मानचित्र (map) मिलने जैसा था। उन्होंने अतिरिक्त विवरण का उपयोग लक्ष्य पर ध्यान केंद्रित करने के लिए किया और खेल को बहुत तेज़ी से हल किया।
  • AI के लिए: यह किसी ऐसे व्यक्ति को मानचित्र देने जैसा था जिसे पढ़ना नहीं आता। अतिरिक्त नंबरों ने उनकी मदद नहीं की। वे अभी भी बेतहाशा झूलते रहे और विफल रहे।

बड़ी तस्वीर: यह क्यों मायने रखता है?

हम ऐसे सिस्टम बना रहे हैं जहाँ कई AI मिलकर जटिल समस्याओं को हल करते हैं (जैसे कोड लिखना, आपूर्ति श्रृंखला प्रबंधित करना, या सिमुलेशन चलाना)।

यह पेपर हमें चेतावनी देता है: सिर्फ इसलिए कि AI सवालों के जवाब देने में स्मार्ट है, इसका मतलब यह नहीं है कि वह एक टीम में काम करने में भी अच्छा है।

  • मनुष्य "समूह समन्वय" (group coordination) में माहिर होते हैं क्योंकि वे जानते हैं कि कब बोलना है और कब चुप रहना है। वे समूह के मिजाज के आधार पर अपने व्यवहार को अनुकूलित करते हैं।
  • वर्तमान AI एक बहुत ही उत्साही, बहुत शोर मचाने वाले इंटर्न की तरह है जो कभी बोलना बंद नहीं करता, हर गलती को बहुत ज़्यादा सुधारता है, और कल क्या हुआ था उसे भूल जाता है।

निष्कर्ष (The Takeaway)

यदि आप AI की ऐसी टीम बनाना चाहते हैं जो मानव टीम की तरह काम करे, तो आप केवल उन्हें प्लग इन करके उम्मीद नहीं कर सकते। आपको उन्हें संयम (restraint) सिखाना होगा। आपको उन्हें सिखाना होगा कि कभी-कभी, सबसे अच्छा कदम यह होता है कि कुछ न किया जाए और टीम को स्थिर होने दिया जाए। जब तक AI "रणनीतिक निष्क्रियता" (strategic inaction) की कला नहीं सीख लेता, तब तक उसे हमारे साथ या खुद के साथ समन्वय करने में संघर्ष करना पड़ेगा।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →