← नवीनतम पेपर
🤖 AI

Benchmarking Open-Ended Multi-Agent Coordination in Language Agents

यह शोध पत्र *alem* को प्रस्तुत करता है, जो लंबी अवधि के उत्तरजीविता कार्यों (long-horizon survival tasks) में ओपन-एंडेड मल्टी-एजेंट समन्वय के मूल्यांकन के लिए एक JAX-आधारित बेंचमार्क है, जो यह प्रकट करता है कि जहाँ फ्रंटियर LLMs व्यक्तिगत कार्यों में उत्कृष्ट हैं, वहीं वे समन्वय के मामले में काफी संघर्ष करते हैं—जो एक विशिष्ट बाधा है जहाँ संचार महत्वपूर्ण सिद्ध होता है और मॉडलों के बीच प्रदर्शन व्यापक रूप से भिन्न होता है।

मूल लेखक: Kale-ab Abebe Tessera, Andras Szecsenyi, Cameron Barker, Alexander Rutherford, Davide Paglieri, Aidan Scannell, Henry Gouk, Elliot J. Crowley, Tim Rocktäschel, Amos Storkey

प्रकाशित 2026-06-09
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Kale-ab Abebe Tessera, Andras Szecsenyi, Cameron Barker, Alexander Rutherford, Davide Paglieri, Aidan Scannell, Henry Gouk, Elliot J. Crowley, Tim Rocktäschel, Amos Storkey

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि खोजकर्ताओं का एक समूह एक विशाल, निरंतर बदलते हुए जंगल में जीवित रहने की कोशिश कर रहा है। उन्हें लकड़ी काटने, पत्थर खोदने, आश्रय बनाने और राक्षसों से लड़ने की आवश्यकता है। लेकिन यहाँ एक पेंच है: वे यह सब अकेले नहीं कर सकते। कभी-कभी, उन्हें पेड़ को गिराने के लिए एक ही समय पर एक साथ लकड़ी काटनी पड़ती है। अन्य समय में, एक व्यक्ति को गड्ढा खोदना शुरू करना होगा, और दूसरे को कुछ ही सेकंड के भीतर उसे पूरा करना होगा, अन्यथा गड्ढा ढह जाएगा।

यह शोध पत्र एक नया "प्रशिक्षण मैदान" पेश करता है जिसे ALEM (जिसका अम्हारिका में अर्थ "दुनिया" है) कहा जाता है, ताकि यह परीक्षण किया जा सके कि AI एजेंट इस तरह के अराजक, दीर्घकालिक उत्तरजीविता खेल में कितनी अच्छी तरह मिलकर काम कर सकते हैं।

समस्या: सोलो स्टार्स बनाम टीम प्लेयर्स

अब तक, AI के अधिकांश परीक्षण एकल वीडियो गेम की तरह थे। वे पूछते थे, "क्या यह AI एक पहेली हल कर सकता है?" या "क्या यह एक भूलभुलिका (maze) में रास्ता खोज सकता है?" लेकिन वास्तविक दुनिया में, AI को टीमों में काम करने की आवश्यकता होगी। लेखकों ने देखा कि टीम वर्क के मौजूदा परीक्षण बहुत सरल थे: वे छोटे थे, नियम निश्चित थे, या टीम के सदस्यों को आपस में अधिक बात करने की आवश्यकता नहीं थी।

वे देखना चाहते थे कि क्या आधुनिक AI (लार्ज लैंग्वेज मॉडल्स, या LLMs) दीर्घकालिक समन्वय (long-term coordination) को संभाल सकते हैं। क्या वे 50 कदम पहले बनाई गई योजना को याद रख सकते हैं? क्या वे अपने साथी से यह कहने के लिए बात कर सकते हैं कि "मैं बाईं ओर जाऊंगा, तुम दाईं ओर जाओ"? क्या वे स्थिति बदलने पर खुद को ढाल सकते हैं?

समाधान: ALEM (सर्वाइवल सिम्युलेटर)

लेखकों ने Craftax नामक एक गेम पर आधारित एक डिजिटल दुनिया बनाई है, जिसे ALEM कहा जाता है। इसे Minecraft या Terraria के एक हाई-टेक संस्करण के रूप में समझें, लेकिन एक ट्विस्ट के साथ:

  • प्रोसीजरल जनरेशन (Procedural Generation): हर बार जब गेम शुरू होता है, तो मैप और विशिष्ट टीम वर्क चुनौतियाँ रैंडम तरीके से उत्पन्न होती हैं। यह AI को केवल "उत्तरों को रटने" से रोकता है।
  • "समन्वय स्पेक्ट्रम" (The Coordination Spectrum): गेम में एक डायल है जो नियंत्रित करता है कि टीम वर्क कितना कठिन है।
    • आसान: आप ज्यादातर अकेले काम कर सकते हैं।
    • मध्यम: आपको एक-दूसरे को औजार पास करने की आवश्यकता होती है (जैसे दीवार बनाने वाले व्यक्ति को हथौड़ा देना)।
    • कठिन: आपको एक सिंक्रोनाइज्ड स्विमिंग टीम की तरह पूर्ण तालमेल में कार्य करना होगा, अन्यथा कार्य विफल हो जाएगा।
  • सॉफ्ट स्पेशलाइजेशन (Soft Specialization): इस दुनिया में, कोई भी कोई भी काम कर सकता है, लेकिन यदि आप उस काम के लिए "विशेषज्ञ" नहीं हैं, तो आप विफल हो सकते हैं। यह टीम को यह तय करने के लिए मजबूर करता है कि मौके पर किसे क्या करना चाहिए।

प्रयोग: 13 AI एजेंट बनाम दुनिया

शोधकर्ताओं ने 13 अलग-अलग आधुनिक AI मॉडल्स को इस दुनिया में डाला। उन्होंने उन्हें सिखाया नहीं; वे बस उन्हें वहां छोड़ दिया (इसे "ज़ीरो-शॉट" कहा जाता है)। उन्होंने कुछ "रोबोट" एजेंटों को भी प्रशिक्षित किया (मानक सुदृढीकरण लर्निंग का उपयोग करके) ताकि वे एक बेंचमार्क के रूप में कार्य कर सकें।

परिणाम आश्चर्यजनक थे:

  1. AI संघर्ष कर रहा था: औसतन, AI एजेंटों ने संभावित स्कोर का केवल लगभग 6% प्राप्त किया। वे गेम को हल करने से बहुत दूर थे।
  2. अकेले स्मार्ट होने का मतलब टीम में स्मार्ट होना नहीं है: कुछ AI मॉडल एकल कार्यों (जैसे लकड़ी इकट्ठा करना) में बहुत अच्छे थे लेकिन समन्वय करने में बहुत खराब थे। एक मॉडल, GPT-5.4, बुनियादी कार्यों में बहुत अच्छा था लेकिन जब उसे साथियों के साथ तालमेल बिठाने की आवश्यकता थी, तो वह बुरी तरह विफल रहा। एक अन्य मॉडल, Gemini-3.1, टीम वर्क में बहुत बेहतर था, यहाँ तक कि उसने सबसे कठिन परिदृश्यों में प्रशिक्षित रोबोट एजेंटों को भी पीछे छोड़ दिया।
  3. आकार सब कुछ नहीं है: बड़े AI मॉडल (जिनमें अधिक "दिमागी शक्ति" होती है) जरूरी नहीं कि टीम के रूप में बेहतर काम करें। कभी-कभी एक छोटा मॉडल एक विशाल मॉडल की तुलना में बेहतर समन्वय करता है।

"क्यों": टीम वर्क को क्या कठिन बनाता है?

शोधकर्ताओं ने AI एजेंटों का विश्लेषण किया ताकि यह देखा जा सके कि विफलता का कारण क्या था। उन्होंने तीन मुख्य चीजें पाईं:

  • संचार ही सर्वोपरि है (Communication is King): जब उन्होंने एजेंटों की आपस में बात करने की क्षमता को बंद कर दिया, तो उनके टीम वर्क स्कोर गिर गए। AI एजेंट चैट का उपयोग यह कहने के लिए कर रहे थे, जैसे, "मैं पेड़ के पास जा रहा हूँ, तुम यहाँ रुको," या "मुझे लकड़ी दो।" इसके बिना, वे केवल अनुमान लगा रहे थे।
  • योजना के लिए स्मृति (Memory is for Planning): AI के पास एक "स्क्रैचपैड" (एक निजी नोटबुक) था। सर्वश्रेष्ठ प्रदर्शन करने वाले एजेंटों ने इस नोटबुक का उपयोग भविष्य की योजनाएं लिखने के लिए किया (जैसे, "चरण 1: पत्थर खोदें। चरण 2: भट्टी बनाएं")। कमजोर मॉडल्स ने नोटबुक का उपयोग केवल वर्तमान में जो देख रहे हैं उसे दोहराने के लिए किया, जिससे आगे की योजना बनाने में कोई मदद नहीं मिली।
  • तर्क (Reasoning) मदद करता है: जब AI को कार्य करने से पहले "सोचने" के लिए मजबूर किया गया, तो उसने एकल कार्यों और टीम वर्क दोनों में बेहतर प्रदर्शन किया।

"मिक्स्ड टीम" का आश्चर्य

शोधकर्ताओं ने एक ही टीम में विभिन्न AI मॉडल्स को मिलाने का भी प्रयास किया (उदाहरण के लिए, एक Gemini एजेंट के साथ GPT एजेंट का काम करना)। उन्हें उम्मीद थी कि टीम सबसे स्मार्ट सदस्य के समान प्रदर्शन करेगी। इसके बजाय, टीम का प्रदर्शन दोनों के औसत के बराबर रहा। यह पता चलता है कि एक सुपर-स्मार्ट साथी तब तक मदद नहीं करता जब तक दूसरा साथी योजना या संचार शैली को नहीं समझता।

निष्कर्ष

यह शोध पत्र दिखाता है कि समन्वय एक अनूठा कौशल है जिसे वर्तमान AI ने अभी तक नहीं सीखा है। सिर्फ इसलिए कि एक AI सवालों के जवाब देने या अकेले पहेलियाँ सुलझाने में अच्छा है, इसका मतलब यह नहीं है कि वह एक टीम में काम कर सकता है।

ALEM इस विशिष्ट "टीमवर्क बाधा" को मापने का एक नियंत्रित तरीका प्रदान करता है। यह दिखाता है कि वास्तविक दुनिया में मनुष्यों या अन्य AI के साथ काम करने के लिए AI बनाने हेतु, हमें केवल उन्हें एकल कार्यों में स्मार्ट बनाने के बजाय, उन्हें बातचीत करने, मिलकर योजना बनाने और एक-दूसरे पर भरोसा करने के बारे में सिखाने पर ध्यान केंद्रित करने की आवश्यकता है।

इस "सर्वाइवल सिम्युलेटर" का कोड अब अन्य शोधकर्ताओं के उपयोग और सुधार के लिए खुला है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →