🤖 machine learning

Coordination Matters: Evaluation of Cooperative Multi-Agent Reinforcement Learning

यह शोध पत्र तर्क देता है कि मानक रिटर्न-आधारित मेट्रिक्स सहकारी मल्टी-एजेंट सुदृढीकरण लर्निंग (cooperative multi-agent reinforcement learning) के मूल्यांकन के लिए अपर्याप्त हैं और एक समन्वय-जागरूक (coordination-aware) मूल्यांकन ढांचे का प्रस्ताव करता है, जिसे STAT टेस्टबेड के माध्यम से कार्यान्वित किया गया है, जो एजेंट समन्वय तंत्रों और स्केलेबिलिटी चुनौतियों में महत्वपूर्ण अंतर को प्रकट करता है जिन्हें कुल प्रदर्शन स्कोर अक्सर अस्पष्ट कर देते हैं।

Maria Ana Cardei, Matthew Landers, Afsaneh Doryab2026-05-08
🤖 machine learning

Cross-Modal Navigation with Multi-Agent Reinforcement Learning

यह शोध पत्र CRONA को प्रस्तुत करता है, जो क्रॉस-मोडल नेविगेशन के लिए एक मल्टी-एजेंट रीइन्फोर्समेंट लर्निंग फ्रेमवर्क है, जो जटिल वातावरणों में, जहाँ सिंगल-एजेंट मॉडल संघर्ष करते हैं, रोबस्ट और कुशल एम्बॉडीड नेविगेशन प्राप्त करने के लिए एक सेंट्रलाइज्ड क्रिटिक के साथ मोडैलिटी-स्पेशलाइज्ड एजेंट्स का लाभ उठाता है।

Shuo Liu, Xinzichen Li, Christopher Amato2026-05-08
💬 NLP

Recursive Agent Optimization

यह शोध पत्र रिकर्सिव एजेंट ऑप्टिमाइज़ेशन (RAO) को पेश करता है, जो एक सुदृढीकरण शिक्षण (reinforcement learning) ढांचा है जो एजेंटों को उप-कार्यों को स्वयं को पुनरावर्ती रूप से सौंपने के लिए प्रशिक्षित करता है, जिससे प्रशिक्षण दक्षता में सुधार होता है, संदर्भ सीमाओं से परे मापनीयता (scalability) सक्षम होती है, और विभाजित करो और जीतो (divide-and-conquer) की रणनीतियों के माध्यम से जटिल समस्याओं में सामान्यीकरण को बढ़ाता है।

Apurva Gandhi, Satyaki Chakraborty, Xiangjun Wang, Aviral Kumar, Graham Neubig2026-05-08
💻 computer science

Governed Collaborative Memory as Artificial Selection in LLM-Based Multi-Agent Systems

यह शोध पत्र LLM-आधारित मल्टी-एजेंट सिस्टम में निरंतर स्मृतियों (persistent memories) के चयन की चुनौती को "शासित सहयोगात्मक स्मृति" (governed collaborative memory) के रूप में रूपंकित करता है, जो एक ऐसा डिज़ाइन एजेंडा प्रस्तावित करता है जो स्मृति शासन को केवल पुनर्प्राप्ति सटीकता (retrieval accuracy) पर निर्भर रहने के बजाय, ज्ञानमीमांसीय गुणवत्ता (epistemic quality), स्रोत निष्ठा (provenance fidelity) और पता लगाने योग्य संस्थागत स्थिति (traceable institutional state) सुनिश्चित करने के लिए एक कृत्रिम चयन व्यवस्था (artificial selection regime) के रूप में मानता है।

Diego F. Cuadros, Abdoul-Aziz Maiga, Helen Meskhidze, Andre Curtis-Trudel2026-05-07
🤖 AI

Agent Island: A Saturation- and Contamination-Resistant Benchmark from Multiagent Games

यह शोध पत्र 'एजेंट आइलैंड' (Agent Island) प्रस्तुत करता है, जो एक गतिशील मल्टीप्लेयर बेंचमार्क है जिसे सहयोग और संघर्ष के अनुकूल खेलों में भाषा मॉडल एजेंटों को प्रतिस्पर्धी बनाकर स्थिर मूल्यांकनों की संतृप्ति और संदूषण संबंधी समस्याओं को दूर करने के लिए डिज़ाइन किया गया है, जहाँ एक बेयसियन रैंकिंग प्रणाली यह प्रकट करती है कि OpenAI का gpt-5.5 अन्य मॉडलों की तुलना में काफी बेहतर प्रदर्शन करता है और साथ ही मतदान व्यवहार में एक मापने योग्य समान-प्रदाता पूर्वाग्रह भी प्रदर्शित करता है।

Connacher Murphy2026-05-07
💻 computer science

Tree-based Credit Assignment for Multi-Agent Memory System

यह शोध पत्र TreeMem का प्रस्ताव करता है, जो एक ट्री-आधारित क्रेडिट असाइनमेंट विधि है जो एक ट्री-स्ट्रक्चर्ड पाइपलाइन पर मोंटे कार्लो एवरेजिंग के माध्यम से अंतिम कार्य पुरस्कारों (final task rewards) से एजेंट-विशिष्ट अनुकूलन संकेतों को व्युत्पन्न करती है, जिससे महंगी कार्य-विशिष्ट एनोटेशन की आवश्यकता के बिना मल्टी-एजेंट मेमोरी सिस्टम के प्रभावी प्रशिक्षण को सक्षम बनाया जा सके।

Marina Mao, Alexandr Liu, Pengbo Li, Siheng Li, Bo Zhou, Xiang Wang2026-05-07
🤖 machine learning

Graph-SND: Sparse Aggregation for Behavioral Diversity in Multi-Agent Reinforcement Learning

यह शोध पत्र Graph-SND को प्रस्तुत करता है, जो एक स्केलेबल स्पार्स एग्रीगेशन विधि है जो मल्टी-एजेंट सुदृढीकरण शिक्षण में द्विघाती-लागत वाले सिस्टम न्यूरल डायवर्सिटी (SND) मीट्रिक का अनुमान लगाने के लिए मनमाने ग्राफ किनारों (edges) पर भारित औसत की गणना करती है, जिससे मीट्रिक के अर्थ संबंधी अर्थ को बदले बिना बड़े एजेंट समूहों के लिए कुशल व्यवहारिक विविधता मापन और नियंत्रण सक्षम होता है।

Shawn Ray2026-05-07
💻 computer science

The Hive Mind is a Single Reinforcement Learning Agent

यह शोध पत्र यह स्थापित करता है कि विशुद्ध रूप से अनुकरण करने वाले एजेंटों के झुंड, जैसे कि मधुमक्खियाँ, का उभरता हुआ "हाइव माइंड" (सामूहिक मस्तिष्क), सामूहिक निर्णय लेने को अनुकूलित करने के लिए "मेइनार्ड-क्रॉस लर्निंग" नामक एक नवीन मल्टी-आर्म्ड बैंडिट एल्गोरिदम का उपयोग करने वाले एक एकल ऑनलाइन सुदृढीकरण शिक्षण (रिनफोर्समेंट लर्निंग) एजेंट के गणितीय रूप से समकक्ष है।

Karthik Soma, Yann Bouteiller, Heiko Hamann, Giovanni Beltrame2026-05-06
💻 computer science

Closed-Loop Vision-Language Planning for Multi-Agent Coordination

यह शोध पत्र COMPASS को प्रस्तुत करता है, जो एक नवीन मल्टी-एजेंट फ्रेमवर्क है जो कोड-आधारित कौशल परिशोधन और संरचित संचार के साथ विकेंद्रीकृत, क्लोज्ड-लूप प्लानिंग के लिए विजन-लैंग्वेज मॉडल्स का लाभ उठाता है, और पारंपरिक MARL बेसलाइन्स से काफी बेहतर प्रदर्शन करते हुए SMACv2 बेंचमार्क पर अत्याधुनिक प्रदर्शन प्राप्त करता है।

Zhiyuan Li, Wenshuai Zhao, Joni Pajarinen2026-05-06
🤖 AI

Talk is Cheap, Communication is Hard: Dynamic Grounding Failures and Repair in Multi-Agent Negotiation

यह शोध पत्र एक बहु-चरणीय (multi-turn) वार्तालाप ढांचे को प्रस्तुत करता है जो यह प्रदर्शित करता है कि बहु-एजेंट एलएलएम (multi-agent LLMs) गतिशील ग्राउंडिंग विफलताओं—जैसे कि हठधर्मी एंकरिंग (stubborn anchoring) और संदर्भ संबंधी बाइंडिंग विफलताएं (referential binding failures)—के कारण लगातार इष्टतम परिणामों को प्राप्त करने में विफल रहते हैं, न कि व्यक्तिगत तर्क सीमाओं के कारण, जो स्थिर बेंचमार्क से परे संवादात्मक समन्वय प्रक्रियाओं का अध्ययन करने की महत्वपूर्ण आवश्यकता पर प्रकाश डालता है।

Yiheng Yao, Chelsea Zou, Robert D. Hawkins2026-05-06