💻 computer science
ACPO: Agent-Chained Policy Optimization for Multi-Agent Reinforcement Learning
यह शोध पत्र एजेंट-चेन्ड पॉलिसी ऑप्टिमाइज़ेशन (ACPO) को प्रस्तुत करता है, जो एक मल्टी-एजेंट रीइन्फोर्समेंट लर्निंग पद्धति है जो समवर्ती निर्णयों को विश्वासों (beliefs) पर आधारित एजेंट क्रियाओं की एक क्रमिक श्रृंखला के रूप में मॉडल करके संयुक्त नीति ग्रेडिएंट (joint policy gradient) के सटीक विकेंद्रीकृत अपघटन (exact decentralized decomposition) को प्राप्त करती है, जिससे स्वतंत्र एक्टर प्रशिक्षण सक्षम होता है जो सामूहिक रूप से संयुक्त सुधार की गारंटी देता है और मौजूदा बेसलाइनों से बेहतर प्रदर्शन करता है, विशेष रूप से बड़े पैमाने के सहकारी कार्यों में।
Daiki E. Matsunaga, Junho Na, Tri Wahyu Guntara, Scott Sanner, Pascal Poupart, Jongmin Lee, Kee-Eung Kim2026-06-30