The challenge of hidden gifts in multi-agent reinforcement learning
यह शोध पत्र मल्टी-एजेंट सुदृढीकरण शिक्षण (multi-agent reinforcement learning) में "छिपे हुए उपहारों" (hidden gifts) की चुनौती की जांच करता है, यह प्रदर्शित करते हुए कि मानक एल्गोरिदम तब सामूहिक पुरस्कार प्राप्त करने में विफल रहते हैं जब लाभकारी क्रियाएं अदृश्य होती हैं, लेकिन क्रिया इतिहास और विकेंद्रीकृत एक्टर-क्रिटिक एजेंटों में एक नवीन विचरण-न्यूनीकरण सुधार पद (variance-reducing correction term) को शामिल करके प्रदर्शन में महत्वपूर्ण सुधार किया जा सकता है।