Policy Optimization and Statistical Inference for Online Contextual Matrix Games
यह शोध पत्र गतिशील प्रासंगिक जानकारी को बहु-खिलाड़ी रणनीतिक अंतःक्रियाओं के साथ एकीकृत करने के लिए ऑनलाइन प्रासंगिक मैट्रिक्स गेम्स (online contextual matrix games) के ढांचे को प्रस्तुत करता है, जो OnGameLearn एल्गोरिदम का प्रस्ताव करता है जो उप-रैखिक पछतावा (sublinear regret) प्राप्त करता है और पे-ऑफ अनुमान, नैश इक्विलिब्रियम अभिसरण (Nash equilibrium convergence), और नीति मूल्य अनुमान (policy value inference) के लिए कठोर सांख्यिकीय गारंटी प्रदान करता है।