Decentralized Best-Response-Based Learning in Two-Player Zero-Sum Stochastic Games: A Finite-Sample Analysis
यह शोध पत्र दो-खिलाड़ी शून्य-योग (zero-sum) मैट्रिक्स और स्टोकेस्टिक खेलों के लिए विकेंद्रीकृत, पे-ऑफ-आधारित बेस्ट-रिस्पॉन्स लर्निंग एल्गोरिदम का एक परिमित-नमूना (finite-sample) विश्लेषण प्रस्तुत करता है, जो एक नवीन कपल्ड लयापुनोव-ड्रिफ्ट (coupled Lyapunov-drift) ढांचे के माध्यम से क्रमशः और के नमूना जटिलता (sample complexity) सीमाओं को स्थापित करता है जो परस्पर क्रिया करने वाले स्टोकेस्टिक इटरेट्स और गैर-स्थिर सैंपलिंग को संभालता है।