Near-Optimal Last-Iterate Convergence for Zero-Sum Games with Bandit Feedback and Opponent Actions
यह शोध पत्र यह प्रदर्शित करता है कि दो-खिलाड़ी शून्य-योग खेलों (two-player zero-sum games) में, जहाँ बैंडिट फीडबैक के साथ खिलाड़ी प्रतिद्वंद्वी की क्रियाओं को भी देखते हैं, एक कुशल एल्गोरिदम उच्च संभाव्यता के साथ निकट-इष्टतम लास्ट-इटरैट अभिसरण (last-iterate convergence) प्राप्त कर सकता है, जो उन पिछली सीमाओं को दूर करता है जिन्होंने केवल लॉस फीडबैक उपलब्ध होने पर अभिसरण को धीमी दरों तक सीमित कर दिया था।