On the Convergence Rates of Federated Q-Learning across Heterogeneous Environments
यह शोधपत्र विषम वातावरणों (heterogeneous environments) में सिंक्रोनस फेडरेटेड Q-लर्निंग की जांच करता है, जो यह प्रकट करता है कि जबकि एजेंटों की संख्या () बढ़ाने से रैखिक गति-वृद्धि (linear speed-up) प्राप्त होती है, कई स्थानीय पुनरावृत्तियों () को निष्पादित करना अभिसरण (convergence) को मौलिक रूप से की दर तक कम कर देता है और एक दो-चरणीय त्रुटि गतिकी (two-phase error dynamic) उत्पन्न करता है जिसे चरण-निर्भर स्टेपसाइज़ चयन के माध्यम से अनुकूलित किया जा सकता है।