The Sample Complexity of Policy Learning with Mu-Resets
Cet article résout le rôle de la réalisabilité de la politique dans la complexité d'échantillonnage de l'apprentissage de politique sous le protocole -resets en démontrant que la dépendance vis-à-vis de l'horizon est exponentiellement grande () sous une concentration de toutes les politiques bornée, mais considérablement réduite à sous une concentration de poussée bornée.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.