← Derniers articles
🤖 machine learning

The Sample Complexity of Policy Learning with Mu-Resets

Cet article résout le rôle de la réalisabilité de la politique dans la complexité d'échantillonnage de l'apprentissage de politique sous le protocole μ\mu-resets en démontrant que la dépendance vis-à-vis de l'horizon HH est exponentiellement grande (exp(Ω(H))\exp(\Omega(H))) sous une concentration de toutes les politiques bornée, mais considérablement réduite à exp(Θ(H))\exp(\Theta(\sqrt H)) sous une concentration de poussée bornée.

Auteurs originaux : Gene Li

Publié 2026-08-11
📖 1 min de lecture☕ Lecture pause café

Auteurs originaux : Gene Li

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Pas encore d'explication disponible dans cette langue.

Essayez : AR, DE, EN, ES, FR, HI, IT, JA, KO, NL, PT, ZH

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →