The Sample Complexity of Policy Learning with Mu-Resets
Este artículo resuelve el papel de la realizabilidad de la política en la complejidad de muestra del aprendizaje de políticas bajo el protocolo de -reajustes al demostrar que la dependencia del horizonte es exponencialmente grande () bajo una concentrabilidad de todas las políticas acotada, pero se reduce significamente a bajo una concentrabilidad de pushforward acotada.
Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.