The Sample Complexity of Policy Learning with Mu-Resets
Este artigo resolve o papel da realizabilidade de política na complexidade de amostra do aprendizado de política sob o protocolo de -resets ao demonstrar que a dependência em relação ao horizonte é exponencialmente grande () sob concentrabilidade de todas as políticas limitada, mas significativamente reduzida para sob concentrabilidade de pushforward limitada.
Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo
Afogado em artigos na sua área?
Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.