Improved Quantum Algorithms for Reinforcement Learning Under a Generative Model
Cet article propose de nouveaux algorithmes quantiques pour calculer des politiques optimales approximatives dans des processus de décision markoviens à horizon fini et à horizon infini avec remise, sous un modèle génératif, lesquels améliorent les complexités de requête précédentes en combinant l'itération de valeur avec l'estimation de la moyenne quantique et la recherche de maximum afin d'approcher les bornes inférieures quantiques établies.