Tackling Decision Processes with Non-Cumulative Objectives using Reinforcement Learning
Cet article introduit une mise en correspondance générale qui transforme les processus de décision markoviens non cumulatifs (NCMDP) en MDP standards, permettant l'application directe des techniques d'apprentissage par renforcement existantes pour optimiser des fonctions de récompense arbitraires et démontrant une amélioration des performances et de l'efficacité de l'entraînement à travers diverses tâches.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Dans le monde de l'intelligence artificielle, il existe un cadre puissant utilisé pour apprendre aux machines comment prendre des décisions. Imaginez un robot apprenant à marcher, un programme informatique maîtrisant un jeu vidéo ou un algorithme de trading gérant un portefeuille boursier. Ces systèmes fonctionnent en prenant une série d'actions, les unes après les autres, en réponse à leur environnement. À chaque mouvement, le système reçoit un signal, souvent appelé récompense, lui indiquant si cette action était bonne ou mauvaise. Pendant des décennies, la règle standard de réussite dans ces scénarios a été simple : maximiser la somme totale de toutes les récompenses collectées au fil du temps. Si un robot reçoit un petit point pour chaque pas en avant, l'objectif est d'obtenir autant de points que possible à la fin du voyage. Cette approche, connue sous le nom de processus de décision markovien, a été incroyablement fructueuse, guidant tout, des robots industriels aux voitures autonomes.
Cependant, la vie réelle est souvent plus complexe qu'une simple feuille de calcul. Parfois, le résultat le plus important n'est pas la quantité totale de bonnes choses qui se sont produites, mais plutôt le pire moment survenu, ou la constance de la performance au fil du temps. Considérez un vaisseau spatial atterrissant sur une planète. L'objectif n'est pas seulement d'atterrir en toute sécurité ; c'est de s'assurer que l'engin ne dépasse jamais une vitesse dangereuse pendant toute la descente, peu importe la fluidité du reste du vol. En finance, un investisseur peut se soucier moins du profit total réalisé sur un an que de la fluctuation de ce profit, recherchant un rendement régulier plutôt qu'un pari risqué. Ces scénarios impliquent ce que les chercheurs appellent des objectifs non cumulatifs, où le score final dépend d'une fonction spécifique de l'ensemble de l'historique des récompenses, comme la valeur maximale atteinte ou le ratio entre le gain moyen et la volatilité. Jusqu'à présent, enseigner à l'intelligence artificielle comment optimiser ces objectifs complexes dépendant de l'historique a été difficile, nécessitant souvent des algorithmes construits sur mesure et difficiles à appliquer à de nouveaux problèmes.
Une équipe de chercheurs de l'Institut Max Planck pour la science de la lumière et de l'Université Friedrich-Alexander d'Erlangen-Nuremberg a développé une solution générale à ce problème. Ils ont découvert un moyen de traduire ces défis non cumulatifs complexes dans le format standard que les outils d'intelligence artificielle existants et puissants savent déjà résoudre. Au lieu d'inventer un nouveau type d'algorithme d'apprentissage à partir de zéro, ils ont créé un pont. Ils ont montré qu'en modifiant légèrement la façon dont la machine perçoit sa situation actuelle et la façon dont elle calcule son retour immédiat, n'importe quel objectif complexe peut être converti en un problème standard de « somme de récompenses ». Cela permet aux chercheurs de prendre les logiciels d'apprentissage les plus avancés et prêts à l'emploi disponibles aujourd'hui et de les appliquer directement à des problèmes qui étaient auparavant hors de portée, sans avoir besoin de modifier le logiciel lui-même.
Le cœur de leur méthode consiste à donner à l'agent artificiel un peu plus de mémoire. Dans une configuration standard, un agent n'a besoin de connaître que son état actuel pour prendre une décision. Mais quand l'objectif dépend de l'historique complet des récompenses — comme se souvenir de la vitesse la plus élevée atteinte jusqu'à présent — l'agent doit porter cette information avec lui. Les chercheurs ont proposé un système où l'« état » de l'agent est étendu pour inclure un résumé de l'historique, tel que la récompense la plus haute ou la plus basse observée jusqu'à ce moment. Simultanément, ils ont ajusté la récompense immédiate que l'agent reçoit à chaque étape. Au lieu de recevoir une récompense qui reflète simplement l'action actuelle, l'agent reçoit une valeur calculée qui, lorsqu'elle est additionnée sur l'ensemble du voyage, reconstruit parfaitement l'objectif complexe. Par exemple, si l'objectif est de minimiser la vitesse maximale, l'agent est récompensé de telle sorte qu'il est pénalisé uniquement lorsqu'il établit un nouveau record de vitesse, transformant ainsi le problème du « minimum des maximums » en une somme standard.
Cette approche a été testée à travers une grande variété de tâches difficiles, prouvant sa polyvalence. Dans une simulation d'un atterrisseur lunaire, les chercheurs ont entraîné un agent à faire atterrir un vaisseau spatial tout en limitant strictement sa vitesse maximale. Ils ont comparé leur méthode à une approche standard qui tentait d'approximer l'objectif en ajoutant une pénalité à la toute fin du vol. La nouvelle méthode, qui traitait la limite de vitesse comme une partie continue du processus d'apprentissage, a trouvé un bien meilleur équilibre entre un atterrissage sûr et un mouvement efficace. Dans le domaine de la finance, ils ont appliqué la technique à l'optimisation de portefeuille, où l'objectif est de maximiser le ratio de Sharpe — une mesure du rendement ajusté au risque qui divise le profit moyen par la volatilité de ces profits. Les méthodes précédentes devaient s'appuyer sur des approximations approximatives de ce ratio. En utilisant cette nouvelle cartographie, les agents pouvaient apprendre à maximiser le ratio exact directement, ce qui a conduit à des stratégies d'investissement nettement meilleures pendant l'entraînement.
Les chercheurs ont également exploré des problèmes d'optimisation discrète, tels que la recherche de l'arrangement le plus efficace de portes logiques quantiques ou la simplification de diagrammes complexes utilisés en informatique quantique. Dans ces tâches, l'objectif est souvent de trouver le meilleur état unique atteint lors d'une longue recherche, plutôt que la somme de toutes les améliorations réalisées en cours de route. Ici, la nouvelle méthode a permis aux agents d'explorer plus audacieusement. Parce que l'agent n'était pas pénalisé pour les revers temporaires qui étaient nécessaires pour atteindre une meilleure solution plus tard, il a appris plus rapidement et a trouvé des solutions de meilleure qualité que les agents entraînés avec des récompenses cumulatives standards. Dans une expérience impliquant la correction d'erreurs quantiques, la nouvelle méthode a amélioré les performances de manière significative, trouvant de meilleures solutions en moins de temps.
La force de ce travail réside dans sa simplicité et sa généralité. Les chercheurs n'ont pas créé un nouvel algorithme d'apprentissage ; ils ont créé une couche de traduction. Cela signifie que tout expert dans un domaine spécifique, de la robotique à la finance, peut prendre son problème existant, appliquer cette cartographie et utiliser immédiatement les outils d'apprentissage par renforcement les plus puissants disponibles. La méthode fonctionne aussi bien dans des environnements prévisibles que dans ceux remplis de bruit aléatoire, et elle traite des objectifs aussi bien simples que complexes. Bien que les chercheurs aient noté que la mémoire étendue requise pour l'agent puisse rendre le problème légèrement plus vaste, les techniques modernes de deep learning sont bien équipées pour gérer cela. Le résultat est un cadre unifié qui lève la barrière entre les objectifs complexes du monde réel et les outils sophistiqués de l'intelligence artificielle, ouvrant la voie à des machines capables d'apprendre des stratégies qui étaient auparavant trop difficiles à définir.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.