Efficient Hypergradient Descent for Inverse Reinforcement Learning
Cet article propose une méthode efficace d'apprentissage par renforcement inverse qui exploite la proportionnalité entre la hessienne de l'objectif interne et la matrice d'information de Fisher de la politique pour dériver un hypergradient structuré, lequel est ensuite approximé via un esquissage spectral en flux (streaming spectral sketching) afin de surmonter les goulots d'étranglement de scalabilité associés aux matrices de Fisher de grande taille.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Imaginez que vous essayez d'apprendre à un robot à marcher comme un danseur professionnel. Vous pourriez montrer au robot une vidéo de la danse et lui dire : « Copie exactement mes mouvements ». C'est ce qu'on appelle l'apprentissage par imitation. Mais que se passe-t-il si le sol change, ou si le robot doit danser sur un trampoline plutôt que sur une scène ? S'il s'était contenté de mémoriser les mouvements, il pourrait tomber lamentablement sur le nez. Une approche plus intelligente consiste à comprendre pourquoi le danseur a bougé de cette façon. Qu'est-ce que le danseur cherchait à accomplir ? Quel était le « score » qu'il essayait de maximiser ? C'est l'objectif de l'Apprentissage par Renforcement Inverse (IRL) : au lieu de simplement copier la danse, nous essayons de rétro-concevoir le « système de récompense » invisible que l'expert suivait. Une fois que nous connaissons les règles du jeu, nous pouvons apprendre au robot à danser sur n'importe quelle surface, pas seulement sur celle qu'il a vue dans la vidéo.
Pour ce faire, les scientifiques utilisent un jeu complexe en deux étapes appelé optimisation bi-niveau. Voyez cela comme un professeur et un élève. Le « niveau interne » est l'élève qui essaie d'apprendre les meilleurs mouvements basés sur un ensemble de règles (la récompense) que nous lui donnons. Le « niveau externe » est le professeur qui vérifie si les mouvements de l'élève ressemblent à ceux de l'expert. S'ils ne correspondent pas, le professeur modifie les règles (la récompense) et renvoie l'élève s'entraîner. Le problème est que déterminer exactement comment modifier les règles est incroyablement difficile. C'est comme essayer de deviner comment un minuscule changement dans les règles va se répercuter sur tout le processus d'apprentissage de l'élève. Généralement, calculer cela nécessite une quantité massive de mémoire informatique, comme si l'on essayait de transporter une bibliothèque dans son sac à dos juste pour résoudre un problème de mathématiques.
Cet article introduit un raccourci ingénieux pour résoudre ce problème de mémoire. Les auteurs, Nikita Sevriukov et son équipe de l'Université HSE, ont découvert que lorsque l'élève (le robot) a parfaitement appris les règles, la « forme » mathématique de son processus d'apprentissage ressemble exactement à une carte spécifique appelée Matrice d'Information de Fisher. C'est un événement majeur car cette carte possède une structure particulière qui la rend plus facile à manipuler. Cependant, même cette carte peut être trop vaste pour être stockée sur un ordinateur. Ainsi, l'équipe a inventé une méthode de « croquis spectral de flux » (streaming spectral sketch). Imaginez qu'au lieu de noter chaque détail de la carte, vous preniez un instantané rapide et intelligent qui capture les caractéristiques les plus importantes tout en jetant l'encombrement inutile. Ils appellent cette méthode la Descente de Gradient Hyper-efficace (Efficient Hypergradient Descent).
Les chercheurs ont testé cette idée dans deux mondes différents : un jeu simple d'équilibrage de pôle appelé CartPole et une tâche de contrôle continu plus complexe appelée LQR. Ils ont comparé leur nouvelle méthode de « croquis » aux anciennes méthodes plus lentes pour effectuer les calculs. Les résultats sont prometteurs. Dans l'environnement complexe LQR, leur méthode a réduit la mémoire nécessaire d'environ 1,31 fois et a été légèrement plus rapide. Dans le jeu plus simple CartPole, elle a été presque 1,3 fois plus rapide. Bien que la méthode de « croquis » n'ait pas toujours produit la carte de récompense absolument parfaite par rapport aux méthodes lentes et lourdes, elle s'en est approchée de très près. Plus important encore, elle a permis au robot d'apprendre le style de l'expert tout aussi bien, mais de manière beaucoup plus efficace. Les auteurs suggèrent qu'en utilisant ces approximations intelligentes et légères, nous pouvons apprendre aux robots à apprendre des experts sans avoir besoin de superordinateurs pour stocker toutes les données.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.