Residual Reward Models: Leveraging Prior Knowledge for Efficient Preference-based Reinforcement Learning in Robotics
Cet article introduit les Modèles de Récompense Résiduelle (RRM), une méthode qui décompose la fonction de récompense en une composante de connaissance a priori et un décalage résiduel apprenable afin d'améliorer significativement l'efficacité de l'échantillonnage et l'applicabilité en conditions réelles de l'apprentissage par renforcement basé sur les préférences en robotique.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Enseigner à un robot comment effectuer une tâche physique complexe, comme appuyer sur un bouton ou ramasser un objet délicat, est un casse-tête difficile pour les ingénieurs. Dans le monde de la robotique, la machine a besoin d'un ensemble d'instructions qui lui indiquent ce qu'elle fait bien et ce qu'elle fait mal. Cet ensemble d'instructions est appelé une fonction de récompense. Si les instructions sont vagues ou erronées, le robot pourrait apprendre à contourner le système, trouvant un moyen d'obtenir un score élevé sans réellement accomplir la tâche, ou il pourrait simplement abandonner parce qu'il ne parvient pas à comprendre ce qui est attendu. Traditionnellement, les humains doivent écrire ces instructions à la main, en devinant quels mouvements mèneront au succès. Ce processus est lent, coûteux et échoue souvent lorsque le robot est confronté à une situation que l'humain n'avait pas anticipée.
Une approche plus récente, connue sous le nom d'apprentissage par préférences, tente de résoudre ce problème en permettant aux humains de simplement dire quel mouvement de robot semble le meilleur entre deux choix, plutôt que d'écrire des règles complexes. Bien que cela semble plus simple, cela crée un nouveau problème : le robot doit voir des milliers de ces comparaisons pour apprendre quoi que ce soit d'utile. Dans un cadre réel, demander à un humain de regarder et de juger un robot autant de fois est impraticable et coûteux. Le robot apprend trop lentement, et le coût de l'attention humaine devient un goulot d'étranglement qui empêche ces machines d'être utiles en dehors d'un laboratoire contrôlé.
Des chercheurs de l'Université de Toronto et de l'Université Tsinghua ont développé une méthode pour accélérer considérablement ce processus. Ils appellent leur approche le Modèle de Récompense Résiduelle (Residual Reward Model). Au lieu de partir de zéro et de demander à un humain d'enseigner tout au robot depuis le début, cette méthode permet au robot de commencer avec une « meilleure supposition » sur la façon dont la tâche devrait être accomplie. Cette supposition peut provenir d'une règle simple écrite par un ingénieur, d'une description générée par un grand modèle de langage, ou même d'une fonction de récompense apprise en regardant un humain accomplir la tâche une seule fois. Le robot utilise ensuite cette supposition initiale comme fondation. Lorsqu'un humain fournit une préférence, en disant « ce mouvement était meilleur que celui-là », le robot ne cherche pas à réécrire tout le manuel de règles. Au lieu de cela, il apprend seulement la petite différence, ou le « résidu », nécessaire pour corriger la supposition initiale.
Imaginez cela comme un étudiant qui connaît déjà les règles de base d'un sport mais qui a besoin d'un entraîneur pour lui indiquer les nuances spécifiques de sa technique. L'étudiant n'a pas besoin de réapprendre à courir ou à lancer ; il doit seulement ajuster légèrement sa forme pour correspondre aux commentaires de l'entraîneur. De la même manière, le robot utilise le feedback de l'humain pour apporter des ajustements petits et précis à sa compréhension préexistante de la tâche. Cette structure maintient la stabilité de l'apprentissage. Si la supposition initiale est imparfaite, le robot peut tout de même apprendre car il n'a qu'à corriger les erreurs plutôt que de découvrir l'entièreté du concept à partir de rien.
Les chercheurs ont testé cette idée dans une variété d'environnements simulés, incluant des tâches où un bras robotique devait appuyer sur des boutons, balayer des objets dans un bac ou déverrouiller des portes. Ils ont également testé cela sur un vrai robot physique, un bras Franka Panda, dans un cadre de laboratoire. Dans chaque cas, la méthode utilisant la « meilleure supposition » plus les petites corrections apprises était beaucoup plus rapide que les méthodes qui tentaient d'apprendre tout à partir des préférences humaines seules. Dans les simulations, le robot utilisant cette nouvelle méthode a atteint un taux de réussite parfait dans de nombreuses tâches tout en nécessitant beaucoup moins de jugements humains. Par exemple, dans une tâche où un robot devait appuyer sur un bouton, une méthode standard qui tentait d'apprendre à partir de zéro stagnait à un taux de réussite de vingt pour cent, tandis que la nouvelle méthode atteignait cent pour cent.
L'étude a également montré que cette approche est robuste face aux erreurs. Si la « meilleure supposition » initiale était légèrement erronée, ou si le feedback humain était occasionnellement bruité ou incohérent, le robot pouvait tout de même apprendre le comportement correct. La supposition initiale agissait comme un filet de sécurité, empêchant le robot de s'égarer dans des comportements inutiles, tandis que les corrections garantissaient qu'il finisse par trouver le bon chemin. Cela était particulièrement important lorsque les chercheurs testaient le système avec un feedback humain très limité. Même lorsque l'humain était sollicité pour fournir un nombre infime de jugements, le robot utilisant la méthode résiduelle continuait de s'améliorer, alors que la méthode standard ne parvenait à rien apprendre d'utile.
Peut-être plus important encore, les chercheurs ont démontré que cet apprentissage pouvait être transféré directement d'une simulation informatique vers un robot physique réel sans aucun ajustement supplémentaire. Ils ont entraîné le robot dans un environnement virtuel, puis ont appliqué la politique apprise sur un véritable bras Franka Panda pour effectuer des tâches comme atteindre un objet, pousser un bloc ou ramasser quelque chose pour le déplacer. Le robot entraîné avec la méthode résiduelle a réussi ces tâches réelles beaucoup plus rapidement que la méthode de référence. Dans une tâche difficile impliquant la poussée d'un objet, la méthode standard ne réussissait que la moitié du temps après un entraînement intensif, tandis que la nouvelle méthode atteignait un taux de réussite de quatre-vingt-quinze pour cent avec le même temps d'entraînement.
Les conclusions suggèrent qu'en combinant les connaissances préalables avec le feedback humain, les robots peuvent apprendre des compétences physiques complexes avec beaucoup moins de supervision humaine que ce qui était auparavant jugé possible. Cela ne signifie pas que le robot sait tout à l'avance, mais plutôt qu'il utilise ce qu'il sait déjà comme point de départ pour tirer le meilleur parti de chaque fragment de feedback humain qu'il reçoit. Cette efficacité pourrait être une étape clé pour rendre les assistants robotiques pratiques pour des emplois du monde réel, où le temps et l'attention humaine sont des ressources limitées. Ce travail confirme qu'offrir à un robot un coup de pouce, même rudimentaire, lui permet d'apprendre à partir des préférences humaines d'une manière qui est à la fois plus rapide et plus fiable qu'en partant d'une page blanche.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.