MEMENTO: Memory-Guided Memetic Code-as-Policy Evolution
L'article introduit MEMENTO, un cadre mémétique guidé par la mémoire qui fait évoluer du code exécutable sous forme de politiques pour des tâches embodiment de long horizon en combinant la génération pilotée par les LLM avec un retour structuré provenant d'un évaluateur évolué, atteignant une performance et un transfert sim-to-real supérieurs par rapport aux bases de référence existantes.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Imaginez que vous essayez d'apprendre à un robot à accomplir une tâche complexe, comme construire une tour de blocs ou préparer un sandwich. Il ne s'agit pas seulement d'appuyer sur un bouton unique ; c'est une longue séquence d'étapes où chaque mouvement dépend du précédent. Si le robot saisit le mauvais bloc ou ouvre la mauvaise porte, tout le plan s'effondre. C'est le monde de l'« IA incarnée » (embodied AI), où le logiciel rencontre le monde physique et désordonné. Le grand défi ici est le « problème de l'attribution de crédit » : lorsqu'un robot échoue à la fin d'une tâche de longue durée, comment savoir quelle étape spécifique a fait défaut ? Était-ce le premier mouvement, ou le dixième ?
Pour résoudre cela, des chercheurs essaient une astuce ingénieuse appelée « code-as-policy » (le code comme politique). Au lieu d'entraîner un robot avec des instructions vagues ou des récompenses par essais et erreurs, ils écrivent le cerveau du robot sous forme de véritable code informatique. C'est comme donner au robot un livre de recettes plutôt qu'un simple ressenti. Si la recette échoue, vous pouvez la lire, voir exactement quelle instruction était déroutante, et la réécrire. Mais écrire ces recettes à la main est difficile, et deviner le bon code l'est encore plus. C'est là que les modèles de langage étendus (LLM) — les mêmes cerveaux d'IA qui rédigent des essais et discutent avec nous — entrent en jeu. Ils peuvent générer du code, mais ils ont souvent besoin d'aide pour comprendre pourquoi un morceau de code a échoué afin de pouvoir le corriger correctement.
C'est l'histoire d'une nouvelle méthode appelée MEMENTO, qui agit comme un éditeur super intelligent et doté de mémoire pour le code des robots. Les chercheurs ont voulu voir s'ils pouvaient faire évoluer de meilleures recettes de robot en laissant une IA les écrire, les tester, puis utiliser une « mémoire » spéciale pour se souvenir de ce qui n'a pas fonctionné, afin de ne pas commettre les mêmes erreurs à nouveau. Ils ont testé cela sur deux jeux difficiles : un où un bras robotique doit résoudre un puzzle de la Tour de Hanoi (déplacer des blocs sans enfreindre les règles), et un autre où un robot doit naviguer dans une maison virtuelle pour préparer un en-cas.
Voici comment fonctionne MEMENTO, et ce que l'équipe a découvert.
Le problème du « tâtonnement »
Imaginez que vous essayiez d'écrire un programme pour résoudre un puzzle. Vous demandez à une IA d'écrire le code. Elle écrit quelque chose, vous l'exécutez, et cela échoue. Si vous demandez simplement à l'IA d'« essayer à nouveau » avec une nouvelle idée aléatoire, vous obtiendrez peut-être une erreur légèrement différente, mais vous n'apprenez pas vraiment. C'est comme essayer de trouver une clé cachée dans un immense champ en lançant des fléchettes les yeux bandés.
Les méthodes précédentes tentaient de corriger cela en générant de nombreuses versions différentes du code à la fois et en choisissant la meilleure. Mais les chercheurs ont découvert que cette approche passait souvent à côté de la plaque. C'était comme avoir cent personnes suggérant différentes façons de réparer un tuyau qui fuit, mais aucune d'entre elles ne regardait réellement l'endroit précis où l'eau coulait. Elles manquaient d'un moyen de prendre une bonne idée, de l'ajuster soigneusement, de se souvenir des ajustements qui avaient échoué, et de combiner les meilleures parties de différentes idées.
Entrée en scène MEMENTO : L'éditeur doté de mémoire
Les auteurs ont introduit MEMENTO, qui signifie Memory-Guided Memetic Code-as-Policy Evolution (Évolution de politique par code guidée par la mémoire et mémétique). Le nom semble sophistiqué, mais l'idée est étonnamment humaine. Considérez MEMENTO comme un maître éditeur travaillant avec un seul brouillon « étoile » du cerveau du robot.
Le processus se déroule en deux actes principaux :
Acte 1 : Construire le Juge
Avant même que le robot ne commence à apprendre, MEMENTO crée un « Juge » spécial (un évaluateur). Ce Juge est un morceau de code qui observe le robot tenter la tâche et lui donne un score. Mais il ne se contente pas de dire « Réussite » ou « Échec ». Il donne un bulletin de notes détaillé : « Vous avez obtenu le score, mais vous avez lâché le bloc ici », ou « Vous avez ouvert la porte trop vite ». Les chercheurs ont d'abord fait évoluer ce Juge, en s'assurant qu'il était capable de repérer précisément ce qui n'allait pas dans la performance du robot.
Acte 2 : La recherche à trois branches
Une fois le Juge prêt, la véritable évolution commence. MEMENTO ne lance pas de fléchettes au hasard ; il utilise trois stratégies spécifiques pour améliorer le code du robot, tout en conservant une « mémoire » des échecs passés :
- Le Hill-Climber (L'ajusteur minutieux) : Cette branche prend le meilleur code actuel et effectue des changements minuscules et prudents. Si un changement améliore le robot, il le conserve. Si un changement l'aggrave, il se souvient de pourquoi ce changement spécifique a échoué. Cette « mémoire des idées rejetées » empêche l'IA de commettre deux fois la même erreur. C'est comme un randonneur qui tente un sentier, trouve une impasse, la marque sur une carte, puis essaie un autre chemin, s'assurant de ne pas retourner dans le même buisson.
- Le Macro-Mutateur (Le générateur de grandes idées) : Parfois, de petits ajustements ne suffisent pas. Cette branche prend le meilleur code et effectue des changements majeurs et audacieux — comme réécrire un paragraphe entier de la recette. C'est le moment du « et si nous essayions une approche complètement différente ? ».
- Le Crossover (Le mélangeur) : C'est l'ingrédient magique. Il prend le meilleur résultat de l'Ajusteur minutieux et le meilleur résultat du Générateur de grandes idées, et les mélange. C'est comme prendre les meilleurs ingrédients de deux recettes différentes pour créer un nouveau plat superlatif.
Après avoir essayé ces trois voies, MEMENTO choisit le résultat unique le plus performant pour devenir l'« Élite » du tour suivant. Ce cycle se répète, affinant lentement le code jusqu'à ce que le robot puisse accomplir la tâche.
Les résultats : Est-ce que cela fonctionne vraiment ?
Les chercheurs ont testé MEMENTO dans deux mondes très différents :
- Robosuite Tower of Hanoi : Un bras robotique empilant quatre blocs.
- AI2-THOR : Un robot naviguant dans une cuisine virtuelle pour mettre une pomme dans un micro-ondes et du pain dans un frigo.
Ils ont comparé MEMENTO à deux autres méthodes populaires (Eureka et REvolve). Les résultats étaient clairs : MEMENTO a gagné.
Dans la tâche de la Tour de Hanoi, MEMENTO a atteint un taux de réussite de 0,97 ± 0,06 (ce qui signifie qu'il a résolu le puzzle presque à chaque fois), tandis que les autres méthodes ont eu du mal, l'une n'atteignant que 0,53 et l'autre échouant complètement (0,00). Dans la tâche de la cuisine, MEMENTO a atteint un taux de réussite parfait de 1,00 ± 0,00, alors que les autres n'ont réussi que 0,40 et 0,00.
Mais la véritable magie ne se trouvait pas seulement dans la salle d'entraînement. Les chercheurs ont testé si le robot pouvait gérer de nouvelles situations qu'il n'avait jamais vues auparavant.
- Nouvelles formes : Lorsque les blocs ont été changés de cubes à des cylindres étranges ou des objets asymétriques, MEMENTO a quand même résolu le puzzle 0,87 du temps. Les autres méthodes sont tombées à 0,23 ou 0,00.
- Nouvelles pièces : Lorsqu'ils ont déplacé le robot de cuisine dans une configuration de maison totalement nouvelle qu'il n'avait jamais vue, MEMENTO a quand même réussi 0,78 du temps. Les autres sont tombés à 0,08.
Cela suggère que MEMENTO n'a pas seulement mémorisé les blocs spécifiques ou la cuisine spécifique ; il a réellement appris la logique de la tâche.
Les moments de révélation (Études d'ablation)
Pour prouver que leur conception spécifique était la recette secrète, les chercheurs ont essayé de retirer des parties de MEMENTO pour voir ce qui se passerait.
- Sans mémoire : Lorsqu'ils ont supprimé la « mémoire » des idées rejetées, le robot s'est retrouvé coincé à commettre les mêmes erreurs encore et encore.
- Sans grands changements : S'ils ne laissaient le robot faire que de petits ajustements (sans « Macro-Mutation »), il ne pouvait pas sortir des pièges locaux.
- Sans mélange : S'ils arrêtaient de mélanger les meilleures idées (sans « Crossover »), le robot ne pouvait pas combiner les bonnes stratégies.
- Sans évolution du Juge : Lorsqu'ils ont utilisé un Juge simple, non entraîné, au lieu du Juge évolué, le robot n'a pas pu comprendre comment gagner.
Chaque fois qu'ils retiraient une pièce, la performance chutait de manière significative, prouvant que l'ensemble du système était nécessaire.
De la simulation à la réalité
La partie la plus excitante ? Ils ont pris le meilleur code que MEMENTO a fait évoluer dans la simulation informatique et l'ont appliqué à un véritable robot physique (un bras robotique Franka). Ils ne l'ont pas réentraîné ni modifié le code ; ils l'ont simplement laissé fonctionner.
Le robot a résolu la Tour de Hanoi dans le monde réel 90 % du temps (9 tentatives sur 10). L'unique échec n'était pas dû à une erreur de code, mais au fait que la caméra du robot avait mal interprété la position d'un bloc. Cela a prouvé que l'approche « code-as-policy » n'est pas seulement un tour de simulation — elle fonctionne dans le monde physique réel et désordonné.
Ce que cela signifie
L'article suggère que pour que les robots apprennent des tâches longues et complexes, nous avons besoin de plus que de simples conjectures aléatoires. Nous avons besoin d'un système qui se souvienne de ce qui n'a pas fonctionné, qui effectue à la fois de petits et de grands changements, et qui mélange les meilleures idées ensemble. MEMENTO montre qu'en traitant le code du robot comme une recette qui peut être éditée, testée et affinée avec une mémoire des échecs passés, nous pouvons enseigner aux robots à résoudre des puzzles qui étaient auparavant trop difficiles pour eux.
Les auteurs précisent avec prudence que cela a été testé sur des tâches spécifiques et que la méthode dépend du modèle de langage spécifique utilisé. Ils n'ont pas prétendu que cela résout tous les problèmes robotiques, mais ils ont montré une voie très prometteuse pour apprendre aux robots à penser en code.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.