← Derniers articles
💻 computer science

WAM-RL: World-Action Model Reinforcement Learning with Reconstruction Rewards and Online Video SFT

Cet article introduit WAM-RL, un nouveau cadre d'apprentissage par renforcement qui permet l'optimisation en ligne conjointe des modèles de monde et d'action via des récompenses de reconstruction, démontrant que la coévolution de ces deux composants est essentielle pour atteindre des performances élevées dans les tâches de manipulation à long horizon au-delà des limites de l'entraînement basé uniquement sur l'expert.

Auteurs originaux : Zezhong Qian, Xiaowei Chi, Yu Qi, Haozhan Li, Zhi Yang Chen, Shanghang Zhang

Publié 2026-06-17
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Zezhong Qian, Xiaowei Chi, Yu Qi, Haozhan Li, Zhi Yang Chen, Shanghang Zhang

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous appreniez à un robot à effectuer une tâche complexe, comme arroser une plante ou empiler des blocs. Traditionnellement, nous enseignons aux robots en leur montrant des vidéos d'experts accomplissant parfaitement le travail. Le robot mémorise ces vidéos et essaie de les copier. Cela fonctionne bien pour des tâches simples, mais si le robot commet une minuscule erreur, il s'embrouille souvent et échoue complètement car il n'a jamais appris comment se rétablir.

Ce document présente un nouveau système appelé WAM-RL. Considérez cela comme le fait de donner au robot un « cerveau » et un « corps » qui apprennent ensemble en réalisant réellement la tâche, plutôt que de simplement regarder des vidéos.

Voici comment cela fonctionne, décomposé en concepts simples :

1. Les deux parties : l'« Imaginateur » et le « Faiseur »

La plupart des modèles de robots avancés possèdent deux parties principales :

  • Le Modèle de Monde (l'Imaginateur) : Cette partie est comme un réalisateur de cinéma à l'intérieur de la tête du robot. Avant que le robot ne bouge, il imagine à quoi ressemblera le futur. « Si je bouge mon bras de cette façon, le bloc tombera. Si je le bouge de cette façon, il restera en place. » Il prédit l'avenir.
  • Le Modèle d'Action (le Faiseur) : C'est le corps du robot. Il prend le « film » que l'Imaginateur a créé et le transforme en mouvements musculaires réels.

Le Problème : Dans les anciens systèmes, l'« Imaginateur » était fixe. Il était entraîné sur des vidéos parfaites et ne changeait jamais. Si le monde réel ne correspondait pas à la vidéo parfaite (comme si le robot faisait tomber un bloc), le « Faiseur » ne savait pas comment réparer l'erreur car son « Imaginateur » ne pouvait pas prédire qu'une erreur s'était produite.

2. La Solution : Une équipe qui grandit ensemble

Les auteurs ont créé un cadre où l'Imaginateur et le Faiseur apprennent l'un de l'autre en temps réel.

  • Le Faiseur reçoit un nouvel entraîneur : Au lieu de simplement recevoir un « Bon travail » ou « Mauvais travail » à la toute fin, le Faiseur reçoit un score constant basé sur la mesure de la précision de ses mouvements réels par rapport aux prédictions de l'Imaginateur. Si le robot imagine que le bloc restera en place, mais qu'il tombe réellement, le Faiseur reçoit une « pénalité ». Cela apprend au Faiseur à bouger d'une manière qui correspond au plan.
  • L'Imaginateur reçoit un rappel à la réalité : L'Imaginateur est mis à jour à l'aide de vidéos réelles du robot réussissant sa tâche. Crucialement, les auteurs ont ajouté un « filet de sécurité » (appelé Régularisation KL). Imaginez que l'Imaginateur est un étudiant qui apprend de nouvelles choses. Le filet de sécurité empêche l'étudiant d'oublier tout ce qu'il savait déjà ou de changer sa personnalité de manière trop radicale. Cela garantit que l'Imaginateur améliore ses prédictions sans briser la connexion avec le Faiseur.

3. La Grande Découverte : On ne peut pas entraîner uniquement le corps

Le document a révélé quelque chose de très important lors des expériences :

  • Tâches courtes : Si vous entraînez uniquement le « Faiseur » (le corps) et que vous laissez l'« Imaginateur » (le cerveau) tranquille, le robot s'améliore pour les tâches rapides et simples.
  • Tâches longues : Pour des tâches complexes qui durent longtemps, entraîner seulement le corps échoue. Pourquoi ? Parce que le corps est limité par la qualité de la capacité du cerveau à prédire l'avenir. Si le cerveau commet une petite erreur dans sa prédiction, le corps ne peut pas la corriger, et l'erreur s'accumule jusqu'à ce que le robot échoue.

L'Analogie : Imaginez jouer à un jeu vidéo où vous êtes le personnage (le Faiseur), mais que la carte (l'Imaginateur) est légèrement erronée. Si le jeu est court, vous pouvez vous débrouiller par intuition. Mais si le jeu est long, la mauvaise carte finira par vous mener dans le précipice. Vous devez corriger la carte pendant que vous jouez, et non pas seulement améliorer la vitesse de course de votre personnage.

4. Comment ils mesurent le succès

Au lieu de simplement vérifier si le robot a terminé la tâche, ils ont utilisé une astuce ingénieuse. Ils ont comparé le Futur Imaginé (ce que le robot pensait qu'il se passerait) avec le Futur Réel (ce qui s'est réellement passé).

  • Si le robot imaginait que le bloc resterait et qu'il est resté, c'est un score élevé.
  • Si le robot imaginait que le bloc resterait, mais qu'il est tombé, c'est un score faible.
    Cela aide le robot à apprendre à prédire la réalité plus précisément, ce qui l'aide à mieux bouger.

5. Le Résultat : Apprendre à se rétablir

Le résultat le plus passionnant est que ce système a appris au robot comment se rétablir de ses erreurs.

  • Sans ce système : Si le robot essayait de saisir un bloc et le ratait, il continuerait à essayer de le saisir de la même manière incorrecte, finissant par abandonner.
  • Avec ce système : L'« Imaginateur » a appris à prédire qu'un échec pouvait survenir. Il a ensuite « imaginé » un plan de récupération (comme reculer la main et réessayer). Le « Faiseur » a vu ce plan et l'a exécuté. Le robot a appris à dire : « Oups, j'ai raté, essayons un autre angle », et a réussi.

Résumé

WAM-RL est une méthode où le « cerveau » (prédiction) et le « corps » (action) d'un robot apprennent ensemble en temps réel. En faisant en sorte qu'ils s'améliorent simultanément, le robot devient bien meilleur pour les tâches longues et complexes et, surtout, apprend à corriger ses propres erreurs lorsqu'elles surviennent, plutôt que de simplement échouer.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →