← Derniers articles
🤖 machine learning

GROW: Aligning GRPO with State-Action Modeling for Open-World VLM Agents

L'article présente GROW, un cadre d'apprentissage par renforcement qui adapte l'optimisation de politique relative de groupe (GRPO) pour les agents de modèles vision-langage en monde ouvert en décomposant les trajectoires complètes en échantillons état-action afin de surmonter les limitations de longueur de contexte, atteignant des performances de pointe sur plus de 800 tâches Minecraft.

Auteurs originaux : Xiongbin Wu, Zhihao Luo, Shanzhe Lei, Lechao Zhang, Xuhong Wang, Jie Yang, Zhonglong Zheng, Yuanjie Zheng, Xin Tan, Wei Liu

Publié 2026-05-21
📖 6 min de lecture🧠 Analyse approfondie

Auteurs originaux : Xiongbin Wu, Zhihao Luo, Shanzhe Lei, Lechao Zhang, Xuhong Wang, Jie Yang, Zhonglong Zheng, Yuanjie Zheng, Xin Tan, Wei Liu

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous enseigniez à un robot à jouer à un jeu vidéo complexe comme Minecraft. Le robot possède une caméra (ses yeux) et peut taper sur un clavier et déplacer une souris (ses mains). Son objectif est d'accomplir des tâches telles que « construire une maison », « miner de l'or » ou « vaincre un monstre ».

Pendant longtemps, la meilleure façon d'enseigner à ces robots était le Raffinement Supervisé (SFT). Imaginez cela comme montrer au robot une vidéo d'un expert humain jouant parfaitement au jeu et lui dire : « Copiez exactement ce qu'ils ont fait. » Le problème ? Trouver des heures de gameplay humain parfait est coûteux, et si le robot mémorise simplement la vidéo, il se perd lorsque le jeu change légèrement.

Ensuite, les chercheurs ont essayé l'Apprentissage par Renforcement (RL), spécifiquement un algorithme appelé GRPO. Cela revient à laisser le robot jouer au jeu, échouer, réussir et apprendre des résultats. Cependant, le GRPO standard présentait un défaut majeur lorsqu'il était appliqué aux jeux en monde ouvert : il traitait l'ensemble de la session de jeu comme une seule leçon.

Le Problème : La Leçon « Trop Longue »

Imaginez que vous essayiez d'apprendre à faire un gâteau.

  • Le GRPO standard revient à vous remettre un livre de 500 pages qui inclut l'histoire de votre enfance, le bulletin météo d'il y a trois jours, la recette et l'histoire du chien de votre voisin, le tout mélangé. Il vous dit : « Vous avez fait un bon gâteau à la fin, donc tout ce qui se trouve dans ce livre de 500 pages était bon. »
  • Dans l'article, cela s'appelle la « trajectoire complète ». Alors que le robot joue à Minecraft, l'historique de ce qu'il a vu et fait devient de plus en plus long. Finalement, le « livre » devient si énorme et rempli de bruit sans pertinence (comme marcher pendant 10 minutes avant de trouver un bloc) que le robot est submergé et ne peut pas déterminer quel mouvement spécifique a réellement conduit au succès.

La Solution : GROW (L'Approche « Carte de Recette »)

Les auteurs proposent un nouveau cadre appelé GROW (Alignement de GRPO avec la Modélisation État-Action).

Au lieu de donner au robot tout le livre de 500 pages, GROW découpe la session de jeu en de minuscules cartes de recettes faciles à avaler.

  • Décomposition État-Action : GROW décompose la longue session de jeu en moments individuels : « Regarder le bloc » + « Cliquer sur la souris » + « Le pic frappe ».
  • Rétroaction Intelligente : Si le robot réussit à la fin, GROW ne dit pas « Tout le jeu était génial ». Au lieu de cela, il examine les cartes spécifiques qui ont mené à la victoire. Il dit : « Le mouvement que vous avez fait 5 secondes avant de trouver l'or était très bon. Le mouvement que vous avez fait il y a 20 minutes alors que vous marchiez simplement ? C'était juste correct. »

Comment Cela Fonctionne (L'Analogie)

Imaginez un entraîneur formant un joueur de football.

  • Ancienne Méthode (GRPO Standard) : L'entraîneur regarde tout le match de 90 minutes, voit le joueur marquer un but, puis crie : « Bravo ! Vous avez tout fait correctement de la première à la dernière minute ! » Le joueur est confus car il a en fait fait une passe terrible à la 10e minute qui a failli faire perdre le match.
  • Méthode GROW : L'entraîneur décompose le match. « Cette passe à la 10e minute était négligente. Mais la course que vous avez faite à la 80e minute ? Parfaite. Et le tir à la 89e minute ? Brillant. » Le joueur apprend exactement quelles actions spécifiques répéter.

La Mathématique « Magique »

L'article inclut une preuve mathématique (Analyse de Substitut) pour nous rassurer que cette approche de « découpage de la leçon » reste valide.

  • La Préoccupation : Les mathématiques standard pour ce type d'apprentissage exigent généralement de comparer différentes tentatives au même point de départ exact. GROW compare différents moments dans le temps, qui sont tous différents.
  • Le Résultat : Les auteurs ont prouvé que même si les points de départ sont différents, la « note » que le robot reçoit reflète toujours avec précision la qualité de sa stratégie. C'est comme noter un élève à un test de mathématiques : même si les questions sont différentes, la note finale indique toujours s'il progresse en mathématiques.

Les Résultats : Battre le Jeu

L'équipe a testé GROW sur plus de 800 tâches Minecraft différentes, allant de la navigation dans les grottes à la fabrication d'objets et au combat contre des monstres.

  • Taux de Réussite : GROW a nettement surpassé les méthodes précédentes. Par exemple, dans les « tâches d'interface graphique » (utiliser les menus du jeu pour fabriquer des objets), le taux de réussite a bondi d'environ 39 % à 68 %.
  • Efficacité : Le robot n'a pas seulement gagné plus souvent ; il a gagné plus vite. Il a nécessité moins d'étapes pour accomplir les tâches car il a appris à ignorer le « bruit » et à se concentrer sur les mouvements qui comptaient réellement.
  • Généralisation : Le robot n'a pas simplement mémorisé les jeux spécifiques sur lesquels il s'est entraîné. Il a acquis des compétences générales (comme savoir chercher une cible ou comment utiliser un menu) qui lui ont permis de réussir dans de nouvelles tâches jamais vues qu'il n'avait jamais rencontrées auparavant.

En Résumé

GROW est une méthode plus intelligente pour enseigner aux agents IA à jouer à des jeux en monde ouvert. Au lieu de les submerger avec de longues et désordonnées histoires de leurs sessions de jeu complètes, il décompose le jeu en petites étapes claires. Cela aide l'IA à comprendre exactement quelles actions mènent au succès, lui permettant d'apprendre plus vite, de jouer mieux et de gérer de nouveaux défis sans se perdre.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →