← Derniers articles
💻 computer science

Training One Model to Master Cross-Level Agentic Actions via Reinforcement Learning

Le document présente CrossHA, un modèle agentique unifié entraîné via un nouveau pipeline combinant le réglage fin supervisé et l'optimisation de politique relative de groupe multi-tours pour sélectionner et basculer de manière autonome entre des espaces d'action hétérogènes, atteignant ainsi des performances et une adaptabilité de pointe dans des tâches dynamiques à long horizon au sein de l'environnement Minecraft.

Auteurs originaux : Kaichen He, Zihao Wang, Muyao Li, Anji Liu, Yitao Liang

Publié 2026-06-05
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Kaichen He, Zihao Wang, Muyao Li, Anji Liu, Yitao Liang

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous appreniez à un robot à jouer au jeu vidéo Minecraft. Par le passé, les chercheurs devaient construire des « cerveaux » distincts pour chaque partie du jeu. Un cerveau était bon pour se déplacer (en utilisant des commandes simples, étape par étape), un autre était bon pour cliquer sur des menus (avec des mouvements de souris précis), et un troisième était bon pour utiliser des raccourcis de haut niveau (comme « aller vers l'arbre le plus proche »).

Le problème est que ces robots étaient rigides. Si une tâche nécessitait de marcher puis de cliquer sur un menu, le robot devenait confus ou bloqué parce qu'il était entraîné à n'utiliser qu'un seul type de « langage » à la fois.

La Grande Idée : L'Agent « Couteau Suisse »
Cette publication présente CrossHA, un nouveau type d'agent IA qui agit comme un chef cuisinier possédant une cuisine complète. Au lieu d'être forcé d'utiliser uniquement une cuillère ou uniquement un couteau, CrossHA apprend à observer l'ingrédient (la tâche) et décide instantanément : « Ai-je besoin d'un hachage grossier (un mouvement simple) ou d'une tranche fine (un clic précis) en ce moment ? »

C'est le premier modèle capable de passer de manière fluide entre différents « langages d'action » à la volée, sans qu'un humain ne lui indique quel langage utiliser à chaque étape.

Comment ils l'ont enseigné (La recette de l'entraînement)

Les chercheurs n'ont pas simplement déversé des données sur le modèle ; ils ont utilisé un pipeline d'entraînement en trois étapes, similaire à la façon dont un humain apprend une compétence complexe :

  1. La phase de « Dégustation » (Affinage supervisé) :
    D'abord, ils ont montré au modèle des milliers d'exemples de personnes jouant au jeu en utilisant différentes méthodes (certaines marchaient, d'autres cliquaient, d'autres utilisaient des raccourcis). L'objectif ici était simplement d'enseigner au modèle le « vocabulaire » de toutes ces différentes méthodes afin qu'il puisse toutes les comprendre. C'était comme apprendre à un étudiant à lire l'anglais, l'espagnol et le français, mais sans encore lui demander d'écrire une histoire.

  2. La phase de « Sprint » (RL à tour unique) :
    Ensuite, ils ont donné au modèle des défis courts, d'une seule étape. Si le modèle tentait de résoudre un problème en utilisant le mauvais « langage » (par exemple, essayer de traverser une porte verrouillée au lieu de cliquer sur la poignée), il recevait un score faible. S'il choisissait le bon outil pour la tâche, il recevait une récompense. Cela a appris au modèle à faire des choix rapides et intelligents sur quel outil choisir pour un instant donné.

  3. La phase de « Marathon » (RL multi-tours) :
    Enfin, ils ont laissé le modèle jouer des parties complètes et longues. L'objectif n'était pas seulement de réussir une étape, mais de terminer toute la quête de manière efficace. Le modèle a appris que parfois, utiliser une méthode « rapide mais grossière » est préférable pour traverser un champ, mais que passer à une méthode « lente mais précise » est nécessaire pour fabriquer un objet délicat. Il a appris à équilibrer vitesse et précision sur un long voyage.

Les Résultats : Pourquoi c'est important

Les chercheurs ont testé ce modèle sur plus de 800 tâches différentes dans Minecraft, allant de l'abattage d'arbres à la fabrication d'objets complexes en passant par le combat contre des monstres.

  • L'ancienne méthode : Les robots entraînés pour n'utiliser qu'une seule méthode (comme seulement marcher) étaient excellents pour marcher mais médiocres pour la fabrication. Ils étaient comme une personne qui ne sait que courir mais ne sait pas ouvrir une porte.
  • La méthode CrossHA : Le nouveau modèle était le meilleur en tout. Il ne s'est pas contenté de moyenner les scores ; il excellait parce qu'il savait exactement quand changer de vitesse.

L'analogie du « Conducteur Intelligent » :
Imaginez conduire une voiture.

  • Un robot à action fixe est comme un conducteur qui ne connaît que l'autoroute. S'il arrive sur un chemin de terre, il s'écrase. S'il arrive sur un parking, il se perd.
  • CrossHA est comme un conducteur expérimenté qui sait quand passer une vitesse élevée pour l'autoroute (efficacité) et quand passer une vitesse basse et diriger avec soin pour un créneau serré (précision). Il n'a pas besoin d'un copilote pour lui dire quand changer de vitesse ; il ressent simplement la route et s'adapte.

L'essentiel

L'article affirme qu'en entraînant un seul modèle pour maîtriser tous ces différents « espaces d'action » et en le laissant apprendre grâce à l'apprentissage par renforcement (essai et erreur avec des récompenses), ils ont créé un agent nettement plus intelligent, plus flexible et plus efficace que les modèles précédents qui étaient limités à un seul type d'action.

Ils l'ont prouvé en montissant que le modèle pouvait gérer plus de 800 défis différents dans un jeu complexe en monde ouvert, surpassant ainsi toutes les autres méthodes existantes. Le code et les modèles sont désormais ouverts à tous.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →