← Derniers articles
🤖 AI

Coachable agents for interactive gameplay

Cet article présente un cadre qui combine des approximateurs de fonction de valeur universels avec des techniques d'entraînement spécialisées pour permettre des modifications de « style » en temps réel et contrôlées par l'utilisateur pour les agents d'apprentissage par renforcement à travers divers domaines tels que les jeux vidéo et la robotique, garantissant qu'ils maintiennent la performance de la tâche tout en s'adaptant à des préférences comportementales spécifiques.

Auteurs originaux : Roberto Capobianco (Sony AI, Zurich, Switzerland), Harm van Seijen (Sony AI, North America, various locations), Nolan D. Bard (Sony AI, North America, various locations), Neil Burch (Sony AI, North Am
Publié 2026-07-02
📖 6 min de lecture🧠 Analyse approfondie

Auteurs originaux : Roberto Capobianco (Sony AI, Zurich, Switzerland), Harm van Seijen (Sony AI, North America, various locations), Nolan D. Bard (Sony AI, North America, various locations), Neil Burch (Sony AI, North America, various locations), Fatima Davelouis (Sony AI, North America, various locations), Josh Davidson (Sony AI, North America, various locations), Alisa Devlic (Sony AI, Zurich, Switzerland), Yunshu Du (Sony AI, North America, various locations), Ishan Durugkar (Sony AI, North America, various locations), Siddhant Gangapurwala (Sony AI, North America, various locations), Daniel Hernandez (Sony AI, North America, various locations), G. Zacharias Holland (Sony AI, North America, various locations), Sahil Jain (Sony AI, North America, various locations), Kenta Kawamoto (Sony AI, Tokyo, Japan), Raksha Kumaraswamy (Sony AI, North America, various locations), Patrick MacAlpine (Sony AI, North America, various locations), Dustin R. Morrill (Sony AI, North America, various locations), Declan Oller (Sony AI, North America, various locations), Francesco Riccio (Sony AI, Zurich, Switzerland), Akanksha Saran (Sony AI, North America, various locations), Craig Sherstan (Sony AI, Tokyo, Japan), Kaushik Subramanian (Sony AI, Zurich, Switzerland), Thomas J. Walsh (Sony AI, North America, various locations), Samuel Barrett (Sony AI, North America, various locations), Kizza N. Frisbee (Sony AI, North America, various locations), Mady Govil (Sony AI, North America, various locations), Johannes Günther (Sony AI, North America, various locations), Varun R. Kompella (Sony AI, North America, various locations), James A. MacGlashan (Sony AI, North America, various locations), Maxwell Svetlik (Sony AI, North America, various locations), Michael D. Thomure (Sony AI, North America, various locations), Jaden B. Travnik (Sony AI, North America, various locations), Kevin Waugh (Sony AI, North America, various locations), Elahe Aghapour (Sony AI, North America, various locations), Florian Fuchs (Sony AI, Zurich, Switzerland), Andreanne Lemay (Sony AI, North America, various locations), Shruti Mishra (Sony AI, Zurich, Switzerland), Takuma Seno (Sony AI, Tokyo, Japan), Peter Stone (Sony AI, North America, various locations), Michael Spranger (Sony AI, Tokyo, Japan), Peter R. Wurman (Sony AI, North America, various locations)

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous avez un personnage de jeu vidéo ou un robot brillant et super intelligent qui a été entraîné pour gagner. Habituellement, ces systèmes d'IA sont comme des athlètes d'élite qui ont maîtrisé une seule façon spécifique de gagner : la manière la plus rapide, la plus efficace, la plus « parfaite ». Si vous leur demandez de nettoyer une pièce, ils le font selon le chemin le plus efficace possible. S'ils conduisent une voiture de course, ils prennent la trajecte parfaite à chaque fois.

Mais que se passe-t-il si vous ne voulez pas que ce soit « parfait » ? Et si vous vouliez qu'ils conduisent comme des casse-cou imprudents, qu'ils nettoient la pièce discrètement parce qu'un bébé dort, ou qu'ils combattent un boss de jeu vidéo en utilisant uniquement un type de magie spécifique ?

Ce document présente une nouvelle façon d'entraîner des agents d'IA pour qu'ils puissent être « coachés » afin de changer de style à la volée, sans avoir besoin d'être réentraînés de zéro.

Voici la décomposition de la manière dont ils ont procédé, en utilisant des analogies simples :

1. Le Problème : L'athlète « Taille Unique »

Considérez un agent d'IA standard comme un pilote de Formule 1 qui a mémorisé un tour parfait. Il est incroyablement rapide, mais si vous lui demandez de « conduire comme un touriste » ou de « conduire agressivement », il ne sait pas comment faire. Il ne connaît qu'une seule façon optimale de gagner. Dans le monde réel, les utilisateurs se soucient souvent de la manière dont une tâche est accomplie, et pas seulement du fait qu'elle soit accomplie.

2. La Solution : Le « Coach de Style »

Les chercheurs ont construit un système où l'IA apprend toute une famille de comportements au lieu de seulement un seul. Ils appellent cela l'apprentissage « conditionné par le style » (Style-Conditioned learning).

Imaginez un coach humain parlant à un athlète. Au lieu de simplement dire « Cours plus vite », le coach dit : « Cours vite, mais garde les bras bas », ou « Cours vite, mais prends des virages larges ». L'athlète apprend à accomplir la tâche principale (courir) mais ajuste ses mouvements secondaires (le style) en fonction des instructions du coach.

Dans ce document, le « coach » est un ensemble d'instructions données à l'IA au moment où elle commence à jouer. L'IA possède un « bouton de contrôle » (appelé vecteur de style) que l'utilisateur peut tourner pour changer le comportement instantanément.

3. Comment ils ont enseigné à l'IA (La salle de sport d'entraînement)

Pour enseigner ces styles à l'IA, ils ne se sont pas contentés de la laisser jouer normalement. Ils ont créé des scénarios d'entraînement spéciaux :

  • Le Système de Récompense : Ils ont donné à l'IA deux types de points.
    1. Points de Tâche : Des points pour gagner la course, battre l'ennemi ou avancer.
    2. Points de Style : Des points pour le faire d'une certaine manière. Par exemple, « Si tu utilises des flèches de feu, reçois des points supplémentaires », ou « Si tu conduis lentement pour économiser du carburant, reçois des points supplémentaires ».
  • Le Cerveau « Universel » : Ils ont utilisé un type spécial de cerveau d'IA (appelé UVFA) qui peut comprendre que « Gagner » est l'objectif, mais que « Comment vous gagnez » peut changer. C'est comme un chef qui sait préparer un excellent steak (la tâche) mais qui peut instantanément passer d'un assaisonnement au sel, au poivre ou à l'huile de truffe (le style) selon la demande du client.

4. Les Trois Essais Routiers

L'équipe a testé ce cadre d'« Agent Coachable » dans trois mondes très différents pour prouver qu'il fonctionne partout :

  • La Voiture de Course (Gran Turismo 7) :
    Ils ont entraîné une IA à conduire une voiture de course. Habituellement, l'IA conduit pour gagner le temps le plus rapide. Avec le nouveau système, ils pouvaient dire à l'IA : « Conduis pour économiser du carburant » ou « Conduis pour économiser les pneus ».

    • Le Résultat : L'IA a appris à conduire plus lentement et plus prudemment pour étendre sa réserve de carburant de 60 %, ou à déraper dans les virages pour le style, tout en terminant la course. Elle pouvait même recevoir l'ordre de « conduire agressivement » ou « conduire prudemment » simplement en tournant un cadran.
  • Le Héros de Jeu Vidéo (Horizon Forbidden West) :
    C'était le test majeur. L'IA jouait le rôle d'un héros combattant de gigantesques animaux robots. Le jeu possède de nombreuses armes, pièges et pouvoirs élémentaires (feu, glace, électricité).

    • Le Résultat : Les chercheurs pouvaient dire à l'IA : « Combat en utilisant uniquement des pièges », ou « Utilise uniquement des armes de feu », ou « N'utilise pas ton arme la plus puissante ».
    • L'IA n'a pas seulement obéi aveuglément ; elle est devenue intelligente. Si on lui disait d'utiliser la « Glace », elle choisissait une arme de glace faible pour geler l'ennemi, puis passait à une arme puissante pour achever l'adversaire pendant qu'il était gelé. Elle a appris à combiner les styles, comme utiliser une arme spécifique et un effet élémentaire spécifique en même temps.
  • Le Robot Marcheur (Humanoïde) :
    Ils ont entraîné un robot numérique à marcher sur un sol.

    • Le Résultat : Ils pouvaient dire au robot de marcher avec une « foulée courte » ou une « foulée longue », et même changer la pose de ses bras (comme tenir un plateau ou balancer les bras). Le robot pouvait passer d'un style de marche à un autre instantanément tout en gardant son équilibre.

5. La Magie du Contrôle au « Temps Réel » (Runtime)

La partie la plus importante de ce document est que l'utilisateur n'a pas besoin d'attendre que l'IA apprenne un nouveau style. L'IA apprend tous les styles en même temps pendant l'entraînement.

Lorsque l'utilisateur joue ou utilise le robot, il peut choisir le style en temps réel.

  • Analogie : Imaginez un lecteur de musique. Habituellement, vous devez télécharger une nouvelle chanson pour entendre un genre différent. Avec ce système, l'IA est comme un DJ qui a tous les genres en tête. Vous pouvez appuyer sur un bouton, et elle passe instantanément du « Jazz » (conduite calme, sécurisée) au « Rock » (conduite rapide, agressive) sans arrêter la musique.

Résumé

Ce document montre que nous pouvons rendre les agents d'IA flexibles. Au lieu d'être un robot rigide qui ne connaît qu'une seule façon de faire les choses, ces « Agents Coachables » peuvent adapter leur personnalité et leur stratégie à la volée. Qu'il s'agisse d'une voiture de course économisant du carburant, d'un héros de jeu vidéo utilisant des armes spécifiques ou d'un robot adoptant une démarche particulière, l'utilisateur décide de la manière dont le travail est accompli, et pas seulement du fait qu'il soit accompli.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →