← Derniers articles
🤖 machine learning

Superhuman AI for Generals.io Using Self-Play Reinforcement Learning

Cet article présente un agent d'IA surhumain pour le jeu de stratégie en temps réel Generals.io qui atteint le classement n°1 du classement public en exploitant un simulateur natif JAX avec une accélération de 10 000x pour permettre l'entraînement de bout en bout efficace d'une politique de vision transformer via l'apprentissage par renforcement par auto-jeu.

Auteurs originaux : Matej Straka, Viliam Lisý, Martin Schmid

Publié 2026-06-23
📖 7 min de lecture🧠 Analyse approfondie

Auteurs originaux : Matej Straka, Viliam Lisý, Martin Schmid

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez un champ de bataille numérique appelé Generals.io. Il s'agit d'un jeu de stratégie en temps réel où deux commandants (ou deux équipes) dirigent des armées sur une grille. Ils ne peuvent pas voir toute la carte à la fois ; ils ne voient que la terre qu'ils possèdent et la zone immédiate autour de leurs troupes. Le reste est caché dans un « brouillard de guerre ». L'objectif est simple : capturer le quartier général ennemi (le Général) tout en protégeant le vôtre.

Ce document décrit comment une équipe de chercheurs a conçu une IA qui est si performante qu'elle a battu les meilleurs joueurs humains au monde. Voici l'histoire de la façon dont ils y sont parvenus, décomposée en concepts simples.

1. Le simulateur « Super-Rapide »

Avant de pouvoir entraîner l'IA, ils avaient besoin d'un moyen de s'exercer. Par le passé, entraîner une IA sur ce jeu revenait à essayer d'apprendre à conduire en regardant une voiture avancer d'un centimètre par heure. C'était trop lent.

Les chercheurs ont construit un nouveau « simulateur » (une version numérique du jeu) en utilisant un outil spécial appelé JAX. Considérez cela comme le passage d'un vélo à un jet supersonique.

  • L'ancienne méthode : La version précédente pouvait exécuter environ 3 500 étapes de jeu par seconde sur un ordinateur standard.
  • La nouvelle méthode : Leur nouvelle version exécute 50 millions d'étapes par seconde sur une seule carte graphique.
  • Le résultat : C'est une accélération de 10 000x. Cela signifie que l'IA peut jouer des millions de parties dans le temps qu'il faut à un humain pour en jouer une seule. Cette vitesse a supprimé le principal goulot d'étranglement : l'IA pouvait enfin apprendre assez vite pour devenir vraiment douée.

2. Le camp d'entraînement par « Auto-jeu » (Self-Play)

Au lieu d'enseigner à l'IA en lui montrant des vidéos d'experts humains (ce qui revient à apprendre aux échecs en ne montant que des parties de grands maîtres), ils ont laissé l'IA jouer contre elle-même.

  • La méthode : L'IA joue des millions de parties contre des copies d'elle-même.
  • La récompense : Le jeu est très simple : soit vous gagnez (+1 point), soit vous perdez (-1 point). Il n'y a pas de « prix de participation » ou de points pour avoir tué quelques soldats ennemis. Vous ne recevez une récompense que si vous capturez le Général ennemi.
  • Le défi : Comme la récompense est très rare (vous ne l'obtenez qu'à la toute fin d'une longue partie), il est difficile pour l'IA de comprendre ce qu'elle a bien fait. C'est comme essayer d'apprendre à faire un gâteau en goûtant seulement le produit final, sans aucun retour sur le fait que vous avez mis trop de sucre ou pas assez de farine.

3. La recette secrète : Ce qui a réellement fonctionné

Les chercheurs ont testé de nombreuses différentes « recettes » pour voir ce qui rendait l'IA surhumaine. Ils ont découvert que certaines choses que les gens pensaient nécessaires étaient en fait inutiles, tandis que quelques astuces simples faisaient toute la différence.

  • Pas besoin de « fiches de triche » : Ils n'ont pas eu besoin de donner à l'IA des règles complexes ou des récompenses ajustées à la main pour les « bonnes » actions (comme capturer un château). Le simple signal « Gagner ou Perdre » suffisait, grâce au simulateur ultra-rapide.
  • L'étudiant « Moyen » (EMA) : Dans de nombreux systèmes d'IA, on utilise la toute dernière version de l'IA qui a terminé l'entraînement. Les chercheurs ont découvert que prendre une Moyenne Mobile Exponentielle (EMA) du cerveau de l'IA au fil du temps fonctionnait mieux.
    • Analogie : Imaginez un étudiant qui passe un examen chaque jour. La « dernière itération » est simplement son score le dernier jour. L'« EMA » revient à prendre la moyenne de ses performances sur tout le mois. Les chercheurs ont trouvé que « l'étudiant moyen » était en fait plus constant et plus intelligent que l'étudiant lors de sa meilleure (ou pire) journée isolée.
  • Le filtrage des « bonnes » parties (Top-Advantage Filtering) : L'IA a joué des millions de parties, mais la plupart étaient ennuyeuses ou aléatoires. Les chercheurs ont réalisé qu'ils n'avaient pas besoin d'apprendre de chaque partie. Ils n'ont conservé que les 25 % de parties où l'IA avait un avantage clair et ont appris de celles-ci.
    • Analogie : Si vous essayez d'apprendre à nager, vous n'avez pas besoin de regarder chaque fois que vous vous agitez dans l'eau. Vous avez seulement besoin d'étudier les moments où vous avez nagé de manière fluide et efficace. Cela a rendu l'entraînement beaucoup plus rapide et efficace.
  • Commencer petit : Ils n'ont pas commencé l'IA sur une grande carte. Ils ont commencé avec les Généraux très proches les uns des autres afin que l'IA puisse apprendre à gagner rapidement. Ensuite, ils ont lentement éloigné les Généraux, laissant l'IA apprendre la stratégie à long terme étape par étape.

4. Les résultats : Battre les humains

Après avoir entraîné l'IA pendant quatre jours sur des ordinateurs puissants, l'IA (surnommée « Average Joe ») s'est présentée sur le classement public.

  • Classement : Elle a atteint la 1ère place sur plus de 5 000 joueurs humains.
  • L'écart : Elle a battu le deuxième joueur humain par une marge énorme. En fait, l'écart entre l'IA et le deuxième humain était de la même taille que l'écart entre le deuxième humain et le 25e humain.
  • Face à face : Lorsqu'ils ont joué directement contre les deux meilleurs joueurs humains, l'IA a gagné 199 parties et n'en a perdu que 70.
  • Contre les anciens bots : Elle a également écrasé le meilleur ancien bot et le meilleur bot « basé sur des règles » (qui utilise des formules mathématiques plutôt que l'apprentissage) avec un taux de victoire parfait de 100 %.

5. Ce que l'IA « voyait »

Les chercheurs ont regardé à l'intérieur du cerveau de l'IA pour voir si elle pensait comme un humain.

  • Le détecteur de « Brouillard » : Ils ont trouvé une partie spécifique du cerveau de l'IA qui semblait suivre l'emplacement du Général ennemi pour le localiser.
  • L'analogie : Imaginez que vous jouez à cache-cache dans l'obscurité. Au début, vous pensez que la personne peut être n'importe où. Puis, en entendant un bruit ou en voyant une ombre, vous réduisez les possibilités à quelques endroits. Enfin, vous les repérez. Le cerveau de l'IA a fait exactement cela : il a commencé par une supposition, a affiné ses recherches à mesure qu'il recueillait des indices, puis a fini par « verrouiller » la position du Général ennemi, même s'il ne pouvait pas le voir directement.

Résumé

Ce document prouve que vous n'avez pas besoin de règles complexes et pré-conçues ou de quantités massives de données humaines pour créer une IA surhumaine pour les jeux de stratégie. Si vous avez un simulateur suffisamment rapide et une récompense simple de type « Gagner ou Perdre », un algorithme d'apprentissage standard peut découvrir le reste par lui-même. Les ingrédients clés étaient la vitesse, la patience (la moyenne des résultats) et le fait de se concentrer uniquement sur les parties les plus informatives.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →