ASH: Agents that Self-Hone via Embodied Learning
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Imaginez que vous essayez d'apprendre à jouer à un jeu vidéo très long et compliqué, comme Pokémon ou The Legend of Zelda, mais que vous n'avez ni manuel d'instructions, ni professeur, ni personne pour vous dire quels boutons appuyer. La plupart des programmes informatiques qui tentent de faire cela s'embourbent après quelques heures car ils s'appuient sur des règles préécrites ou sur d'énormes quantités de données soigneusement étiquetées par des humains.
L'article présente un nouveau système appelé ASH (Agents that Self-Hone via Embodied Learning). Considérez ASH non pas comme un robot suivant un script, mais comme un joueur humain curieux qui sait utiliser Google.
Voici comment ASH fonctionne, décomposé en étapes simples :
1. Le moment « bloqué »
ASH commence à jouer au jeu. Il possède une mémoire à court terme (ce qui s'est passé au cours des 30 dernières secondes) et une mémoire à long terme (les moments importants qu'il a déjà vus). Il joue jusqu'à ce qu'il heurte un mur. Peut-être ne sait-il pas comment combattre un monstre, ou ne sait-il pas quel chemin prendre dans un labyrinthe. Dans les termes de l'article, il se « bloque ».
2. La « recherche Google »
Lorsque ASH se bloque, il n'abandonne pas. Au lieu de cela, il examine ce qu'il vient de voir à l'écran et se rend sur Internet (plus précisément, une immense collection de vidéos YouTube) pour trouver d'autres personnes jouant au jeu. Il recherche des vidéos qui ressemblent exactement au moment où il est actuellement bloqué.
3. Le « filtre intelligent »
Internet est plein de bruit. ASH ne regarde pas des vidéos au hasard ; il utilise un outil spécial pour trouver les moments clés. Imaginez regarder une vidéo de 20 heures où quelqu'un joue à un jeu ; vous n'avez pas besoin de regarder tout le film pour apprendre à combattre un chef. Vous avez juste besoin de voir les 30 secondes spécifiques où ils trouvent la stratégie. ASH trouve automatiquement ces « meilleurs moments » et les enregistre dans sa mémoire à long terme.
4. La « rétro-ingénierie »
Voici la partie délicate : les vidéos d'Internet que ASH trouve montrent généralement seulement l'écran, pas les pressions de boutons. ASH possède un « traducteur » (appelé Modèle de Dynamique Inverse) qui regarde la vidéo et devine : « D'accord, pour passer de cet écran à celui-là, le joueur a dû appuyer sur 'A' puis sur 'Haut' ». Il transforme la vidéo muette en un ensemble d'instructions.
5. La boucle « d'amélioration personnelle »
Maintenant, ASH prend ces nouvelles instructions et les pratique. Il met à jour son propre cerveau (sa politique) afin que la prochaine fois qu'il se bloque, il sache quoi faire. Il retourne ensuite jouer au jeu. S'il se bloque à nouveau plus tard sur un problème différent, il répète tout le processus : se bloquer, chercher sur Internet, apprendre l'astuce, et continuer.
Les résultats : Pourquoi cela compte
Les chercheurs ont testé ASH dans deux jeux très différents :
- Pokémon Émeraude : Un jeu stratégique où vous voyagez, attrapez des monstres et combattez.
- The Legend of Zelda : Le Minish Cap : Un jeu d'action où vous courez, sautez, résolvez des énigmes et combattez des ennemis en temps réel.
Ils ont comparé ASH à d'autres méthodes d'IA :
- L'apprenant « manuel scolaire » : Ces systèmes ont essayé d'apprendre à partir d'un énorme ensemble de données de mouvements pré-étiquetés. Ils se sont bloqués tôt car ils ne pouvaient pas gérer de nouvelles situations qu'ils n'avaient jamais vues auparavant.
- Le modèle « génie » : Ce sont d'énormes modèles d'IA qui tentent de deviner la réponse sans entraînement. Ils « hallucinent » souvent (inventent des choses) et se heurtent à des murs ou parlent à des personnages inexistants.
- ASH : ASH n'a cessé de s'améliorer. Tandis que les autres systèmes ont arrêté de progresser après environ 6 heures, ASH a continué pendant 8 heures, apprenant de nouvelles compétences comme le combat, l'attrape de monstres et la résolution d'énigmes. Il a accompli presque tous les objectifs majeurs dans les deux jeux.
La vue d'ensemble
L'article affirme que ASH prouve que vous n'avez pas besoin qu'un humain écrive un système de récompense ou étiquette chaque vidéo pour enseigner à une IA une tâche longue et complexe. Au contraire, si vous donnez à une IA la capacité de se bloquer, chercher de l'aide sur Internet et apprendre de cela, elle peut s'enseigner elle-même à maîtriser de longues aventures ouvertes.
C'est comme enseigner à un enfant à faire du vélo non pas en écrivant un manuel, mais en le laissant tomber, en le faisant regarder une vidéo de quelqu'un d'autre qui fait du vélo, puis en essayant à nouveau. ASH est le premier système à réussir à réaliser cette boucle automatiquement dans des jeux vidéo complexes.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.