← Derniers articles
🤖 AI

Impartial Games: A Challenge for Reinforcement Learning

Cet article démontre que les algorithmes d'apprentissage par renforcement de type AlphaZero échouent à atteindre une maîtrise de niveau expert dans les jeux impartiaux comme le Nim en raison d'un goulot d'étranglement représentationnel fondamental dans l'apprentissage de principes mathématiques abstraits, révélant qu'un simple réglage des hyperparamètres ne peut surmonter leur incapacité à généraliser au-delà des états mémorisés.

Auteurs originaux : Bei Zhou, Søren Riis

Publié 2026-09-09
📖 6 min de lecture🧠 Analyse approfondie

Auteurs originaux : Bei Zhou, Søren Riis

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Dans le monde de l'intelligence artificielle, un type spécifique de programme informatique est récemment devenu célèbre pour sa capacité à maîtriser des jeux de stratégie complexes. En jouant des millions de parties contre lui-même, ces programmes apprennent à effectuer des coups qui surprennent souvent même les plus grands experts humains. Ils sont devenus des champions dans des jeux comme les échecs et le Go, où le succès dépend de la reconnaissance de motifs, de l'évaluation de positions et de la planification de nombreuses étapes à l'avance. L'idée sous-jacente est que si une machine peut apprendre à gagner en comprenant le flux d'un jeu, elle pourrait éventuellement apprendre à résoudre n'importe quel problème complexe. Cependant, ce succès a créé un faux sentiment de sécurité. Il s'avère que la manière dont ces machines apprennent n'est pas universelle. Il existe une classe spécifique de jeux où les règles sont simples, les pièces sont partagées par les deux joueurs, et la stratégie gagnante repose sur une logique mathématique cachée plutôt que sur la reconnaissance de formes. Dans ces jeux, les systèmes d'intelligence artificielle les plus avancés se heurtent à un mur, échouant à apprendre les principes mêmes qui rendent le jeu soluble pour les humains.

Des chercheurs de l'Imperial College London et de la Queen Mary University of London ont décidé d'étudier cet angle mort en utilisant un jeu appelé Nim. Le Nim est un jeu se jouant avec plusieurs piles d'objets, où deux joueurs se relaient pour retirer n'importe quel nombre d'objets d'une seule pile. Le but est d'être celui qui prend le dernier objet. Bien que le jeu paraisse simple, le secret pour gagner réside dans un calcul mathématique spécifique impliquant les nombres binaires des tailles des piles. Pour un humain, apprendre cette règle est une question de compréhension d'un concept abstrait unique. Pour l'intelligence artificielle, le défi est différent. Les chercheurs voulaient voir si les mêmes algorithmes d'apprentissage qui ont conquis les échecs pouvaient apprendre à gagner au Nim, et si non, pourquoi. Ils ont construit une version personnalisée du célèbre système d'apprentissage AlphaZero et l'ont entraînée à jouer au Nim sur des plateaux de tailles croissantes, observant attentivement l'évolution de la compréhension de l'ordinateur.

Les résultats furent frappants et révélateurs. Lorsque les chercheurs ont testé le système sur un petit plateau de Nim avec cinq piles, l'ordinateur a appris à bien jouer. Il pouvait gagner de manière constante, agissant comme un champion qui sait comment commencer une partie et la diriger vers la victoire. Cependant, dès que la taille du plateau passait à six ou sept piles, les performances du système s'effondraient. L'ordinateur cessait d'apprendre à gagner. Au lieu de trouver les bons coups, il commençait à deviner, ne performant pas mieux que s'il avait choisi ses coups de manière aléatoire. Les chercheurs ont découvert que le problème n'était pas que le jeu était trop complexe ou que l'ordinateur avait besoin de plus de temps pour l'entraînement. Le problème était fondamental dans la manière dont le cerveau de l'ordinateur, un type de réseau de neurones, traite l'information. Ces réseaux sont excellents pour repérer des connexions entre les choses, comme reconnaître qu'une certaine disposition de pièces d'échecs mène généralement à une victoire. Mais ils éprouvent d'immenses difficultés avec un type de logique spécifique appelé parité, qui est essentiellement une façon de compter si un nombre est pair ou impair à travers un groupe d'éléments. Dans le Nim, le coup gagnant dépend entièrement de ce type de logique de comptage.

Pour comprendre pourquoi cela importe, les chercheurs ont introduit une nouvelle façon de mesurer la compétence d'une intelligence artificielle. Ils ont distingué un « champion » d'un « expert ». Un champion est un joueur capable de gagner depuis la position de départ en guidant le jeu vers un terrain familier où il sait quoi faire. Un expert, cependant, peut effectuer le coup parfait à partir de n'importe quelle position sur le plateau, même celles qu'il n'a jamais vues auparavant. L'étude a montré que l'intelligence artificielle pouvait devenir un champion sur de petits plateaux, en mémorisant les bons coups d'ouverture. Mais elle échouait à devenir un expert. Lorsque le jeu passait dans les phases médianes ou finales, ou lorsque le plateau était plus grand, l'ordinateur ne parvenait pas à trouver le coup correct. Son guide interne, censé lui indiquer quels coups sont bons, devenait confus. Il attribuait une probabilité élevée à un coup perdant et ignorait le coup gagnant. Même lorsque l'ordinateur exécutait des millions de simulations pour vérifier ses choix, il ne pouvait pas corriger son erreur initiale car sa supposition de départ était trop éloignée de la réalité.

Les chercheurs ont testé si cet échec était dû à la méthode d'apprentissage elle-même ou à la difficulté de la logique du jeu. Ils ont créé une version du jeu où les deux joueurs contrôlaient des piles différentes et n'avaient pas besoin d'utiliser la logique de parité pour gagner. Dans ce jeu modifié, la même intelligence artificielle a appris rapidement et facilement, prouvant que le système d'apprentissage était capable. Cela a confirmé que le problème ne venait pas du processus d'entraînement, mais du type spécifique de mathématiques requis pour le jeu original. L'ordinateur ne pouvait tout simplement pas apprendre la règle abstraite de la parité à partir des données qu'il générait en jouant contre lui-même. Le bruit dans les données, causé par les erreurs de l'ordinateur lors de sa phase initiale d'apprentissage, rendait impossible pour le réseau de déceler le motif sous-jacent.

Cette découverte remet en question l'idée selon laquelle l'intelligence artificielle actuelle peut résoudre n'importe quel problème avec suffisamment de données et de puissance de calcul. Elle suggère qu'il existe certains types de raisonnement logique que ces systèmes ne peuvent pas apprendre par eux-mêmes. Les chercheurs proposent que pour véritablement maîtriser des jeux comme le Nim, et peut-être d'autres problèmes complexes reposant sur des mathématiques abstraites, l'intelligence artificielle future devra être construite différemment. Ils suggèrent de combiner la puissance de reconnaissance de formes des systèmes actuels avec un module de raisonnement symbolique distinct, capable de gérer ces règles logiques spécifiques. Tant qu'un tel changement n'aura pas été opéré, ces puissants systèmes d'apprentissage resteront des champions dans certains domaines, mais resteront aveugles à la logique fondamentale d'autres, incapables d'atteindre le niveau de véritable expertise qu'un humain peut atteindre grâce à une seule intuition.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →