← Derniers articles
🤖 AI

AGI Maze as a Benchmark Framework for World-Modeling Agents

L'article présente AGI Maze, un cadre de référence léger basé sur une grille conçu pour exposer l'incapacité des modèles de langage de grande taille actuels à construire des représentations persistantes et manipulables de l'état du monde, nécessaires à la résolution de tâches partielles et étatiques, même lorsqu'ils sont dotés de mécanismes de mémoire de travail.

Auteurs originaux : Alexey Potapov

Publié 2026-07-02
📖 6 min de lecture🧠 Analyse approfondie

Auteurs originaux : Alexey Potapov

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

L'idée principale : Pourquoi les chatbots « intelligents » se perdent dans un labyrinthe

Imaginez que vous avez un ami très intelligent capable d'écrire de la poésie, de résoudre des problèmes mathématiques et de raconter des blagues. Cet ami est comme un Grand Modèle de Langage (LLM). Il est incroyable pour prédire quel mot vient ensuite dans une phrase.

Cependant, l'article soutient que si vous placez cet ami dans un labyrinthe sombre et sinueux où il ne peut voir que le mur juste devant lui, il se perd. Il peut deviner l'étape suivante, mais il ne peut pas construire une carte mentale de l'ensemble du labyrinthe dans sa tête. Il est excellent pour terminer une histoire, mais mauvais pour simuler un monde.

Pour prouver cela, les auteurs ont créé un nouveau test appelé AGI Maze.


Qu'est-ce que l'AGI Maze ? (Le « jeu vidéo textuel »)

Considérez l'AGI Maze comme un jeu vidéo auquel vous jouez entièrement par messages textuels.

  • La configuration : Vous êtes dans une grille (comme un échiquier). Vous avez un point de départ, un coffre au trésor, une clé et une sortie.
  • Le piège : Vous ne voyez pas la carte. Vous ne savez pas où se trouvent les murs. Vous savez seulement d'où vous êtes parti.
  • Le gameplay : Vous tapez « Aller à droite ». Le jeu répond : « Vous avez heurté un mur ». Puis vous tapez « Aller en bas ». Le jeu dit : « Vous avez trouvé une clé ! ».
  • Le but : Vous devez comprendre la disposition du labyrinthe, trouver la clé, ouvrir le coffre et vous échapper — tout en vous souvenant d'où vous êtes passé et de l'emplacement des murs, sans jamais voir d'image.

Pourquoi est-ce difficile ?
Le labyrinthe contient des « pièges » pour rendre l'exercice encore plus dur :

  1. Les rivières : Si vous marchez sur une rivière, vous êtes emporté automatiquement en aval, mais le jeu ne vous dit pas dans quelle direction l'eau coule. Vous devez deviner.
  2. Les fosses : Si vous tombez dans un trou, vous pourriez réapparaître dans une partie totalement différente du labyrinthe.
  3. Limite de temps : Vous n'avez qu'un certain nombre de pas pour terminer. Si vous errerez sans but, vous manquerez de temps.

L'expérience : L'IA peut-elle le résoudre ?

Les auteurs ont testé plusieurs modèles d'IA populaires (comme GPT-4o et Gemini) sur ces labyrinthes. Ils ont traité l'IA comme un joueur humain qui ne dispose que des descriptions textuelles.

Les résultats ont été surprenants :

  • L'IA « Vanilla » (standard) : Lorsque l'IA essayait simplement de deviner le prochain mouvement en se basant sur l'historique de la discussion, elle échouait lamentablement. Sur de petits labyrinthes, elle faisait souvent pire qu'un programme informatique qui choisit une direction au hasard (une « marche aléatoire » ou random-walk).
  • Le problème : L'IA ne construisait pas de carte dans son « esprit ». Elle se contentait de deviner le mot suivant en fonction des dernières phrases. Elle ne pouvait pas maintenir une image stable de « où je suis » et de « où sont les murs ».

L'astuce du « Carnet de notes »

Les auteurs ont réalisé que les humains ne peuvent pas résoudre un labyrinthe complexe sans crayon et papier. Nous dessinons la carte au fur et à mesure. Ils ont donc donné à l'IA un « carnet de notes » (en la laissant écrire des notes dans son propre historique de discussion avant de faire un mouvement).

  • La configuration : Avant que l'IA ne dise « Aller à droite », elle écrit d'abord une note : « Je suis en bas à gauche. Je suis monté et j'ai heurté un mur. Je pense que la clé est à droite. »
  • Le résultat : Cela a considérablement aidé les modèles d'IA les plus puissants. Ils sont passés d'un échec total à la résolution d'environ 60 à 70 % des labyrinthes.
  • Le bémol : Même avec le carnet de notes, l'IA éprouvait toujours des difficultés. Elle ne construisait pas naturellement une carte parfaite et structurée. Elle se contentait d'écrire des notes désordonnées. Et pour les modèles d'IA plus petits et moins puissants, l'astuce du carnet de notes n'a servi à rien — ils se sont quand même perdus.

Que nous dit cela ?

L'article conclut par quelques points clés :

  1. Prédiction vs Compréhension : L'IA actuelle est excellente pour prédire le mot suivant dans une phrase (comme finir une histoire), mais elle est mauvaise pour simuler un monde changeant (comme naviguer dans un labyrinthe). Elle ne maintient pas naturellement un « modèle mental » de la réalité.
  2. La mémoire est difficile : Donner simplement à l'IA une longue liste de messages passés (sa « mémoire ») ne suffit pas. Elle doit organiser activement ces informations en une carte ou un plan, ce qu'elle peine actuellement à faire de manière autonome.
  3. Le test est un outil, pas un score final : Les auteurs ne disent pas que « l'IA est inutile ». Ils disent : « Voici un outil spécifique (AGI Maze) pour nous montrer précisément l'IA échoue ». Cela souligne que pour construire de véritables agents intelligents, nous devons leur apprendre à construire et à utiliser des cartes internes du monde, et pas seulement à discuter.

Résumé de l'analogie

  • Les LLM actuels sont comme un guide touristique qui a mémorisé un script. Si vous lui demandez de décrire une ville qu'il n'a jamais visitée, il peut deviner les mots, mais si vous lui demandez de naviguer dans un labyrinthe les yeux bandés, il trébuche car il n'a pas de carte.
  • L'AGI Maze est le test du labyrinthe les yeux bandés.
  • Le « Carnet de notes » consiste à donner au guide touristique un stylo et du papier. Cela l'aide un peu, mais il n'est toujours pas un cartographe naturel.

L'article soutient que pour que l'IA devienne véritablement intelligente (AGI), elle doit apprendre à dessiner ses propres cartes et à les mettre à jour au fur et à mesure de son exploration, plutôt que de simplement deviner la phrase suivante.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →