← Derniers articles
💬 NLP

Why Do LLM Agents Fail in Exploring New Environments? A World-Modeling Perspective

Cet article identifie l'« effondrement de l'exploration » comme un mode de défaillance clé où les agents LLM perdent la capacité de découvrir de nouvelles solutions dans des environnements inconnus lors de l'apprentissage par renforcement, et propose SPA, une méthode qui améliore la performance en ancrant d'abord l'agent dans la prédiction d'état et de transition via un réglage fin supervisé par auto-expérience avant d'optimiser pour la récompense.

Auteurs originaux : Shiqi Chen, Tongyao Zhu, Zian Wang, Jinghan Zhang, Kangrui Wang, Ruochen Zhou, Siyang Gao, Teng Xiao, Yee Whye Teh, Junxian He, Manling Li

Publié 2026-09-10
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Shiqi Chen, Tongyao Zhu, Zian Wang, Jinghan Zhang, Kangrui Wang, Ruochen Zhou, Siyang Gao, Teng Xiao, Yee Whye Teh, Junxian He, Manling Li

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez un programme informatique conçu pour penser et agir comme un humain, capable de résoudre des énigmes, de naviguer dans des mondes virtuels ou même d'utiliser un navigateur Web pour trouver des informations. Ces programmes, connus sous le nom de modèles de langage de grande taille, sont entraînés sur de vastes quantités de textes provenant d'Internet, apprenant à prédire quel mot vient ensuite dans une phrase. Lorsque les chercheurs demandent à ces modèles d'agir comme des agents — en prenant des mesures pour atteindre un objectif — ils utilisent souvent une méthode appelée apprentissage par renforcement. Il s'agit d'un processus où le modèle essaie différentes actions, reçoit un retour sur sa réussite ou son échec, et apprend progressivement à répéter les actions qui mènent au succès. C'est un moyen puissant d'enseigner à une machine comment faire des choses pour lesquelles elle n'a pas été explicitement programmée. Cependant, un problème critique survient lorsque ces agents sont placés dans des situations nouvelles et inconnues. Bien qu'ils puissent apprendre à résoudre une énigme spécifique qu'ils ont déjà rencontrée, ils ont souvent du mal à comprendre comment explorer un environnement totalement nouveau, restant bloqués dans une manière de penser étroite qui les empêche de trouver la meilleure solution.

Une équipe de chercheurs s'est donné pour mission de comprendre pourquoi ces agents intelligents échouent lorsqu'ils sont confrontés à l'inconnu. Ils ont découvert un phénomène spécifique qu'ils appellent « effondrement de l'exploration ». En termes simples, lorsqu'un agent est entraîné sur une nouvelle tâche, il apprend souvent à trouver un seul chemin spécifique vers le succès et ignore ensuite toutes les autres possibilités. Il devient si concentré sur cette voie unique qu'il perd la capacité d'essayer différentes approches. Les chercheurs ont mesuré cela en observant deux scores différents : l'un qui suit si la meilleure supposition de l'agent fonctionne, et un autre qui suit si l'une de ses nombreuses supposations différentes fonctionne. Dans les tâches familières, les deux scores s'améliorent à mesure que l'agent apprend. Mais dans de nouveaux environnements difficiles, comme un puzzle basé sur une grille où des boîtes doivent être poussées vers des cibles spécifiques, le score pour la meilleure supposition unique augmente légèrement, tandis que le score pour l'essai de nombreux chemins différents diminue en fait. L'agent apprend à être plus confiant dans une mauvaise habitude plutôt qu'à apprendre à être plus flexible. Cela se produit parce que l'agent ne comprend pas réellement les règles du nouveau monde dans lequel il se trouve ; il devine sans fondement solide.

Pour corriger cela, les chercheurs ont développé une nouvelle méthode d'entraînement appelée SPA, qui signifie Self-Experience Agent (Agent d'Expérience Propre). Au lieu d'essayer immédiatement d'enseigner à l'agent comment obtenir des récompenses, ils lui ont d'abord appris à comprendre le monde qui l'entoure. Ils ont donné à l'agent la possibilité d'explorer l'environnement de son propre chef, sans la pression de marquer des points. Pendant cette phase, on demandait à l'agent de décrire ce qu'il voyait et de prédire ce qui se passerait ensuite s'il effectuait une certaine action. Par exemple, si l'agent voyait une boîte à un endroit précis et décidait de la pousser, il devait d'abord déclarer où se trouvait la boîte, puis prédire où elle finirait. Les chercheurs ont ensuite utilisé les résultats réels et corrects de l'environnement pour corriger les prédictions de l'agent, lui enseignant ainsi les lois de la physique pour ce jeu spécifique. Ce processus a créé une sorte de carte interne ou de « modèle de monde » dans l'esprit de l'agent, ancrant sa compréhension dans la réalité plutôt que dans des suppositions vagues.

Une fois que l'agent a construit cette compréhension interne du fonctionnement du monde, les chercheurs ont commencé le processus d'entraînement standard pour lui apprendre à gagner. Les résultats étaient frappants. Lors de tests sur un jeu de puzzle appelé Sokoban, où l'agent devait pousser des boîtes vers des cibles, la méthode d'entraînement standard ne permettait à l'agent de réussir qu'environ 25 % du temps. Avec la nouvelle méthode, le taux de réussite a bondi à près de 60 %. Sur un autre puzzle impliquant un lac gelé, le taux de réussite est passé d'environ 22 % à plus de 70 %. Peut-être plus surprenant encore, un très petit modèle informatique entraîné avec cette méthode a pu surpasser un modèle beaucoup plus grand et plus puissant qui avait été entraîné avec les anciennes méthodes standard. Le petit modèle, ayant d'abord appris les règles du jeu, a pu naviguer dans les puzzles complexes plus efficacement que le modèle géant qui essayait simplement de deviner son chemin vers une récompense.

Les chercheurs ont également testé si cette approche fonctionnait sur d'autres types de tâches, telles qu'un puzzle logique appelé Sudoku et un environnement simulé pour les tâches ménagères. Dans chaque cas, la méthode qui enseignait à l'agent à comprendre l'état du monde avant de chercher à gagner menait à de meilleurs résultats. Ils ont découvert que la clé du succès n'était pas seulement d'avoir plus de données ou un ordinateur plus puissant, mais plutôt l'ordre dans lequel l'apprentissage se produisait. En forçant l'agent à apprendre d'abord la structure de l'environnement, ils ont évité le piège de l'effondrement dans une stratégie unique et fragile. L'agent a appris à garder ses options ouvertes, explorant de multiples chemins parce qu'il comprenait les conséquences de ses actions. Cette approche suggère que pour que l'intelligence artificielle puisse véritablement s'adapter à des situations nouvelles et complexes, elle doit construire une compréhension fiable de la réalité avant de chercher à optimiser son succès. L'étude montre que lorsqu'un agent est ancré dans les mécanismes réels de son environnement, il peut apprendre à explorer plus efficacement et à résoudre des problèmes qui étaient auparavant hors de portée.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →