← Derniers articles
💻 computer science

Language Models Might Not Understand You: Evaluating Theory of Mind via Story Prompting

Cet article présente StorySim, un cadre programmable pour générer des invites d'histoires nouvelles et exemptes de contamination afin d'évaluer les grands modèles de langage, révélant qu'ils obtiennent généralement de meilleurs résultats dans la modélisation du monde que dans les tâches de théorie de l'esprit et qu'ils s'appuient souvent sur des heuristiques plutôt que sur un raisonnement approfondi.

Auteurs originaux : Nathaniel Getachew, Abulhair Saparov

Publié 2026-04-28
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Nathaniel Getachew, Abulhair Saparov

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous essayez d'enseigner à un robot comment comprendre les pensées humaines. Vous voulez savoir si le robot peut deviner ce que quelqu'un d'autre pense, même si les pensées de cette personne sont erronées. Cette capacité s'appelle la Théorie de l'Esprit (ToM).

Pendant longtemps, les scientifiques ont testé des robots (des Modèles de Langage à Grande Échelle ou LLM) en utilisant une histoire classique pour enfants appelée « Sally-Anne ». Dans cette histoire, Sally cache un jouet, quitte la pièce, et Anne déplace le jouet. Lorsque Sally revient, où cherche-t-elle ? Un humain sait que Sally cherchera à l'endroit d'origine car elle ne sait pas que le jouet a bougé. Mais si vous modifiez l'histoire ne serait-ce qu'un tout petit peu, ces robots sont souvent confus, ce qui suggère qu'ils pourraient simplement mémoriser l'histoire plutôt que de vraiment comprendre les esprits des personnages.

Pour résoudre ce problème, les auteurs de cet article ont créé un nouvel outil appelé StorySim. Imaginez StorySim comme un ensemble de LEGO programmable pour les histoires.

L'Ensemble de LEGO (StorySim)

Au lieu d'écrire une histoire à la main ou de demander à une autre IA de l'écrire (ce qui pourrait accidentellement copier des éléments que le robot a déjà vus), les chercheurs utilisent un « Storyboard ».

  • Le Storyboard : C'est un plan strict. Il indique : « Le personnage A entre dans la pièce 1 à la minute 1. Le personnage B entre dans la pièce 2 à la minute 2. » Il contrôle exactement qui voit quoi et quand.
  • Le Constructeur : Le système remplit le reste de l'histoire automatiquement, en veillant à ce que les règles ne soient jamais enfreintes. Parce que les histoires sont construites à partir de zéro à l'aide de ces plans, les robots ne les ont jamais vues auparavant. C'est comme construire un tout nouveau puzzle à chaque fois que vous jouez.

Le Test : Esprit contre Carte

Les chercheurs ont utilisé cet ensemble de LEGO pour mener trois types de tests différents sur divers modèles d'IA :

  1. Le test « Esprit » (Théorie de l'Esprit) : Ils ont demandé : « Où Bob pense-t-il qu'Anne se trouve ? » Pour répondre à cela, le robot doit ignorer la vérité réelle et suivre ce que Bob a vu et ce qu'il croit.
  2. Le test « Carte » (Modélisation du Monde) : Ils ont demandé : « Où Anne est-elle allée en réalité ? » Cela demande simplement au robot de se souvenir des faits de l'histoire, comme suivre un objet en mouvement sur une carte.
  3. Le test « Objet » : Ils ont posé la même question « Carte », mais au lieu de personnes, l'histoire portait sur des objets inanimés (comme une balle déplacée). Cela vérifie si le robot traite les personnes différemment des objets.

Ce qu'ils ont découvert

Les résultats étaient un peu surprenants, comme découvrir qu'un élève qui a réussi l'examen de mathématiques lutte avec l'énigme logique :

  • Les robots sont meilleurs avec les Cartes qu'avec les Esprits : La plupart des modèles d'IA étaient beaucoup meilleurs pour suivre où les choses ont réellement été (Modélisation du Monde) que pour deviner ce qu'un personnage pensait qu'il se passait (Théorie de l'Esprit). Ils pouvaient suivre l'intrigue, mais ils avaient du mal à se mettre à la place d'un personnage.
  • Personnes contre Objets : Les robots étaient légèrement meilleurs pour suivre les mouvements de personnes que d'objets. Il semble que les modèles soient « préparés » à prêter plus d'attention aux personnages humains, peut-être parce qu'ils sont entraînés sur tant de conversations humaines.
  • Le piège de la « Récence » : Les chercheurs craignaient que les robots ne trichent en devinant simplement le dernier endroit où ils ont vu quelqu'un. Ils ont testé cela en faisant en sorte que le « mensonge » de l'histoire se produise il y a longtemps. Surprenamment, les robots ne semblaient pas tomber dans ce piège simple de « deviner le dernier événement » autant que prévu.
  • L'habitude de la « Première Rencontre » : Lorsque les robots ont échoué au test « Esprit », ils ont souvent fait une erreur spécifique : ils ont deviné l'endroit où les personnages se sont rencontrés pour la première fois, plutôt que l'endroit où ils se sont vus pour la dernière fois. C'est comme un élève qui se souvient du premier jour de classe mais oublie ce qui s'est passé hier.

La Grande Image

L'article conclut que, bien que l'IA moderne devienne plus intelligente dans le raisonnement, elle lutte toujours pour comprendre véritablement les « états mentaux » des autres. Elle peut suivre parfaitement les événements d'une histoire, mais lorsqu'on lui demande d'imaginer ce qu'un personnage pense (surtout si cette pensée est erronée), elle échoue souvent.

Les auteurs ont créé StorySim non pas pour donner aux robots une note finale, mais pour leur offrir un test équitable et frais sur lequel ils ne pourraient pas tricher en mémorisant d'anciennes réponses. Ils espèrent que cet outil aidera les futurs chercheurs à construire une IA capable de vraiment comprendre les perspectives humaines, et pas seulement de réciter des faits.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →