Do we carry the false belief that LLMs have a theory of mind?
Bien que les grands modèles de langage obtiennent souvent des scores élevés aux évaluations de la théorie de l'esprit, cette étude révèle qu'ils s'appuient sur des heuristiques économiquement avantageuses plutôt que sur un véritable suivi des états mentaux, indiquant qu'ils manquent de capacités robustes en matière de théorie de l'esprit.
Article original sous licence CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Les êtres humains possèdent un superpouvoir cognitif unique qui nous permet de naviguer dans le monde social : la capacité de comprendre que d'autres personnes ont des esprits propres, remplis de pensées, de croyances et de désirs qui peuvent différer des nôtres. Les psychologues appellent cette capacité la « théorie de l'esprit ». C'est la machinerie mentale qui nous permet de réaliser qu'un ami pourrait chercher quelque chose à l'endroit où il l'a vu pour la dernière fois, même si nous savons que l'objet a été déplacé depuis à un autre endroit. Cette compétence ne consiste pas seulement en de l'intelligence ; elle est le fondement de l'empathie, de la communication et de la coopération. Pendant des décennies, des chercheurs ont utilisé une histoire simple, impliquant souvent deux personnages nommés Sally et Anne, pour tester si les enfants ont développé cette capacité. Dans l'histoire, Sally cache un jouet dans un panier et quitte la pièce. Pendant qu'elle est partie, Anne déplace le jouet dans une boîte. Quand Sally revient, la question est simple : où cherchera-t-elle son jouet ? Un enfant doté d'une théorie de l'esprit développée sait que Sally cherchera dans le panier, car c'est là qu'elle croit que le jouet se trouve, malgré le fait que l'objet soit maintenant dans la boîte.
Récemment, un nouveau type d'intelligence est apparu dans notre vie quotidienne : les grands modèles de langage. Ce sont des programmes informatiques entraînés sur de vastes quantités de texte qui peuvent écrire, discuter et résoudre des problèmes avec une fluidité qui imite souvent la conversation humaine. Parce que ces modèles peuvent discuter de sujets complexes et sembler comprendre le contexte, de nombreux chercheurs et observateurs ont commencé à se demander s'ils possèdent eux aussi une théorie de l'esprit. Si une machine peut prédire correctement ce qu'un personnage de fiction croit, comprend-elle vraiment le concept de croyance, ou ne fait-elle que deviner en se basant sur les motifs qu'elle a rencontrés auparavant ? Cette question est devenue urgente à mesure que ces outils s'intègrent dans nos vies sociales et professionnelles, menant à un besoin pressant de déterminer s'ils sont de véritables partenaires sociaux ou de simples imitateurs très sophistiqués.
Une étude récente s'est donné pour mission de répondre à cette question en soumettant les cinq modèles de langage les plus avancés au test du scénario classique de Sally-Anne et à plusieurs de ses variantes. Les chercheurs, dirigés par Nicholas Griffen de l'Université Paris Cité, n'ont pas simplement posé la question standard aux modèles. Au lieu de cela, ils ont conçu une série de défis pour voir si les modèles pouvaient gérer les détails subtils de l'histoire qui nécessitent un raisonnement véritable plutôt qu'une simple mémorisation. Ils ont testé des modèles de grandes entreprises, notamment GPT-5.5 Luna, Claude Sonnet 5, Gemini 3.1 Pro, Grok 4.5 et Mistral Medium 3.5. Pour garantir l'équité des résultats, les chercheurs ont créé de nouvelles versions uniques de l'histoire pour chaque test, changeant les noms, les objets et les détails spécifiques afin que les modèles ne puissent pas simplement se remémorer une réponse précédente de leurs données d'entraînement. Ils ont également introduit des rebondissements délicats, comme rendre les contenants transparents pour que les personnages puissent voir le jouet, ou changer les mots utilisés pour décrire l'endroit où le jouet a été placé, afin de voir si les modèles pouvaient ajuster leur raisonnement en fonction de nouvelles informations visuelles ou linguistiques.
Les résultats ont brossé le portrait d'un système hautement capable dans certains domaines mais fondamentalement limité dans d'autres. Lorsque les modèles recevaient la version standard de l'histoire, ils réussissaient remarquablement bien, la plupart répondant correctement presque à chaque fois. En fait, en moyenne sur tous les types de questions, les modèles ont obtenu des scores bien supérieurs à ce qui serait attendu par le hasard. Le meilleur performeur, Gemini 3.1 Pro, a donné la bonne réponse 84 % du temps au total. Ce succès suggère que ces modèles ont appris le schéma général de la tâche de « fausse croyance » à partir de la vaste quantité de textes qu'ils ont lus. Ils peuvent reconnaître la structure de l'histoire et fournir la réponse qu'un humain donnerait dans un scénario de manuel scolaire.
Cependant, l'étude a révélé que ce succès est fragile. Lorsque les chercheurs ont introduit des variations nécessitant l'usage du bon sens ou l'intégration d'informations visuelles, la performance a chuté de manière spectaculaire. Dans une variation, l'histoire décrivait les contenants comme étant transparents, ce qui signifie que le personnage revenant dans la pièce pouvait réellement voir le jouet dans son nouvel emplacement. Dans une situation réelle, une personne comprendrait que parce que le personnage peut voir le jouet, il ne détient plus une fausse croyance ; il connaît la vérité. Les modèles, cependant, ont largement échoué à faire ce lien. Un seul modèle, Gemini 3.1 Pro, a réussi à obtenir plus de la moitié de ces réponses correctes. Les autres ont continué à insister sur le fait que le personnage chercherait dans l'ancien emplacement vide, ignorant le fait que le personnage pouvait voir le jouet.
La difficulté est devenue plus prononcée lorsque les chercheurs ont modifié les prépositions utilisées pour décrire l'emplacement du jouet. Dans l'histoire standard, un jouet est placé « dans » une boîte. Dans le test, les chercheurs ont décrit le jouet comme étant placé « sur » une boîte ou « sous » un seau. Lorsque l'histoire impliquait que le jouet était visible parce qu'il était posé sur le dessus d'un contenant plutôt que caché à l'intérieur, chaque modèle a totalement échoué, obtenant un score de zéro pour ces questions. Ils n'ont pas pu inférer que la visibilité de l'objet changeait l'état d'esprit du personnage. De même, lorsque l'histoire impliquait qu'un personnage était explicitement informé de l'endroit où le jouet avait été déplacé, ou lorsque la question portait sur ce qu'un personnage pensait qu'un autre personnage ferait, les modèles ont trébuché. Ils ont souvent opté pour des schémas simples et rigides plutôt que de suivre dynamiquement les états mentaux des personnages au fil de l'histoire.
Les chercheurs ont également examiné comment les modèles géraient le genre des personnages. Ils ont constaté que les modèles performaient légèrement mieux lorsque les deux personnages de l'histoire partageaient le même genre, et légèrement moins bien lorsqu'ils avaient des genres différents. Cela suggère que les modèles utilisent peut-être le genre comme un raccourci pour garder une trace de qui est qui, plutôt que de comprendre véritablement les rôles et les actions de chaque individu. Lorsque le raccourci était supprimé en utilisant deux personnages de même genre, les modèles semblaient s'appuyer davantage sur la séquence des événements, ce qui, paradoxalement, les aidait à obtenir la bonne réponse plus souvent. Cela indique que leur raisonnement n'est pas aussi robuste que le raisonnement humain, qui ne dépend pas de tels indices superficiels pour comprendre une situation.
La conclusion centrale de l'étude est que, bien que ces modèles de langage puissent imiter les bonnes réponses aux tests de la théorie de l'esprit, ils ne semblent pas posséder la capacité sous-jacente de comprendre les états mentaux comme le font les humains. Ils ont du mal à relier les points entre ce qu'un personnage peut voir, ce qu'il sait et ce qu'il croit. Les modèles semblent utiliser des « heuristiques », ou raccourcis mentaux, pour deviner la réponse en se basant sur les motifs les plus courants de leurs données d'entraînement. Lorsque l'histoire déviait du schéma standard en ajoutant des détails visuels ou en changeant les relations spatiales, les raccourcis échouaient. Les chercheurs suggèrent que cela est dû au fait que les modèles sont entraînés uniquement sur du texte. Ils n'ont jamais vu un jouet être déplacé, n'ont jamais ressenti la sensation de chercher quelque chose, et n'ont jamais eu à compter sur leurs propres yeux pour mettre à jour leurs connaissances du monde. Sans cette expérience incarnée, ils ne peuvent pas véritablement saisir le concept d'une croyance différente de la réalité.
En fin de compte, l'étude sert de mise en garde contre l'idée de supposer que parce qu'une machine peut parler comme un humain, elle pense comme un tel. Les modèles peuvent produire des réponses qui donnent l'impression qu'ils possèdent une théorie de l'esprit, mais lorsqu'ils sont testés avec des scénarios exigeant une compréhension véritable de la perception et de la croyance, ils révèlent leurs limites. Ils sont excellents pour répéter ce qu'ils ont lu, mais ils ne sont pas encore capables du raisonnement flexible et de bon sens qui permet aux humains de naviguer dans le monde social complexe. À mesure que ces outils deviennent plus courants, il est important de se rappeler que leur intelligence apparente est un reflet des données qu'ils ont consommées, et non le signe qu'ils ont développé un esprit propre.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.