← Derniers articles
💬 NLP

Visuospatial Perspective Taking in Multimodal Language Models

Cette étude révèle que les modèles de langage multimodaux actuels présentent des lacunes significatives dans la prise de perspective visuospatiale de niveau 2, notamment leur difficulté à inhiber leur propre point de vue pour adopter celui d'autrui, ce qui limite leur efficacité dans des contextes collaboratifs.

Auteurs originaux : Jonathan Prunty, Seraphina Zhang, Patrick Quinn, Jianxun Lian, Xing Xie, Lucy Cheke

Publié 2026-03-26
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Jonathan Prunty, Seraphina Zhang, Patrick Quinn, Jianxun Lian, Xing Xie, Lucy Cheke

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

🧠 Les IA et le "Monde à l'Envers" : Pourquoi elles ont du mal à se mettre à votre place

Imaginez que vous êtes assis à une table avec un ami. Sur la table, il y a un objet. Vous voyez l'objet droit devant vous. Mais votre ami est assis en face de vous. Pour lui, cet objet est "à sa gauche", alors que pour vous, il est "à votre droite".

C'est ce qu'on appelle la prise de perspective visuo-spatiale. C'est une capacité humaine naturelle : nous savons instantanément ce que l'autre voit et comment il voit les choses, même si c'est différent de notre propre point de vue.

Les chercheurs de cette étude ont voulu savoir : Est-ce que les intelligences artificielles (les IA) savent faire ça ?

Pour le savoir, ils ont créé deux jeux d'énigmes, un peu comme des tests de psychologie, mais pour les robots.

🎮 Le Jeu 1 : "La Chaise Tourne" (Le Rotating Figure Task)

Imaginez une photo prise du plafond. Au centre, il y a un petit bonhomme qui regarde dans une direction. Devant lui, il y a un chiffre écrit au sol (par exemple, un 6).

  • Le défi : L'IA doit répondre à la question : "Si tu étais ce bonhomme, quel chiffre verrais-tu ?"
  • La subtilité : Si le bonhomme est tourné à 180 degrés (dos à vous), il verra le chiffre 9 (car le 6 devient un 9 quand on le regarde de l'autre côté).

Ce que les chercheurs ont découvert :
Les IA sont très fortes quand le bonhomme regarde dans la même direction qu'elles (c'est facile, tout est pareil). Mais dès qu'il faut se mettre dans la peau du bonhomme pour voir le monde "à l'envers" ou de côté, elles se trompent souvent.

C'est comme si l'IA disait : "Je vois un 6, donc c'est un 6 !" sans jamais se demander : "Attends, mais lui, il est tourné, donc pour lui, c'est un 9 !". Elles ont du mal à faire le "tour mental" de l'objet.

🗣️ Le Jeu 2 : "Le Chef d'Orchestre" (Le Director Task)

Imaginez une grille de cases (comme un jeu de Sudoku) remplie d'objets.

  • Vous voyez toute la grille.
  • Le "Directeur" (l'IA) est de l'autre côté. Il y a des murs opaques qui cachent certaines cases à ses yeux. Il ne voit pas tout ce que vous voyez.

Le défi : Le Directeur vous dit : "Prends-moi le plus petit livre bleu que tu vois."

  • Le piège : Il y a un petit livre bleu caché derrière un mur (que vous voyez, mais pas le Directeur). Il y a aussi un gros livre bleu que le Directeur voit.
  • La bonne réponse : Vous devez choisir le gros livre, car c'est le seul que le Directeur peut voir. Si vous choisissez le petit, vous avez échoué car vous n'avez pas respecté son point de vue limité.

Ce que les chercheurs ont découvert :
Les IA ont tendance à choisir l'objet qu'elles voient elles-mêmes, même si le Directeur ne peut pas le voir. Elles oublient de dire : "Ah, mais lui, il ne voit pas ça !". C'est comme si elles étaient égoïstes et pensaient que tout le monde voit la même chose qu'elles.

🚨 Le Problème de Fond : Les IA sont des "Miroirs"

Les chercheurs ont remarqué quelque chose de très intéressant. Parfois, les IA réussissent le test, mais seulement dans des cas très spécifiques (par exemple, quand le bonhomme est tourné exactement à 180 degrés).

Cela suggère que les IA n'utilisent pas de "vrai raisonnement". Elles utilisent des astuces (des raccourcis).

  • Exemple d'astuce : "Si c'est à l'envers, je change le 6 en 9."
  • Mais : Si la situation est un peu plus compliquée (un angle bizarre), l'astuce ne marche plus et l'IA est perdue.

C'est comme un enfant qui apprend à dire "bonjour" en regardant les gens dans les yeux, mais qui ne comprend pas vraiment le concept de politesse. Si la situation change un peu, il ne sait plus quoi faire.

💡 Pourquoi est-ce important ?

Aujourd'hui, on utilise de plus en plus les IA pour :

  • Aider des médecins à opérer.
  • Coordonner des robots dans des entrepôts.
  • Jouer à des jeux vidéo avec des humains.

Pour que ces collaborations fonctionnent, l'IA doit comprendre ce que l'humain voit, ce qu'il sait, et ce qu'il ignore. Si l'IA ne peut pas se mettre à votre place, elle risque de vous donner de mauvaises instructions, de vous cacher des informations importantes, ou de faire des erreurs coûteuses.

En résumé :
Cette étude nous dit que nos IA actuelles sont très intelligentes pour lire des livres et répondre à des questions, mais elles sont encore un peu "naïves" quand il s'agit de comprendre que le monde peut être vu différemment selon où l'on se tient. Elles ont encore du chemin à faire avant de devenir de véritables partenaires de jeu ou de travail.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →