← Derniers articles
🤖 AI

Beyond Recognition: Evaluating Visual Perspective Taking in Vision Language Models

Cette étude évalue la capacité des modèles vision-langage à effectuer la prise de perspective visuelle à l'aide de tâches contrôlées, révélant que bien qu'ils excellent dans la compréhension de scène, leurs performances déclinent nettement lors du raisonnement spatial et de la prise de perspective, ce qui souligne la nécessité d'intégrer des représentations géométriques explicites dans leur développement futur.

Auteurs originaux : Gracjan Góral, Alicja Ziarko, Piotr Miłoś, Michał Nauman, Maciej Wołczyk, Michał Kosiński

Publié 2026-03-31
📖 4 min de lecture☕ Lecture pause café

Auteurs originaux : Gracjan Góral, Alicja Ziarko, Piotr Miłoś, Michał Nauman, Maciej Wołczyk, Michał Kosiński

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

🕵️‍♂️ Le Grand Test de l'Empathie des Robots

Imaginez que vous donnez un examen de conduite à un robot. Vous lui montrez une photo d'une rue et vous lui demandez : « Combien y a-t-il de voitures ? » et « Où est le feu rouge ? ». Le robot répond parfaitement. Il a une mémoire de fer et des yeux de lynx.

Mais ensuite, vous posez une question plus subtile : « Si je suis le conducteur assis dans cette voiture, est-ce que je vois le feu rouge, ou est-il caché par un camion ? »

C'est exactement ce que les chercheurs ont fait avec les intelligences artificielles modernes (les modèles "Vision-Language"). Ils ont créé un jeu de 144 situations très simples, inspirées de tests psychologiques pour humains, pour voir si ces robots savent vraiment se mettre à la place de quelqu'un d'autre.

🧱 Le Jeu de la "Lego-ville"

Pour éviter que les robots ne trichent en se souvenant de réponses apprises sur internet, les chercheurs ont construit un monde miniature avec des Lego.

  • Il y a un petit bonhomme Lego (le "personnage").
  • Il y a un objet (un chien, une chaise, un vase).
  • Ils sont placés sur une table blanche.

Les chercheurs ont tourné le bonhomme, déplacé l'objet, et changé l'angle de la caméra (depuis le plafond ou depuis la table). C'est comme un jeu de rôle très contrôlé.

Ensuite, ils ont posé 7 questions à 9 robots intelligents (comme GPT-4, Claude, Gemini, etc.) :

  1. Niveau 1 (La vue de l'oiseau) : « Combien d'objets vois-tu ? » (Facile).
  2. Niveau 2 (La géométrie) : « Le bonhomme regarde-t-il vers le Nord ou l'Est ? » (Moyen).
  3. Niveau 3 (L'empathie visuelle) : « Si tu es le bonhomme, vois-tu le chien ? » (Difficile).

📉 Le Résultat : Des Génies, mais des "Aveugles" Sociaux

Voici ce qu'ils ont découvert, et c'est assez surprenant :

  • Les robots sont des experts en "Regarder" : Ils comptent les objets et reconnaissent les Lego sans aucune erreur. C'est comme un photographe qui voit tout.
  • Les robots sont nuls en "Comprendre" : Dès qu'il faut imaginer ce que l'autre voit, ils se trompent massivement.

L'analogie du Miroir Cassé :
Imaginez que vous regardez dans un miroir. Vous voyez votre reflet. Un humain comprend instinctivement que si son reflet lève la main gauche, c'est sa main gauche qui bouge, mais que pour le reflet, c'est sa droite.
Les robots, eux, semblent avoir un miroir cassé. Ils voient le bonhomme, ils voient l'objet, mais ils ne parviennent pas à faire le lien mental pour dire : « Ah, le bonhomme fait face à l'objet, donc il le voit ! » ou « Non, l'objet est derrière lui, donc il ne le voit pas ».

🧭 Le Problème du "Boussole Tordue"

Le plus drôle (et le plus inquiétant), c'est que les robots ne font pas juste des erreurs au hasard. Ils ont des préjugés directionnels.

C'est comme si, dans leur cerveau, une boussole était tordue.

  • Certains robots (comme GPT-4 Turbo) pensent que tout le monde regarde vers l'Est.
  • D'autres pensent que tout le monde regarde vers l'Ouest.
  • Même si vous zoomez sur le visage du bonhomme, même si vous mettez une flèche "Nord" sur la photo, même si vous remplacez le Lego par une vraie personne... ils continuent à dire : « Il regarde vers l'Est ! ».

C'est comme si le robot disait : « Je ne sais pas vraiment où il regarde, alors je vais deviner l'Est, c'est une bonne habitude ! » au lieu de vraiment analyser la photo.

🤔 Pourquoi est-ce important ?

Cela ressemble à un petit jeu de Lego, mais c'est crucial pour le futur.
Imaginez une voiture autonome ou un robot chirurgical.

  • Si la voiture ne comprend pas ce que le conducteur de la voiture voisine voit, elle pourrait percuter quelqu'un.
  • Si le robot chirurgical ne comprend pas ce que le chirurgien voit, il pourrait lui tendre l'outil du mauvais côté.

💡 La Conclusion en une phrase

Ces intelligences artificielles sont d'excellents observateurs (elles voient très bien), mais elles sont de piètres acteurs (elles ne comprennent pas la perspective des autres). Elles ont besoin d'apprendre à faire de la "géométrie mentale" et non pas juste à reconnaître des formes.

Pour l'instant, elles sont comme des enfants très brillants qui savent lire tous les livres du monde, mais qui ont encore du mal à comprendre que ce qu'ils voient n'est pas forcément ce que leur ami voit à travers la fenêtre.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →