Vision-Language Models Mistake Head Orientation for Gaze Direction: Nonverbal Conversation Cues
Ce papier révèle que les modèles vision-langage sous-performent considérablement les humains dans l'inférence de la direction du regard car ils s'appuient à tort sur l'orientation de la tête plutôt que sur l'apparence des yeux, un biais attribué aux données d'entraînement plutôt qu'à l'architecture du modèle.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
L'idée principale : Le jeu de devinettes « Tête d'abord »
Imaginez que vous jouez à un jeu où vous devez deviner sur quel objet une personne sur une photo est en train de regarder. Il y a trois objets sur la table : un lapin, une bouilloire et des tulipes.
Si la personne regarde le lapin, mais que sa tête est légèrement tournée vers la bouilloire, que faites-vous ?
- Un humain observe attentivement les yeux de la personne, voit que les pupilles sont dirigées vers le lapin et dit : « Elle regarde le lapin. »
- L'IA actuelle (les modèles vision-langue) ignore souvent les yeux. Au lieu de cela, elle regarde la direction du visage de la personne (sa tête) et dit : « Elle regarde la bouilloire. »
L'article soutient que ces modèles d'IA sont des devineurs « paresseux ». Ils s'appuient sur une ruse : Si la tête fait face à un objet, les yeux doivent aussi regarder dans cette direction. Ils ne font pas l'effort difficile de lire réellement les yeux.
Comment les chercheurs ont testé cela
Les chercheurs ont construit un « laboratoire du regard » spécial pour tester cela. Ils ont pris 1 360 photos réelles de personnes assises à une table avec différents objets. Ils ont mis en place trois scénarios spécifiques pour piéger l'IA :
- Le scénario « Accord » : La personne regarde le lapin, et sa tête fait aussi face au lapin. (Facile pour tout le monde).
- Le scénario « Naturel » : La personne regarde le lapin, et sa tête est orientée naturellement là où elle se sent à l'aise (généralement vers le lapin).
- Le scénario « Piège » (Incongru) : C'est la clé. La personne garde sa tête face à la bouilloire, mais elle bouge ses yeux pour regarder le lapin.
Le Résultat :
- Les humains ont eu raison presque à chaque fois (environ 89 % de précision). Ils ont regardé les yeux.
- Les modèles d'IA (comme GPT-4o, GPT-5.2, Qwen3) ont très mal performé, souvent à peine mieux que le hasard. Lorsque la tête et les yeux ne s'accordaient pas, l'IA devinait presque toujours l'objet vers lequel était tournée la tête, et non l'objet vers lequel regardaient les yeux.
Pourquoi l'IA a-t-elle échoué ? (Le travail d'enquête)
Les chercheurs ne se sont pas contentés de dire « l'IA est mauvaise ». Ils ont joué aux détectives pour comprendre pourquoi. Ils ont écarté plusieurs excuses :
- Est-ce parce que les photos sont trop floues ? Non. Lorsqu'ils ont rendu les photos ultra haute définition, l'IA a quand même échoué.
- Est-ce parce que l'IA ne peut pas nommer les objets ? Non. L'IA pouvait correctement identifier le « lapin » et la « bouilloire » lorsqu'on le lui demandait.
- Est-ce parce que l'IA est trop petite ? Non. Les modèles plus grands et plus puissants ont échoué tout autant que les plus petits.
Le vrai coupable : Les données d'entraînement
Les chercheurs pensent que le problème vient de ce que l'IA a appris sur Internet.
- L'analogie : Imaginez un enfant qui n'a jamais vu que des gens regardant les objets vers lesquels ils font face. Dans le monde réel, il est rare de voir quelqu'un fixer quelque chose sur le côté tout en ayant le visage tourné vers l'avant.
- Parce que les données d'Internet regorgent d'exemples où « la tête et les yeux sont d'accord », l'IA a appris une règle : « Direction de la tête = Direction du regard. » Elle n'a jamais appris que les yeux peuvent bouger indépendamment de la tête.
Le test de la « pièce de monnaie »
Pour prouver que l'IA n'était pas simplement confuse, les chercheurs ont mené un test spécifique. Ils ont demandé : L'IA se soucie-t-elle le moins du monde des yeux ?
Ils ont constaté que le comportement de l'IA était comme un lancer de pièce ou une balance biaisée :
- Lorsque la tête et les yeux s'accordaient, l'IA était confiante.
- Lorsqu'ils ne s'accordaient pas, l'IA ne tentait pas de comprendre les yeux. Elle se contentait de se rabattre sur la tête.
- Même lorsque les chercheurs tentaient d'« enseigner » à l'IA de regarder les yeux en ajoutant des instructions comme « Concentrez-vous sur les yeux », l'IA les ignorait majoritairement et revenait à deviner en se basant sur la tête.
L'expérience de « preuve de concept »
Pour montrer qu'il ne s'agit pas d'un défaut permanent dans le « cerveau » de l'IA (son architecture), mais simplement d'une mauvaise habitude issue de son entraînement, les chercheurs ont mené une petite expérience :
Ils ont pris l'un des modèles d'IA et l'ont re-entraîné spécifiquement sur leurs photos de « Piège » (où la tête et les yeux ne s'accordaient pas).
- Avant le re-entraînement : Le modèle était terrible dans le scénario de piège (15 % de précision).
- Après le re-entraînement : Le modèle s'est beaucoup amélioré (34 % de précision). Il a appris à cesser de s'appuyer uniquement sur la tête et à regarder réellement les yeux.
La leçon : L'IA peut apprendre à lire les yeux, mais elle a besoin de données spécifiques qui lui apprennent à le faire. Les données Internet standard sur lesquelles elle apprend habituellement ne contiennent pas assez de ces exemples de « piège ».
Résumé
- Le Problème : Les modèles d'IA actuels sont terribles pour dire où quelqu'un regarde si sa tête est tournée dans une direction différente. Ils confondent la direction du visage avec la direction des yeux.
- La Cause : Ils ont été entraînés sur des données où les têtes et les yeux pointent généralement dans la même direction, si bien qu'ils ont appris une ruse paresseuse.
- La Solution : Nous devons fournir à l'IA davantage de données où les gens regardent sur le côté ou vers le haut tandis que leur tête reste immobile, forçant ainsi l'IA à apprendre à réellement lire les yeux.
L'article conclut qu'à moins que nous ne résolvions ce problème de données, l'IA aura du mal à comprendre les signaux non verbaux humains, ce qui est essentiel pour que les robots et les ordinateurs interagissent naturellement avec les gens.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.