← Nieuwste papers
💬 NLP

Vision-Language Models Mistake Head Orientation for Gaze Direction: Nonverbal Conversation Cues

Dit artikel onthult dat Vision-Language-modellen aanzienlijk minder goed presteren dan mensen bij het afleiden van blikrichting omdat ze ten onrechte vertrouwen op hoofdoriëntatie in plaats van op het uiterlijk van de ogen, een vertekening die wordt toegeschreven aan de trainingsdata in plaats van aan de modelarchitectuur.

Oorspronkelijke auteurs: Zory Zhang, Pinyuan Feng, Bingyang Wang, Tianwei Zhao, Suyang Yu, Qingying Gao, Hokin Deng, Ziqiao Ma, Yijiang Li, Dezhi Luo

Gepubliceerd 2026-05-01
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Zory Zhang, Pinyuan Feng, Bingyang Wang, Tianwei Zhao, Suyang Yu, Qingying Gao, Hokin Deng, Ziqiao Ma, Yijiang Li, Dezhi Luo

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Het Grote Idee: Het "Eerst het Hoofd" Raadselspel

Stel je voor dat je een spel speelt waarbij je moet raden naar welk object een persoon op een foto kijkt. Er liggen drie items op tafel: een konijntje, een waterkoker en een bosje tulpen.

Als de persoon naar het konijntje kijkt, maar hun hoofd is iets gedraaid richting de waterkoker, wat doe je dan?

  • Een mens kijkt goed naar de ogen van de persoon, ziet dat de pupillen naar het konijntje gericht zijn en zegt: "Ze kijken naar het konijntje."
  • Huidige AI (Vision-Language Modellen) negeert de ogen vaak. In plaats daarvan kijkt het naar de richting van het gezicht (het hoofd) van de persoon en zegt: "Ze kijken naar de waterkoker."

Het artikel stelt dat deze AI-modellen "luie" raadselaars zijn. Ze vertrouwen op een afkorting: Als het hoofd naar een object gericht is, moeten de ogen daar ook naartoe kijken. Ze doen het harde werk niet om daadwerkelijk de ogen te lezen.


Hoe de Onderzoekers Dit Testten

De onderzoekers bouwden een speciale "blik-lab" om dit te testen. Ze namen 1.360 echte foto's van mensen die aan een tafel zaten met verschillende objecten. Ze stelden drie specifieke scenario's op om de AI voor de gek te houden:

  1. Het "Instemmende" Scenario: De persoon kijkt naar het konijntje en hun hoofd is ook naar het konijntje gericht. (Makkelijk voor iedereen).
  2. Het "Natuurlijke" Scenario: De persoon kijkt naar het konijntje en hun hoofd is gericht naar waar ze zich natuurlijk comfortabel voelen (meestal het konijntje).
  3. Het "Truc" Scenario (Incongruent): Dit is de sleutel. De persoon houdt hun hoofd gericht naar de waterkoker, maar beweegt hun ogen om naar het konijntje te kijken.

Het Resultaat:

  • Mensen kregen dit bijna elke keer goed (ongeveer 89% nauwkeurigheid). Ze keken naar de ogen.
  • AI-modellen (zoals GPT-4o, GPT-5.2, Qwen3) presteerden zeer slecht, vaak nauwelijks beter dan raden. Wanneer het hoofd en de ogen het niet eens waren, gokte de AI bijna altijd op het object waar het hoofd naar gericht was, niet op het object waar de ogen naar keken.

Waarom Faalde de AI? (Het Detectivewerk)

De onderzoekers zeiden niet zomaar "AI is slecht". Ze speelden detective om uit te zoeken waarom. Ze stelden verschillende smoesjes terzijde:

  • Is het omdat de foto's te wazig zijn? Nee. Toen ze de foto's super-hoge resolutie maakten, faalde de AI nog steeds.
  • Is het omdat de AI de objecten niet kan benoemen? Nee. De AI kon correct het "konijntje" en de "waterkoker" identificeren toen ze erom gevraagd werd.
  • Is het omdat de AI te klein is? Nee. Grotere, krachtigere modellen faalden net zo vaak als kleinere.

De Echte Dader: De Trainingsdata
De onderzoekers geloven dat het probleem ligt in wat de AI van het internet heeft geleerd.

  • De Analogie: Stel je een kind voor dat alleen maar mensen heeft gezien die naar dingen kijken waar ze naar toe gekeerd zijn. In de echte wereld is het zeldzaam om iemand te zien die zijwaarts staart terwijl hun gezicht naar voren wijst.
  • Omdat de internetdata vol zit met voorbeelden waar "hoofd en ogen het eens zijn", leerde de AI een regel: "Hoofdrichting = Blikrichting." Het leerde nooit dat ogen onafhankelijk van het hoofd kunnen bewegen.

De "Muntworp" Test

Om te bewijzen dat de AI niet gewoon verward was, draaiden de onderzoekers een specifieke test. Ze vroegen: Geeft de AI überhaupt om de ogen?

Ze ontdekten dat het gedrag van de AI als een muntworp of een vooringenomen weegschaal was:

  • Wanneer hoofd en ogen het eens waren, was de AI zelfverzekerd.
  • Wanneer ze het oneens waren, probeerde de AI niet om de ogen uit te zoeken. Het ging gewoon terug naar het hoofd.
  • Zelfs toen de onderzoekers probeerden de AI "te leren" naar de ogen te kijken door instructies toe te voegen zoals "Focus op de ogen", negeerde de AI deze grotendeels en ging terug naar gokken op basis van het hoofd.

Het "Proof of Concept" Experiment

Om te laten zien dat dit geen permanente fout in het brein van de AI (architectuur) is, maar gewoon een slechte gewoonte uit zijn training, deden de onderzoekers een klein experiment:

Ze namen een van de AI-modellen en hertrainden het specifiek op hun "Truc" foto's (waar hoofd en ogen het oneens waren).

  • Voor de hertraining: Het model was vreselijk in het truc-scenario (15% nauwkeurigheid).
  • Na de hertraining: Het model werd veel beter (34% nauwkeurigheid). Het leerde om niet langer uitsluitend op het hoofd te vertrouwen en daadwerkelijk naar de ogen te kijken.

De Les: De AI kan leren om ogen te lezen, maar het heeft specifieke data nodig die het dit leert. De standaard internetdata waar het meestal van leert, heeft niet genoeg van deze "truc" voorbeelden.

Samenvatting

  • Het Probleem: Huidige AI-modellen zijn vreselijk in het bepalen waar iemand naartoe kijkt als hun hoofd in een andere richting gedraaid is. Ze verwarren de richting van het gezicht met de richting van de ogen.
  • De Oorzaak: Ze zijn getraind op data waar hoofden en ogen meestal dezelfde kant op wijzen, dus ze hebben een luie afkorting geleerd.
  • De Oplossing: We moeten AI meer data geven waar mensen zijwaarts of omhoog kijken terwijl hun hoofd stil blijft, zodat de AI gedwongen wordt om te leren hoe het ogen daadwerkelijk moet lezen.

Het artikel concludeert dat tot we dit data-probleem oplossen, AI zal worstelen met het begrijpen van menselijke non-verbale signalen, wat essentieel is voor robots en computers om natuurlijk met mensen te interageren.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →