← Nieuwste papers
💬 NLP

Mind the Motions: Benchmarking Theory-of-Mind in Everyday Body Language

Dit artikel introduceert Motion2Mind, een nieuw raamwerk en dataset die zijn ontworpen om de Theory-of-Mind-vaardigheden van AI-systemen bij het interpreteren van nonverbale signalen te toetsen, en onthult dat huidige modellen aanzienlijk achterblijven bij mensen, zowel bij het detecteren van lichaamstaal als bij het nauwkeurig verklaren van de onderliggende mentale toestanden.

Oorspronkelijke auteurs: Seungbeen Lee, Jinhong Jeong, Donghyun Kim, Yejin Son, Youngjae Yu

Gepubliceerd 2026-05-18
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Seungbeen Lee, Jinhong Jeong, Donghyun Kim, Yejin Son, Youngjae Yu

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je op een feestje bent. Je ziet iemand die zijn armen over elkaar slaat, met zijn voet tikt of oogcontact vermijdt. Je hebt niet nodig dat ze één woord zeggen om te weten dat ze misschien koud hebben, ongeduldig zijn of zich ongemakkelijk voelen. Je leest hun Theory of Mind – je raadt wat er in hun hoofd omgaat op basis van hun lichaamstaal.

Dit artikel, getiteld "Mind the Motions", stelt een eenvoudige maar moeilijke vraag: Kunnen computers dit?

De onderzoekers bouwden een nieuwe test genaamd MOTION2MIND om te zien of AI menselijke lichaamstaal even goed kan begrijpen als wij. Hier is de uiteenzetting van hun bevindingen, met behulp van alledaagse analogieën.

1. Het Probleem: AI is geweldig in tekst, slecht in "Vibes"

Stel je huidige AI (zoals de slimme chatbots die je gebruikt) voor als een persoon die elk boek in de bibliotheek heeft gelezen, maar nooit echt zijn huis heeft verlaten. Ze zijn experts in het begrijpen van woorden en logische raadsels. Echter, ze hebben nooit een echt mens zien fidgeten, zuchten of ongemakkelijk glimlachen.

De onderzoekers ontdekten dat hoewel deze AI-modellen slim zijn, ze terrible zijn in het lezen van de "stomme film" van menselijke interactie. Ze missen vaak duidelijke aanwijzingen of verzinnen betekenissen waar geen enkele is.

2. De Oplossing: Een nieuw "Lichaamstaalwoordenboek"

Om de AI op de juiste manier te testen, konden de onderzoekers niet gewoon oude tests gebruiken die alleen vroegen: "Als Alice denkt dat Bob in de keuken is, maar Bob is eigenlijk in de tuin, waar denkt Alice dat Bob is?" (Dit is een klassiek logisch raadsel genaamd een "valse overtuiging"-taak).

In plaats daarvan creëerden ze een enorm, real-world dataset met clips uit films, sitcoms en reality-tv. Ze behandelden dit als een gigantisch, door experts geschreven woordenboek van lichaamstaal.

  • Het Woordenboek: Ze gebruikten een naslagwerk van een expert (Joe Navarro) dat 407 specifieke lichaamsbewegingen (zoals "armen over elkaar slaan" of "aan de nek raken") en wat ze meestal betekenen (zoals "zich onzeker voelen" of "iets proberen te verbergen") opsomt.
  • De Test: Ze toonden de AI korte video-clips van 4 seconden en vroegen hem drie rollen te spelen:
    1. De Detective (Detectie): "Welke beweging zie je?"
    2. De Vertaler (Kennis): "Wat betekent deze beweging meestal?"
    3. De Psycholoog (Uitleg): "Gezien de hele scène, wat voelt deze persoon op dit moment echt?"

3. De Resultaten: De Valstrik van "Over-interpretatie"

De resultaten waren verrassend en een beetje zorgwekkend voor de AI.

  • Het "Hallucinatie"-Probleem: De AI is als een student die zo graag het juiste antwoord wil dat hij dingen verzonnen. Als een persoon in een video gewoon stil zit, kan de AI zeggen: "Ze voelen duidelijk diep existentieel wanhoop."
    • De Term uit het Artikel: Over-interpretatie. De AI ziet een beweging en dwingt er een psychologische betekenis aan op, zelfs als de beweging betekenisloos is of gewoon een willekeurige tic.
  • Het Kloof: Zelfs de slimste AI-modellen (zoals GPT-4o) scoorden aanzienlijk lager dan menselijke experts.
    • Mensen: Toen experts werden gevraagd om de betekenis van een lichaamsbeweging te raden, hadden ze het ongeveer 89% van de tijd goed.
    • AI: De beste AI-modellen hadden het slechts ongeveer 45-65% van de tijd goed.
  • De "Ongeldige" Aanwijzing Test: De onderzoekers voegden "trick"-clips toe waarbij een beweging zichtbaar was, maar in die context eigenlijk niets specifieks betekende (bijvoorbeeld iemand die gewoon verschuift in zijn stoel omdat de stoel oncomfortabel was). De AI probeerde bijna altijd een diepe emotionele betekenis toe te kennen aan deze willekeurige bewegingen, terwijl mensen correct antwoordden: "Dit betekent niets bijzonders."

4. Waarom is dit belangrijk?

Het artikel betoogt dat AI om echt met mensen te kunnen interageren (zoals een robotassistent of een virtuele vriend), meer moet begrijpen dan alleen woorden. Het moet de "stille taal" van onze lichamen begrijpen.

Momenteel is AI als een persoon die perfect Engels spreekt, maar geen idee heeft dat het over elkaar slaan van je armen meestal betekent dat je gesloten bent. Het mist de "vibe check" die menselijke connectie werkbaar maakt.

Samenvatting in het Kort

  • Het Doel: Kan AI lichaamstaal lezen?
  • De Test: Een nieuwe benchmark genaamd MOTION2MIND met echte video-clips en een door experts samengesteld woordenboek van gebaren.
  • Het Oordeel: Nee, niet echt. AI is momenteel slecht hierin. Het mist vaak duidelijke gebaren en, nog gevaarlijker, het verzonnen diepe emotionele betekenissen voor willekeurige bewegingen die niets betekenen.
  • De Leerervaring: We hebben nog een lange weg te gaan voordat machines echt de "sfeer in de kamer" kunnen lezen. Ze zijn nog te letterlijk en geneigd om dingen te verzinnen als het gaat om menselijke lichaamstaal.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →