← Nieuwste papers
🤖 AI

MultivationBench: A Benchmark for Multimodal Sequential Motivation Reasoning

Het artikel introduceert MultivationBench, een nieuwe benchmark gebaseerd op psychologische kaders die het vermogen van multimodale grote taalmodellen evalueert om sequentiële motivatie-redenering uit te voeren in verhaalgestuurde visuele narratieven, waarbij wordt onthuld dat huidige modellen moeite hebben met het behouden van consistente redenering over dynamische contexten heen ondanks hun statische herkenningscapaciteiten.

Oorspronkelijke auteurs: Kawai Chung, Chunkit Chan, Yauwai Yim, Yuxuan Liu, Haochen Shi, Weiqi Wang, Qing Zong, Tianshi Zheng, Yixuan Fu, Kai Chung Wong, Hao Liang, Yifan Gao, Xi Yang, Janet Hui-wen Hsiao, Yangqiu Song

Gepubliceerd 2026-07-30
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Kawai Chung, Chunkit Chan, Yauwai Yim, Yuxuan Liu, Haochen Shi, Weiqi Wang, Qing Zong, Tianshi Zheng, Yixuan Fu, Kai Chung Wong, Hao Liang, Yifan Gao, Xi Yang, Janet Hui-wen Hsiao, Yangqiu Song

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je naar een film kijkt, maar in plaats van alleen te zien wat er gebeurt, probeer je te raden waarom de personages het doen. Dit is de kern van "sociale intelligentie", een superkracht die mensen hebben waarmee ze de verborgen gevoelens en doelen achter onze acties kunnen begrijpen. Wetenschappers noemen dit "motivatie-redeneren". Het gaat niet alleen om zien dat iemand een telefoon oppakt; het gaat erom uit te zoeken of ze bellen voor hulp, de tijd controleren, of naar een foto kijken van een dierbare die is overleden. Meestal raden we dit niet af van één bevroren plaatje. We kijken hoe het verhaal zich ontvouwt en verzamelen gaandeweg aanwijzingen. Als een personage in scène één verdrietig kijkt en dan in scène twee een foto ziet, verandert onze schatting van hun motivatie. Dit artikel duikt in de vraag of de nieuwste, superintelligente computerbreinen (genaamd Multimodale Large Language Models) dit soort "verhaaldetectivewerk" ook kunnen doen. Hoewel deze computers geweldig zijn in het bekijken van een afbeelding en deze beschrijven, of een verhaal lezen en vragen beantwoorden, stelt dit onderzoek een moeilijkere vraag: Kunnen ze de veranderende gevoelens van een personage als een heel verhaal volgen, net zoals een mens dat doet?

De onderzoekers achter deze studie, geleid door een team van de Hong Kong University of Science and Technology en Amazon, besloten een enorme test te bouwen om dit uit te vinden. Ze creëerden iets dat MultivationBench wordt genoemd. Denk aan een enorme bibliotheek van 1.000 korte visuele verhalen, zoals een mix van filmfragmenten en sociale media-berichten, met meer dan 4.000 specifieke momenten waarop een personage iets doet. Maar dit is niet alleen een test van "wat er gebeurde"; het is een test van "waarom het gebeurde". Om de test eerlijk en wetenschappelijk te maken, gebruikten het team twee beroemde psychologische regelboeken: Maslows Piramide van Behoeften (die menselijke verlangens sorteert van basisoverleving zoals voedsel en veiligheid tot hogere doelen zoals liefde en zelfontplooiing) en Reiss's 16 Basisverlangens (die kijkt naar specifieke persoonlijke drijfveren zoals nieuwsgierigheid, eer of familie).

Het team vroeg de computermodellen om deze verhalen frame voor frame te bekijken. Bij elke stap moesten de modellen de motivatie van het personage raden op basis van alleen wat ze tot dan toe hadden gezien. Het lastige deel? Naarmate het verhaal vorderde, verscheen er nieuwe informatie die de reden voor een eerdere actie volledig veranderde. Bijvoorbeeld: een personage reikt naar een telefoon, en in eerste instantie lijkt het alsof ze even een berichtje checken (een "cognitieve" behoefte). Maar later onthult het verhaal dat ze naar een foto van hun familie kijken terwijl ze zich eenzaam voelen op een feestje, wat betekent dat de echte reden eigenlijk over "Liefde en Verbondenheid" ging. De computer moest slim genoeg zijn om te zeggen: "Wacht, ik zat er eerst naast; nu weet ik de echte reden."

De resultaten waren een beetje een wake-up call voor de techwereld. Het artikel stelde vast dat hoewel deze geavanceerde AI-modellen redelijk zijn in het raden van motivaties in korte, eenvoudige verhalen, ze echt moeite hebben wanneer het verhaal langer wordt. Van de 1.000 geteste verhalen konden de modellen zelden hun redenering van begin tot eind consistent houden. Sterker nog, wanneer gevraagd werd om elke enkele motivatie in een heel verhaal goed te krijgen, slaagden de beste modellen er minder dan 1% van de tijd in. De studie suggereert dat deze AI-breinen als studenten zijn die geweldig zijn in het memoriseren van feiten, maar slecht in het begrijpen van de loop van een plot. Ze lijken vast te blijven zitten aan het eerste dat ze zien en slagen er niet in om hun denken bij te stellen wanneer er nieuw bewijs arriveert. Ze "hallucineren" vaak redenen die aannemelijk klinken maar niet door het verhaal worden ondersteund, of ze missen de diepere, complexere emotionele redenen die het verbinden van punten over het hele narratief vereisen.

De onderzoekers vergeleken de AI ook met echte mensen. De mensen, die bestonden uit afstudeerstudenten, waren aanzienlijk beter in de taak, vooral wanneer de verhalen lang en complex waren. Deze kloof laat zien dat hoewel AI beter wordt in zien en lezen, het nog steeds het "sociale brein" mist dat nodig is om te begrijpen hoe onze motivaties in de loop van de tijd verschuiven en evolueren. Het artikel concludeert dat we nog ver verwijderd zijn van computers die werkelijk de rommelige, veranderende redenen achter menselijk gedrag in een verhaal kunnen begrijpen. Het is een herinnering dat begrijpen waarom mensen doen wat ze doen, veel moeilijker is dan alleen weten wat ze deden.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →