← Nieuwste papers
💻 computer science

MetaphorVU: Towards Metaphorical Video Understanding

Dit artikel introduceert MetaphorVU-Bench, de eerste uitgebreide benchmark voor metaforisch video-begrip, onthult dat huidige MLLM's moeite hebben met domeinoverschrijdende mapping, en stelt MetaphorBoost voor, een inferentieframework dat gebruikmaakt van een metafoorkennisgraf om de prestaties aanzienlijk te verbeteren.

Oorspronkelijke auteurs: Zhuoqun Li, Boxi Cao, Guiping Jiang, Fangrui Lv, Ruotong Pan, Jianan Wang, Xiangyu Wu, Hongyu Lin, Yaojie Lu, Yong Du, Ruyin Jia, Liyan, Tingting Gao, Han Li, Xianpei Han, Le Sun

Gepubliceerd 2026-05-26
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Zhuoqun Li, Boxi Cao, Guiping Jiang, Fangrui Lv, Ruotong Pan, Jianan Wang, Xiangyu Wu, Hongyu Lin, Yaojie Lu, Yong Du, Ruyin Jia, Liyan, Tingting Gao, Han Li, Xianpei Han, Le Sun

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een korte video bekijkt. Op het oppervlak zie je een groep varkens in chique smoking die aan een weelderig banket eten, terwijl katten onder de tafel om restjes schuilen.

Een menselijke kijker begrijpt direct het echte verhaal: dit gaat niet over dieren; het is een kritiek op een corrupte heersende klasse (de varkens) die rijkdom steelt van de armen (de katten). Dit is metafoor: het gebruik van het ene om iets anders volledig te vertegenwoordigen.

Dit artikel, MetaphorVU, betoogt dat hoewel Kunstmatige Intelligentie (KI) zeer goed geworden is in het beschrijven wat er in een video te zien is (bijvoorbeeld: "Er is een varken"), het vreselijk slecht is in het begrijpen wat de video betekent (bijvoorbeeld: "Dit is een politieke satire").

Hier volgt een eenvoudige uiteenzetting van hun bevindingen en oplossing:

1. Het Probleem: KI is "Letterlijk Georiënteerd"

De onderzoekers bouwden een nieuwe test genaamd MetaphorVU-Bench. Denk hierbij aan een "eindexamen" voor KI, met 860 video's uit de echte wereld die vertrouwen op metaforen (zoals het varkenbanket).

Ze testten de slimste KI-modellen die vandaag beschikbaar zijn (inclusief reuzen zoals GPT-5 en Gemini).

  • Het Resultaat: De KI-modellen faalden jammerlijk. Ze scoorden ongeveer 64 van de 100, terwijl mensen ongeveer 83 scoorden.
  • De Diagnose: De KI faalde niet omdat het de varkens of de katten niet kon zien. Het faalde omdat het de verbinding niet kon leggen. Het zag de "visuele elementen" maar kon ze niet koppelen aan de "onderliggende concepten".
    • Analogie: Het is als een vertaler die elk woord in een woordenboek kent, maar de grappen of uitdrukkingen niet begrijpt. Ze kunnen "Het regent katten en honden" letterlijk vertalen, maar ze snappen niet dat het gewoon betekent "het regent hard".

2. De Oplossing: KI een "Spiekbriefje" Geven

De onderzoekers realiseerden zich dat de KI niet dom was; het miste gewoon de specifieke "culturele kennis" die nodig was om deze sprongen te maken. Om dit op te lossen, bouwden ze MetaphorBoost.

  • Het Metafoor-Kennisnetwerk: Stel je een gigantisch, digitaal web voor dat concepten met elkaar verbindt. In dit web is "varken" gekoppeld aan "gierigheid", "smoking" aan "macht" en "banket" aan "overdaad". Dit is niet zomaar een lijst met feiten; het is een kaart van hoe metaforen werken.
  • Hoe het Werkt: Wanneer de KI een video bekijkt, in plaats van zelf de betekenis te raden, pauzeert MetaphorBoost en vraagt dit "Kennisnetwerk": "Hé, ik zie een varken in een smoking. Wat symboliseert dat meestal in de menselijke cultuur?" Het netwerk antwoordt: "Macht en gierigheid."
  • Het Resultaat: Met dit "spiekbriefje" (of externe steun) steeg de prestatie van de KI aanzienlijk. Het werd niet alleen beter in het raden; het werd beter in het redeneren omdat het de juiste hulpmiddelen had om de punten met elkaar te verbinden.

3. De 8 Soorten Metaforen

Het artikel organiseerde deze lastige video's ook in 8 categorieën, waaruit blijkt dat metaforen in vele vormen voorkomen:

  1. Lichaamstaal: Het gebruik van overdreven bewegingen (zoals een student die danst en vervolgens instort) om hoop die overgaat in wanhoop te tonen.
  2. Sfeer: Het gebruik van donker licht of triest muziek om eenzaamheid te tonen.
  3. Culturele Symbolen: Het gebruik van een specifiek object (zoals een lantaarn) om een wens voor succes te vertegenwoordigen.
  4. Naturalistische Symbolen: Het gebruik van een verwelkende bloem om een stervende relatie te vertegenwoordigen.
  5. Causale Montage: Het tonen van oorzaak en gevolg (bijvoorbeeld: een ring opdoen \rightarrow vloeren vegen) om te impliceren "huwelijk brengt hard werk".
  6. Analogische Montage: Het tonen van twee vergelijkbare dingen naast elkaar (bijvoorbeeld: een kinder spel en een volwassen baan) om te laten zien hoe we onze jeugd missen.
  7. Surrealistisch Verhaal: Het gebruik van onmogelijke dingen (zoals pratende dieren) om een verhaal over het echte leven te vertellen.
  8. Performatief Verhaal: Het gebruik van acteurs in een sketch om sociaal gedrag te bekritiseren.

De Conclusie

Het artikel concludeert dat huidige KI geweldig is in perceptie (de wereld zien) maar zwak in cognitie (de diepere betekenis van de wereld begrijpen).

Om KI menselijke communicatie echt te laten begrijpen, kunnen we de modellen niet alleen groter maken; we moeten hen betere "kaarten" geven van hoe mensen ideeën met elkaar verbinden. Door een Metafoor-Kennisnetwerk toe te voegen, lieten ze zien dat KI kan leren "de grap te snappen" en de verborgen betekenissen in onze video's te begrijpen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →