← Nieuwste papers
🤖 AI

WorldSense: Evaluating Real-world Omnimodal Understanding for Multimodal LLMs

Deze paper introduceert WorldSense, het eerste benchmark voor het evalueren van het begrijpen van realistische video's door multimodale LLM's via een sterke integratie van visuele, auditieve en tekstuele informatie, en toont aan dat huidige modellen hierin nog aanzienlijke beperkingen ondervinden.

Oorspronkelijke auteurs: Jack Hong, Shilin Yan, Jiayin Cai, Xiaolong Jiang, Yao Hu, Weidi Xie

Gepubliceerd 2026-03-03
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Jack Hong, Shilin Yan, Jiayin Cai, Xiaolong Jiang, Yao Hu, Weidi Xie

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

🌍 WorldSense: De "Reële Wereld" Test voor AI

Stel je voor dat je een nieuwe student aan het trainen bent om een autonome auto te besturen. Je kunt hem niet alleen leren kijken naar de weg (visueel), want dat is niet genoeg. Hij moet ook horen dat er een sirene achter hem komt (auditief) en voelen hoe de weg trilt (tactiel). Als hij alleen naar de weg kijkt, ziet hij misschien een stopbord, maar hij hoort niet dat er een ambulance nadert die voorrang heeft.

WorldSense is precies zo'n test voor kunstmatige intelligentie (AI), maar dan specifiek voor video's. Het is de eerste "examen" die AI-modellen niet alleen laat kijken, maar ook luisteren en lezen tegelijkertijd, net zoals een mens dat doet in de echte wereld.


🧩 Wat maakt WorldSense zo speciaal?

Vroeger waren de tests voor AI vaak als volgt: je gaf de computer een foto en vroeg: "Wat zie je?" of je gaf een video zonder geluid en vroeg: "Wat gebeurt er?"
Dit is als een examen waarbij je alleen mag kijken, maar niet mag praten of luisteren. De echte wereld werkt echter anders.

WorldSense heeft drie unieke kenmerken:

  1. De "Oor-En-Oog" Dans (Omnimodale Integratie):
    In de echte wereld zijn geluid en beeld onlosmakelijk verbonden. In WorldSense zijn de vragen zo ontworpen dat je beide zintuigen nodig hebt om het antwoord te vinden.

    • Voorbeeld: Je ziet een man met een fruit in zijn hand. Alleen kijken zegt je niet wat hij doet. Maar als je luistert, hoor je dat hij zegt: "Kijk hoe groot deze blauwe bes is!" Dan pas snap je het antwoord. Als je het geluid wegneemt, raakt de AI in de war.
  2. Een Wereldvol Volledig Boek (Diversiteit):
    De test bevat niet alleen één soort video. Het is een bibliotheek van 1.662 video's uit 8 verschillende werelden (zoals sport, muziek, dagelijks leven, films).

    • Analogie: Het is alsof je een student niet alleen laat rekenen met appels, maar ook met auto's, muzieknummers, politieke speeches en sportwedstrijden. Er zijn 3.172 vragen die variëren van simpel "wat zie je?" tot complex "waarom gebeurde dit?".
  3. De Strakke Kwaliteitscontrole (Hoge Kwaliteit):
    De vragen zijn niet zomaar door een computer gegenereerd. 80 experts (mensen) hebben elke vraag handmatig geschreven, gecontroleerd en verbeterd.

    • Vergelijking: Het is alsof je een examen maakt dat niet door een robot is bedacht, maar door een team van de beste leraren ter wereld die er zeker van zijn dat de vragen eerlijk en moeilijk zijn.

📉 Wat leerden we uit de test? (De Resultaten)

Toen de onderzoekers de slimste AI-modellen ter wereld (zoals Gemini, GPT-4o en verschillende open-source modellen) deze test lieten doen, was het resultaat verrassend en een beetje teleurstellend:

  • De "Blinde" AI's: Modellen die alleen naar video's kijken (zonder geluid) deden het redelijk, maar niet geweldig.
  • De "Doof" AI's: Modellen die zowel video als geluid konden ontvangen, deden het slechter dan de modellen die alleen keken!
    • Waarom? Het is alsof je iemand een boek geeft met tekst én een geluidsopname, maar de persoon kan de tekst niet koppelen aan het geluid. Ze raken in de war door de twee informatiebronnen. Ze "luisteren" wel, maar ze begrijpen niet wat het geluid betekent in relatie tot het beeld.
  • De Beste (maar nog niet perfect): De allerbeste commerciële AI (Gemini 2.5 Pro) haalde ongeveer 65% correcte antwoorden.
    • Betekenis: Zelfs de slimste AI's halen nog niet de 100% van een mens. Ze maken veel fouten bij het begrijpen van emoties, ritmes in muziek of complexe situaties.

🔍 Waarom maken ze fouten?

De onderzoekers keken naar de fouten en vonden drie hoofdredenen:

  1. Ze horen maar niet echt: AI's zijn goed in tekst, maar slecht in het "voelen" van geluid. Ze kunnen een teksttranscript lezen ("muziek klinkt blij"), maar ze missen de nuance van hoe het klinkt (de toonhoogte, de snelheid).
  2. Ze kunnen niet samenkomen: De AI's behandelen het beeld en het geluid als twee aparte lijnen die nooit samenkomen. Ze missen de "magische connectie" tussen wat je ziet en wat je hoort.
  3. Ze redeneren slecht: Soms zien ze het beeld en horen ze het geluid goed, maar trekken ze de verkeerde conclusie. Ze kunnen de puzzelstukjes niet tot een logisch geheel vormen.

🚀 Wat is de toekomst?

WorldSense is niet gemaakt om AI's te straffen, maar om hen te helpen groeien. Het paper concludeert dat we AI's moeten leren om:

  • Geluid en beeld gelijktijdig te verwerken (niet één voor één).
  • Meer te leren van de "ruis" en de emotie in geluid, niet alleen van de woorden.
  • Beter te redeneren over complexe situaties.

Kortom: WorldSense is de eerste echte "rijbewijstest" voor AI's in de multimodale wereld. Het laat zien dat we nog een lange weg te gaan hebben voordat computers echt begrijpen hoe de wereld klinkt, ziet en voelt, net zoals wij mensen doen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →