← Nieuwste papers
💻 computer science

Same Content, Different Answers: Cross-Modal Inconsistency in MLLMs

Deze paper introduceert de REST-benchmarks om aan te tonen dat multimodale grote taalmodellen (MLLM's) ondanks hun gedeelde inbeddingsruimte aanzienlijke inconsistenties vertonen in hun redeneervermogen over dezelfde semantische informatie, ongeacht of deze als afbeelding, tekst of een mix wordt gepresenteerd.

Oorspronkelijke auteurs: Angela van Sprang, Laurens Samson, Ana Lucic, Erman Acar, Sennay Ghebreab, Yuki M. Asano

Gepubliceerd 2026-04-23
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Angela van Sprang, Laurens Samson, Ana Lucic, Erman Acar, Sennay Ghebreab, Yuki M. Asano

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Titel: Dezelfde Inhoud, Verschillende Antwoorden: Waarom AI's "oog" en "brein" soms niet samenwerken

Stel je voor dat je een vriend vraagt om een raadsel op te lossen. Je geeft hem de vraag op drie manieren:

  1. Je schrijft de vraag op een briefje.
  2. Je tekent de vraag op een stuk papier en houdt het voor hem.
  3. Je schrijft de vraag op, maar laat een deel van de context op een foto zien.

Als je vriend slim is, zou hij op alle drie de momenten exact hetzelfde antwoord moeten geven. Maar wat als hij op het briefje "6" zegt, op de tekening "7" en op de foto "5"? Dat is precies wat deze studie ontdekt bij moderne kunstmatige intelligentie (AI).

Hier is een uitleg van het onderzoek in gewone taal, met een paar leuke vergelijkingen.

1. Het Probleem: De "Twee Hoeden" van de AI

Moderne AI-modellen (zoals die van Google, OpenAI en Microsoft) zijn getraind om zowel tekst als beelden te begrijpen. Ze hebben één "brein" dat beide moet verwerken. De onderzoekers noemen dit een Multimodaal Groot Taalmodel (MLLM).

De onderzoekers dachten: "Als ze alles in één ruimte opslaan, moeten ze logisch redeneren, ongeacht of ze de informatie zien of lezen."

Maar ze ontdekten iets vreemds: Deze AI's zijn niet consistent. Ze geven verschillende antwoorden op exact dezelfde vraag, afhankelijk van hoe de vraag wordt gepresenteerd.

De Analogie: Stel je voor dat je een vertaler hebt die perfect Frans en Engels spreekt. Als je hem een zin in het Frans geeft, vertaalt hij hem perfect. Maar als je diezelfde zin op een kaartje schrijft en hem het kaartje laat zien (alsof het een tekening is), begint hij opeens in het Nederlands te antwoorden of maakt hij een fout. De inhoud is hetzelfde, maar de manier waarop hij er naar kijkt, verandert zijn gedrag.

2. De Test: De "REST" Proef

Om dit te bewijzen, hebben de onderzoekers een nieuwe test bedacht, genaamd REST (Render-Equivalence Stress Tests).

  • Ze namen vragen (zoals wiskundeproblemen of meerkeuzevragen).
  • Ze maakten er drie versies van: puur tekst, puur een afbeelding van tekst, en een mix.
  • Ze zorgden ervoor dat de AI de letters op de foto's echt goed kon lezen (geen slechte OCR, zoals een slechte scanner).

Het resultaat?
Niets. Geen enkel model gaf altijd hetzelfde antwoord.

  • De beste modellen (zoals GPT-5 mini en Claude Haiku) gaven in ongeveer 90% van de gevallen het juiste antwoord, ongeacht de vorm.
  • De slechtere modellen gaven in slechts 6% tot 10% van de gevallen een consistent antwoord.
  • De grote verrassing: Zelfs als de AI de tekst op de foto perfect kon lezen, gaf hij soms een ander antwoord dan bij de tekstversie. Het probleem zit hem niet in het "zien", maar in het "denken".

3. Waarom gebeurt dit?

De onderzoekers keken diep in het "brein" van de AI (de interne representaties) en vonden de oorzaak:

  • De Twee Werelden: In het brein van de AI bestaan er twee verschillende gebieden. Eén gebied voor tekst en één voor beelden. Deze gebieden liggen niet perfect naast elkaar; er is een kloof.
  • De Reis: Wanneer de AI een vraag als tekst krijgt, reist hij door het "tekst-gebied". Als hij een vraag als afbeelding krijgt, moet hij eerst de afbeelding vertalen naar een tekst-achtig signaal, maar die vertaling landt in een ander deel van het brein. Omdat deze gebieden niet perfect op elkaar afgestemd zijn, krijgt de AI een iets ander gevoel bij dezelfde vraag.

De Analogie: Denk aan een muzikant die een liedje zingt. Als hij het liedje uit zijn hoofd zingt (tekst), klinkt het perfect. Maar als hij het liedje moet spelen terwijl hij naar een partituur kijkt die op een raar hoekje is geplakt (afbeelding), raakt hij de toon kwijt. Het liedje is hetzelfde, maar de manier waarop hij er naar kijkt, verstoort zijn ritme.

4. Kleine details maken een groot verschil

De onderzoekers ontdekten ook dat kleine veranderingen in de afbeelding de AI gek kunnen maken:

  • Resolutie: Als de foto wazig is (lage resolutie), wordt de AI veel onzekerder.
  • Kleur: Verrassend genoeg werken sommige AI's beter met gekleurde tekst dan met zwarte tekst. Alsof ze de kleur als een "hint" zien.
  • Lettertype: Een sierlijk lettertype (cursief) maakte de AI niet per se slimmer of dommer, maar het hielp ook niet.

5. Wat betekent dit voor de toekomst?

Deze studie is een belangrijke waarschuwing. We denken vaak dat AI's slimmer worden naarmate ze meer data zien, maar dit onderzoek toont aan dat ze nog steeds "slordig" zijn in hun redeneerprocessen.

  • Betrouwbaarheid: Als je een AI gebruikt voor kritieke taken (zoals medische diagnoses of juridisch advies), moet je oppassen. Als je de vraag als tekst invoert, krijg je misschien een goed antwoord. Als je dezelfde vraag als screenshot invoert, kan het antwoord verkeerd zijn.
  • De oplossing? De onderzoekers suggereren dat we de AI's moeten leren om de "tekst-wereld" en de "beeld-wereld" beter met elkaar te verbinden. Als die twee gebieden in hun brein dichter bij elkaar komen, wordt de AI betrouwbaarder.

Kortom:
Deze AI's zijn als een genie dat soms een bril opzet en soms niet. Als hij de bril op heeft (tekst), ziet hij alles scherp. Zonder bril (of met een rare bril, zoals een afbeelding) ziet hij dezelfde wereld, maar begrijpt hij de regels van het spel ineens anders. De onderzoekers hebben laten zien dat we nog veel werk moeten doen om die bril voor altijd goed te laten zitten.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →