← Nieuwste papers
💬 NLP

MM-THEBench: Do Reasoning MLLMs Think Reasonably?

Dit artikel introduceert MM-THEBench, een uitgebreide benchmark die is ontworpen om hallucinaties in de tussenliggende redeneerstappen van multimodale grote taalmodellen te evalueren, waarmee het gat in bestaande beoordelingeningetikt die de interne denkprocessen van post-getrainde redeneermodellen over het hoofd zien.

Oorspronkelijke auteurs: Zhidian Huang, Zijun Yao, Ji Qi, Shangqing Tu, Junxian Ma, Jinxin Liu, Weichuan Liu, Xiaoyin Che, Lei Hou, Juanzi Li

Gepubliceerd 2026-02-02
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Zhidian Huang, Zijun Yao, Ji Qi, Shangqing Tu, Junxian Ma, Jinxin Liu, Weichuan Liu, Xiaoyin Che, Lei Hou, Juanzi Li

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een team hebt van superintelligente, veelzijdige detectives (dit zijn de Reasoning Multimodal Large Language Models, of MLLM's). Deze detectives zijn geweldig in het bekijken van een foto, het lezen van een grafiek of het bekijken van een video, en vervolgens een mysterie oplossen.

In het verleden riepen deze detectives gewoon hun eindantwoord: "De verdachte is de butler!" Maar onlangs zijn ze getraind om hardop te denken voordat ze spreken. Ze schrijven een lange lijst met aanwijzingen en logische stappen op (genaamd Chain-of-Thought of CoT) om uit te leggen hoe ze tot die conclusie zijn gekomen.

Het probleem? Soms, zelfs als de detective een lange, chique lijst met stappen opschrijft, zijn sommige van die stappen totale leugens (hallucinaties). Toch roepen ze door puur geluk of door de leugens over te slaan, nog steeds het juiste eindantwoord.

Dit artikel introduceert een nieuwe tool genaamd MM-THEBENCH om deze detectives op heterdaad te betrappen terwijl ze liegen tijdens hun denkproces.

De Nieuwe Trainingsgrond voor Detectives: MM-THEBENCH

Zie MM-THEBENCH als een hoogtechnologische "leugendetectortest" die specifiek is ontworpen voor het denkproces, niet alleen voor het eindantwoord.

1. De Drie Soorten Leugens (De Taxonomie)
De auteurs realiseerden zich dat wanneer een detective liegt, dit meestal in één van drie categorieën valt. Ze maakten een checklist om ze te spotten:

  • De "Foutieve Geheugen" Leugen (Kennis): De detective verzint een feit dat hij op school heeft geleerd. Voorbeeld: "Ik weet zeker dat de Eiffeltoren in Londen staat." (Dat is het niet).
  • De "Slechte Zicht" Leugen (Perceptie): De detective kijkt naar de foto, maar ziet dingen die er niet zijn. Voorbeeld: "Ik zie een rode auto in de foto," terwijl de auto eigenlijk blauw is.
  • De "Slechte Logica" Leugen (Redeneren): De detective ziet de juiste dingen, maar legt de verbindingen verkeerd. Voorbeeld: "De auto is blauw, en blauwe auto's zijn snel, dus deze auto is een Ferrari." (Slechte logica).

2. Het Beoordelingssysteem (Rubrics)
In plaats van alleen te controlか of het eindantwoord goed of fout is, breekt MM-THEBENCH het denkproces van de detective af in kleine, atomaire stappen.

  • Stel je een wiskundeprobleem voor. De "Gold Standard" oplossing heeft 5 specifieke stappen.
  • Het systeem controleert het 20-stappen tellende denkproces van de detective tegenover die 5 gouden stappen.
  • Het vraagt: "Heb je de auto echt gezien? Weet je de regel over driehoeken? Heb je de berekening goed gedaan?"
  • Het geeft een score voor elke afzonderlijke stap en markeert precies waar de "leugen" plaatsvond.

Wat Ze Hebben Ontdekt (De Resultaten)

De auteurs testten 14 van de slimste detectiemodellen ter wereld (inclusief grote namen zoals GPT-5, Claude en Gemini) met deze nieuwe test. Dit is wat zij ontdekten:

1. De "Correcte Antwoord" Valstrik
Alleen omdat een detective het juiste eindantwoord krijgt, betekent dit niet dat hij correct heeft nagedacht.

  • Analogie: Stel je een student voor die een wiskundetoets maakt. Hij schrijft een paragraaf vol onzin, verzint getallen en gebruikt de verkeerde logica, maar raadt vervolgens het eindgetal en heeft het goed.
  • Bevinding: Veel modellen kregen het juiste antwoord, ook al waren hun "denkstappen" vol hallucinaties. Het denkproces was geen getrouwe uitleg van hoe ze het probleem hadden opgelost.

2. Het Verschil tussen "Slechte Zicht" en "Slechte Logica"
Dit was een verrassende ontdekking:

  • Perceptie-hallucinaties (Slecht Zicht): Deze komen heel vaak voor. De modellen identificeren objecten of kleuren vaak foutief. Echter, dit verpest zelden het eindantwoord. Het model denkt misschien dat een auto rood is terwijl hij blauw is, maar het begrijpt nog steeds dat de auto beweegt.
  • Redenerings-hallucinaties (Slechte Logica): Deze zijn zeldzaam, maar dodelijk. Als het model de logica verpest (bijv. "Als A dan B" terwijl het eigenlijk "Als A dan C" is), is het eindantwoord bijna altijd fout.
  • Takeaway: Het is beter om een detective met slecht zicht te hebben dan een met een kapotte hersenpan.

3. Het "Overdenken" Probleem
Het artikel vond dat wanneer modellen worden gedwongen langer na te denken (meer stappen), ze niet noodzakelijkerwijs slimmer worden.

  • Analogie: Stel je een detective voor die steeds meer aantekeningen maakt. De eerste 5 aantekeningen zijn briljant. De volgende 15 aantekeningen zijn slechts een vorm van rondbabbelen, zichzelf herhalen of nieuwe feiten verzinnen.
  • Bevinding: Naarmate het denken langer wordt, daalt de "precisie". De modellen genereren veel extra, nutteloze of gehallucineerde stappen om de ruimte te vullen. Ze zijn aan het "overdenken" en dwalen af van de waarheid.

De Kern van het Verhaal

Het artikel betoogt dat we niet langer simpelweg het eindantwoord kunnen vertrouwen dat een model geeft. We moeten kijken naar hoe ze daar gekomen zijn.

MM-THEBENCH is als een vergrootglas dat ons dwingt om in het notitieblok van de detective te kijken. Het laat ons zien dat hoewel deze AI-modellen beter worden in het oplossen van problemen, hun interne "denken" vaak rommelig is, vol kleine leugens zit en soms volledig losstaat van de realiteit. Om ze echt betrouwbaar te maken, moeten we hun denkproces verbeteren, niet alleen hun eindantwoorden.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →