Unveiling Fine-Grained Visual Traces: Evaluating Multimodal Interleaved Reasoning Chains in Multimodal STEM Tasks
Dit artikel introduceert StepSTEM, een rigoureuze benchmark op graduate-niveau met 283 problemen en een nieuw evaluatiekader op stap-niveau dat is ontworpen om fijnmazig cross-modaal redeneren in multimodale grote taalmodellen te beoordelen, en waaruit blijkt dat de huidige state-of-the-art-modellen nog steeds zwaar vertrouwen op tekstuele shortcuts in plaats van op echte visueel-tekstuele integratie.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je probeert een robot te leren hoe hij een moeilijk wetenschappelijk raadsel moet oplossen, zoals het uitzoeken hoe een brug in stand blijft of het berekenen van de baan van een satelliet. Je toont de robot een foto van de brug en een tekstuele beschrijving van het probleem.
Het Probleem: De "Cheatsleutel"-robot
Op dit moment zijn de slimste AI-robots (zogenaamde Multimodale Grootte Taalmodellen) als studenten die uitstekend kunnen lezen maar verschrikkelijk zijn in kijken. Wanneer je hen een wetenschappelijk probleem met een diagram geeft, negeren ze de afbeelding vaak volledig. Ze lezen alleen de tekst, raden het antwoord op basis van hun geheugen en zeggen: "Ik heb het opgelost!"
Het artikel noemt dit "modality collapse" (modaal instorten). Het is als een student die een wiskundetoets maakt, een grafiek ziet, maar besluit om alleen de woorden van de vraag te lezen en de grafiek te negeren omdat dat makkelijker is. Bestaande toetsen laten hen dit vaak ongestraft doorgeven, omdat ze alleen controleren of het eindantwoord klopt. Als de robot het juiste getal raadt zonder naar de afbeelding te kijken, zegt de toets: "Goed gedaan!" Maar de robot heeft niet echt geleerd hoe hij visuele aanwijzingen moet gebruiken.
De Oplossing: STEPSTEM (De "Strenge Leraar")
De auteurs hebben een nieuwe, zeer strenge toets ontwikkeld genaamd STEPSTEM. Denk hierbij aan een "afgestudeerd-niveau" examen voor robots dat hen dwingt om hun werk te tonen.
- De Valstrik: Ze hebben 283 lastige problemen ontworpen waarbij je ze niet kunt oplossen zonder naar de afbeelding te kijken. De tekst alleen is een doodlopende weg; de afbeelding bevat de sleutel. Het is als een schattenjacht waarbij de kaart (de afbeelding) de enige manier is om de schat te vinden, en de aanwijzingen (de tekst) nutteloos zijn zonder deze kaart.
- De Eisen: De robot mag niet alleen een antwoord geven; hij moet stap voor stap door de oplossing lopen, afwisselend tekst schrijvend en afbeeldingen tekenend. Het is alsof je een student vraagt om een natuurkundeprobleem op te lossen door eerst een uitleg te schrijven, dan een krachtenplan te tekenen, vervolgens de volgende stap te schrijven, daarna een nieuw diagram te tekenen, en zo verder.
- De Beoordeling: In plaats van alleen het eindgetal te controleren, hebben de auteurs een "slimme beoordelaar" gebouwd die elke enkele stap bekijkt.
- Keek de robot naar het juiste deel van de afbeelding? (Ze gebruiken "bounding boxes" als digitale post-it's om dit te controleren).
- Stemde de tekst overeen met de tekening?
- Volgde de robot een logisch pad, of sprong hij zomaar tot een conclusie?
De Resultaten: De Robots Leren Nog Steeds
Toen ze hun toprobots door deze strenge toets lieten gaan, waren de resultaten verrassend:
- De "Alleen-tekst"-experts: De krachtigste robots die alleen tekst kunnen schrijven (zoals Claude Opus 4.6 en Gemini 3.1 Pro) hadden ongeveer 38% van de antwoorden goed. Ze waren goed in de tekstgedeelten maar faalden volledig in de tekenonderdelen omdat ze letterlijk niet kunnen tekenen.
- De "Alleskunner"-robots: De robots die zowel kunnen lezen als tekenen (zoals Gemini 2.5 Flash Image) deden het beter in het tekenen, maar ze hadden nog steeds moeite om het eindantwoord goed te krijgen. Ze konden een afbeelding tekenen, maar vaak was de logica verkeerd.
- De Grote Kloof: Het artikel vond dat zelfs de beste robots nog ver verwijderd zijn van echte "visuele denkers". Ze vertrouwen te veel op tekst en hebben niet geleerd om echt zien en denken te combineren.
De Conclusie
Het artikel betoogt dat we moeten stoppen met robots alleen te vragen "Wat is het antwoord?" en moeten beginnen met vragen: "Laat me zien hoe je daar bent gekomen."
Stel je een rechercheur voor. Als een rechercheur een misdaad oplost maar niet heeft gekeken naar de vingerafdrukken of de foto's van de plaats delict, zouden we hun oplossing niet vertrouwen, zelfs niet als ze de juiste naam raden. STEPSTEM is het gereedschap dat de AI-rechercheur dwingt om naar het bewijsmateriaal (de afbeeldingen) te kijken en stap voor stap uit te leggen hoe dat bewijsmateriaal leidde tot de conclusie.
De auteurs concluderen dat, hoewel AI slimmer wordt, het nog een lange weg te gaan heeft voordat het wetenschappelijke problemen echt kan "zien" en "denken" zoals een menselijke expert. Ze hopen dat deze nieuwe toets onderzoekers zal helpen robots te bouwen die niet alleen raden, maar de visuele wereld daadwerkelijk begrijpen.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.