MentisOculi: Revealing the Limits of Reasoning with Mental Imagery
Het artikel introduceert MentisOculi, een benchmark-suite die aantoont dat, ondanks het potentieel van visuele redenering, huidige unificerende multimodale modellen er niet in slagen de prestaties te verbeteren door middel van tussenliggende visualisaties vanwege cumulatieve generatiefouten en een onvermogen om visuele hulpmiddelen effectief te benutten.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een complexe puzzel probeert op te lossen, zoals een schuifpuzzel of een papiervouwtruc. Je weet dat mensen dit vaak oplossen door hun ogen te sluiten en de stukjes in hun geest te "zien" bewegen. Dit noemen we mentale beeldvorming.
Onlangs zijn geavanceerde AI-modellen erg goed geworden in zowel het lezen van tekst als het creëren van afbeeldingen. Dit leidde onderzoekers tot een grote vraag: Kunnen deze AI's hun eigen "mentale beelden" gebruiken om te denken en problemen op te lossen, net zoals mensen dat doen?
Om dit uit te vinden, hebben de auteurs van dit paper een nieuwe testomgeving gecreëerd genaamd MENTISOCULI (wat ruwweg vertaalt als "Ogen van de Geest").
De Test: Een Mentale Gym voor AI
De onderzoekers hebben vijf verschillende soorten puzzels gebouwd die moeilijk te beschrijven zijn met woorden, maar makkelijk op te lossen als je ze kunt visualiseren. Denk aan ze als een gym voor het brein:
- Vormbord: Het passen van puzzelstukjes in een specifieke vorm.
- Scharniervouwen: Uitzoeken hoe je verbonden vormen moet draaien om een doel te bereiken.
- Papiervouwen: Voorspellen waar gaatjes zullen verschijnen nadat een stuk papier is gevouwen en doorboord.
- Rush Hour: Auto's uit een verkeersopstopping bewegen.
- Schuifpuzzel: Een door elkaar gehusselde afbeelding weer in elkaar zetten.
Deze puzzels worden moeilijker, omdat ze meer stappen en complexere mentale "zetten" vereisen.
Het Experiment: AI Laten "Denken" met Afbeeldingen
De onderzoekers hebben de slimste AI-modellen van dit moment getest. Ze gaven de modellen een keuze:
- De Oude Manier: De puzzel oplossen met alleen woorden (zoals een mens die een probleem hardop doorloopt).
- De Nieuwe Manier: De puzzel oplossen door tussenliggende afbeeldingen te genereren. De AI zou de volgende stap van de puzzel in zijn geest (of op het scherm) "tekenen" voordat hij besluit wat de volgende actie is.
Het is alsof je een schaker vraagt om ofwel alleen over de zetten na te denken, of om na elke enkele zet ook daadwerkelijk het bord te tekenen om de planning te ondersteunen.
De Grote Ontdekking: Tekenen Helpt Nog Niet (Eerst)
De resultaten waren verrassend. Ondanks de vaardigheid van de modellen om prachtige afbeeldingen te maken, hielp het genereren van hun eigen "mentale plaatjes" hen niet om de puzzels op te lossen. Sterker nog, het maakte hen vaak slechter in hun prestaties.
Dit is waarom, gebruikmakend van enkele eenvoudige analogieën:
1. Het "Hallucinerende Kunstenaar"-probleem
Stel je een kunstenaar voor die geweldig is in het tekenen van een enkele auto, maar wanneer er wordt gevraagd om een hele verkeersopstopping te tekenen waarbij auto's één voor één bewegen, vergeet hij steeds hoe de auto's in het vorige frame eruit zagen. Hij voegt misschien een nieuwe auto toe die er niet was, laat een auto verdwijnen, of verandert de kleur van het stopbord.
De paper vond dat wanneer AI-modellen probeerden deze "denk-afbeeldingen" te genereren, ze in elke stap kleine fouten maakten. Tegen de tijd dat ze de laatste stap bereikten, was de afbeelding zo vervormd en foutief dat de AI de afbeelding niet meer kon vertrouwen. Het was alsoals navigeren door een doolhof met een kaart waarvan de muren elke keer dat je kijkt veranderen.
2. Het "Twee Breinen"-probleem
De onderzoekers ontdekten dat het "tekstbrein" van de AI (het vermogen om te redeneren met woorden) en het "beeldbrein" (het vermogen om te tekenen) niet met elkaar communiceerden.
- Het tekstbrein kon soms het juiste antwoord vinden als het zich puur op logica baseerde.
- Het beeldbrein kon soms een correct plaatje tekenen.
- Maar wanneer de AI probeerde de afbeelding te gebruiken om het tekstbrein te helpen, raakten ze in de war. Het tekstbrein negeerde de afbeelding, of de afbeelding toonde een compleet andere oplossing dan de tekst. Ze waren als twee mensen die een boot probeerden te besturen in verschillende richtingen.
3. De "Oracle"-test
Om te zien of het probleem bij het tekenen of bij het begrijpen lag, gaven de onderzoekers de AI perfecte, ware afbeeldingen (zoals een spiekbriefje dat de juiste volgende stap laat zien). Zelfs met deze perfecte plaatjes bleef de AI moeite houden met het gebruiken ervan om de puzzel op te lossen. Dit bewees dat de AI niet alleen slecht is in tekenen; de AI is ook slecht in het interpreteren van visuele informatie om beslissingen te nemen.
De Vergelijking met Mensen
De onderzoekers vroegen ook aan menselijke studenten om deze puzzels op te lossen.
- Mensen: Wanneer de puzzel moeilijker werd, besteedden mensen meer tijd aan het nadenken en namen ze meer stappen om het op te lossen. Ze pasten hun inspanning aan.
- AI: Wanneer de puzzel moeilijker werd, veranderde de AI zijn strategie niet. Het besteedde niet meer "denktijd" (tokens) en probeerde het niet harder. Het bleef op precies dezelfde manier falen.
De Conclusie
De paper concludeert dat hoewel het idee dat AI "mentale beeldvorming" gebruikt om te denken zeer aantrekkelijk is, de huidige technologie er nog niet klaar voor is.
De modellen zijn als een persoon die een auto perfect kan beschrijven en ook een auto perfect kan tekenen, maar als je hen vraagt om een auto stap-voor-stap door een verkeersopstopping te laten rijden, verliezen ze het overzicht over de regels. Ze kunnen de kloof tussen het genereren van een afbeelding en het redeneren met die afbeelding nog niet overbruggen.
Voorlopig zijn deze AI-modellen beter af door zich bij complexe redeneertaken bij woorden te houden. De "ogen van de geest" staan open, maar ze zien nog niet helder genoeg om het brein te helpen denken.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.