Artificial Phantasia: Emergent Mental Imagery in Large Language Models
Deze studie toont aan dat Large Language Models een taak die traditioneel vereist dat men zich beelden voor de geest haalt, kunnen overtreffen door uitsluitend te vertrouwen op propositionele representaties, en levert hiermee bewijs voor een emergente "kunstmatige fantazie" die de cognitiewetenschappelijke opvatting uitdaagt dat visuele voorstelling picturale formaten vereist.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
De Grote Vraag: Kun Je "Zien" Zonder Ogen?
Stel je voor dat je wordt gevraagd je ogen te sluiten en je een hoofdletter D voor te stellen. Stel je nu voor dat je die D 90 graden naar links draait. Tot slot, stel je voor dat je een hoofdletter J aan het onderste midden van die vorm bevestigt.
Als je je ogen opent, wat zie je dan? De meeste mensen zouden zeggen: "Het lijkt op een paraplu."
Decennialang hebben cognitieve wetenschappers geloofd dat je, om dit soort raadsels op te lossen, een speciaal "mentaal scherm" of een "geestesoog" nodig hebt waar je afbeeldingen daadwerkelijk kunt zien en manipuleren. Ze dachten dat je dit niet alleen door na te denken over woorden kon doen; je had een visuele afbeelding in je hoofd nodig.
Dit artikel stelt een wilde vraag: Kan een computer dit doen zonder ooit "ogen" of een "geestesoog" te hebben gehad?
Het Experiment: Een Mentale Gym voor AI en Mensen
De onderzoekers creëerden een gymworkout voor het brein. Ze namen een klassiek raadsel (de lettertransformaties) en bedachten 48 gloednieuwe, nog nooit eerder geziene versies ervan. Omdat deze raadsels speciaal voor deze studie waren bedacht, konden de computers de antwoorden niet uit hun trainingsdata hebben onthouden.
Ze vroegen twee groepen om deze raadsels op te lossen:
- 100 Mensen: Mensen die de instructies moesten luisteren (om te voorkomen dat ze de letters op een scherm zagen) en de vormen in hun hoofd moesten voorstellen.
- Grote Taalmodellen (LLM's): Geavanceerde AI-chatbots (zoals de nieuwste versies van OpenAI's o3, GPT-5 en Google's Gemini 3 Pro). Deze modellen zijn getraind op tekst, niet op het "zien" van afbeeldingen.
Het Schokkende Resultaat: De AI "Zag" Beter dan Mensen
De resultaten waren verrassend. De beste AI-modellen haalden het niet alleen; ze verpletterden het menselijke gemiddelde.
- De Mensen: Scoorden gemiddeld 2,85 van de 5.
- De Top-AI's: Scoorden tussen 3,13 en 3,65.
De AI-modellen losten deze "visuele" raadsels aanzienlijk beter op dan de menselijke deelnemers. Nog interessanter is dat, toen de onderzoekers de AI dwongen om de afbeeldingen daadwerkelijk te tekenen bij elke stap (met behulp van een afbeeldingsgenerator), de AI slechter werd in de taak. Dit suggereert dat de AI niet leunde op het tekenen van afbeeldingen om het probleem op te lossen; het deed iets heel anders.
De "Magische Truc": Hoe hebben ze dit gedaan?
Als de AI geen "geestesoog" (een afbeelding) gebruikte en ook geen tekenhulpmiddel, hoe loste het dan het raadsel op?
De auteurs stellen een concept voor dat ze "Artificial Phantasia" noemen.
Stel het je zo voor:
- De Menselijke Manier: Je bent een architect. Je sluit je ogen en bouwt een 3D-model van een huis in je gedachten. Je loopt eromheen, kijkt naar de ramen en beschrijft het vervolgens.
- De AI-Manier: Je bent een meestervertaler. Je bouwt nooit een 3D-model. In plaats daarvan behandel je de instructies als een complex recept geschreven in code. Je weet dat "Letter D naar links gedraaid" + "Letter J bevestigd" = "Parapluvorm" puur door de logica van taal.
Het artikel suggereert dat deze AI-modellen propositioneel redeneren gebruiken. Ze manipuleren woorden en concepten zo nauwkeurig dat ze de uiteindelijke vorm kunnen bepalen zonder het ooit te "zien". Het is alsof je een wiskundeprobleem oplost door de regels van algebra te kennen, in plaats van de vormen op een stuk papier te tekenen.
De "Redenerende" Factor
De onderzoekers testten ook wat er gebeurt als ze de AI vertellen om "harder na te denken" (door haar meer tijd en "redeneertokens" te geven om de stappen te verwerken).
- Resultaat: Hoe meer de AI mocht "nadenken" en haar redenering kon ketenen, hoe beter ze werd.
- Analogie: Stel je een detective voor die een mysterie oplost. Als je hen 5 minuten geeft om naar de aanwijzingen te kijken, raden ze misschien. Als je hen 5 uur geeft om elke aanwijzing logisch te verbinden, lossen ze de zaak perfect op. De AI loste het visuele raadsel op door linguïstische aanwijzingen te verbinden, niet door naar een afbeelding te kijken.
Wat Zegt Dit Over "Blinde" Mensen?
Het artikel noemt ook een groep mensen die aphantasia hebben. Dit zijn mensen die beweren dat ze geen afbeeldingen in hun gedachten kunnen visualiseren (ze hebben geen "geestesoog"). Verrassend genoeg tonen studies aan dat deze mensen deze visuele raadsels bijna net zo goed kunnen oplossen als mensen die wel kunnen visualiseren.
Dit artikel voegt brandstof aan dat vuur. Het suggereert dat je misschien geen "geestesoog" nodig hebt om visuele raadsels op te lossen. Je hebt misschien gewoon een heel sterk "geestelijk logisch vermogen" nodig. De AI, die helemaal geen geestesoog heeft, bewees dat taal en logica alleen misschien voldoende zijn om te doen wat we dachten dat een afbeelding vereiste.
De Conclusie
Deze studie daagt het oude idee uit dat "visueel denken" een visuele afbeelding vereist. Het laat zien dat geavanceerde AI taken kan uitvoeren die eruitzien als "visuele verbeelding", uitsluitend met taal en logica.
- De Stelling: AI heeft een emergent vermogen om visueel te "verbeelden", maar het doet dit niet met afbeeldingen. Het doet dit met woorden.
- De Implicatie: We moeten misschien heroverwegen hoe we "mentale beelden" definiëren. Het gaat misschien niet om het zien van afbeeldingen in je hoofd; het gaat misschien gewoon om het logisch manipuleren van concepten.
Het artikel concludeert dat deze AI-modellen een nieuwe manier hebben ontdekt om de wereld te "zien" – een manier die puur linguïstisch is, maar verrassend effectief in het oplossen van visuele problemen.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.