← Nieuwste papers
🤖 AI

AGI Maze as a Benchmark Framework for World-Modeling Agents

Het artikel introduceert AGI Maze, een lichtgewicht rastergebaseerd benchmarkframework dat is ontworpen om het onvermogen van huidige grote taalmodellen bloot te leggen om persistente, manipuleerbare wereldtoestandsrepresentaties te construeren die vereist zijn voor het oplossen van gedeeltelijk observeerbare, staat-afhankelijke taken, zelfs wanneer er werkgeheugenmechanismen worden geboden.

Oorspronkelijke auteurs: Alexey Potapov

Gepubliceerd 2026-07-02
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Alexey Potapov

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Het Grote Idee: Waarom "Slimme" Chatbots Verdwalen in een Doolhof

Stel je voor dat je een zeer intelligente vriend hebt die poëzie kan schrijven, wiskundige problemen kan oplossen en grappen kan vertellen. Deze vriend is als een Large Language Model (LLM). Ze zijn geweldig in het voorspellen van het volgende woord in een zin.

Echter, het artikel stelt dat als je deze vriend in een donker, kronkelend doolhof plaatst waar ze alleen de muur direct voor hen kunnen zien, ze verdwaal. Ze kunnen misschien de volgende stap raden, maar ze kunnen geen mentale kaart van het hele doolhof in hun hoofd opbouwen. Ze zijn geweldig in het afmaken van een verhaal, maar slecht in het simuleren van een wereld.

Om dit te bewijzen, hebben de auteurs een nieuwe test ontwikkeld genaamd AGI Maze.


Wat is AGI Maze? (Het "Tekstgebaseerde Videospel")

Beschouw AGI Maze als een videospel dat je volledig speelt via tekstberichten.

  • De Opzet: Je bent in een raster (zoals een schaakbord). Je hebt een startpunt, een schatkist, een sleutel en een uitgang.
  • De Addertjes onder het gras: Je kunt de kaart niet zien. Je weet niet waar de muren zijn. Je weet alleen waar je begonnen bent.
  • De Gameplay: Je typt "Ga Rechts." Het spel antwoordt: "Je raakt een muur." Dan typ je "Ga Omlaag." Het spel zegt: "Je hebt een sleutel gevonden!"
  • Het Doel: Je moet de lay-out van het doolhof uitzoeken, de sleutel vinden, de kist openen en ontsnappen — en dat alles terwijl je onthoudt waar je bent geweest en waar de muren staan, zonder ooit een afbeelding te zien.

Waarom is dit moeilijk?
Het doolhof bevat "trucs" om het nog moeilijker te maken:

  1. Rivieren: Als je in een rivier stapt, word je automatisch stroomafwaarts meegesleurd, maar het spel vertelt je niet welke kant het water op stroomt. Je moet het zelf raden.
  2. Gaten: Als je in een gat valt, kun je in een heel ander deel van het doolhof weer boven water komen.
  3. Tijdslimiet: Je hebt een bepaald aantal stappen om te voltooien. Als je doelloos ronddwaalt, raakt je tijd op.

Het Experiment: Kan AI het Oplossen?

De auteurs hebben verschillende populaire AI-modellen (zoals GPT-4o en Gemini) getest op deze doolhoven. Ze behandelden de AI als een menselijke speler die alleen op de tekstuele beschrijvingen kan vertrouwen.

De resultaten waren verrassend:

  • De "Vanilla" AI: Wanneer de AI alleen probeerde de volgende zet te raden op basis van de chatgeschiedenis, faalde het jammerlijk. In kleine doolhoven deed het vaak slechter dan een computerprogramma dat simpelweg een willekeurige richting kiest (een "random-walk").
  • Het Probleem: De AI bouwde geen kaart in zijn "geest". Het probeerde alleen het volgende woord te raden op basis van de laatste paar zinnen. Het kon geen stabiel beeld vasthouden van "waar ik ben" en "waar de muren staan".

De "Notebook" Truc

De auteurs realiseerden zich dat mensen een complex doolhof niet kunnen oplossen zonder potlood en papier. Wij tekenen de kaart terwijl we voortbewegen. Dus gaven ze de AI een "notitieblok" (door de AI toe te staan eigen aantekeningen te maken in de chatgeschiedenis voordat er een zet wordt gedaan).

  • De Opzet: Voordat de AI "Ga Rechts" zegt, schrijft hij eerst een notitie: "Ik ben linksonder. Ik ging omhoog en raakte een muur. Ik denk dat de sleutel rechts ligt."
  • Het Resultaat: Dit hielp de sterkere AI-modellen aanzienlijk. Ze gingen van falen naar het oplossen van ongeveer 60-70% van de doolhoven.
  • Het Addertje: Zelfs met het notitieblok bleef de AI worstelen. Het bouwde niet van nature een perfecte, gestructureerde kaart. Het schreef gewoon slordige aantekeningen. En voor de kleinere, minder krachtige AI-modellen hielp de notebook-truc helemaal niet — zij raakten nog steeds verdwaald.

Wat Vertelt Dit Ons?

Het artikel concludeert met een paar belangrijke inzichten:

  1. Voorspelling vs. Begrip: Huidige AI is geweldig in het voorspellen van het volgende woord in een zin (zoals het afmaken van een verhaal), maar is slecht in het simuleren van een veranderende wereld (zoals het navigeren door een doolhof). Het bouwt niet van nature een "mentaal model" van de werkelijkheid op.
  2. Geheugen is Moeilijk: Het geven van een lange lijst met eerdere berichten (het "geheugen") is niet genoeg. De AI moet die informatie actief organiseren in een kaart of een plan, en daar heeft het momenteel moeite mee zonder hulp.
  3. De Test is een Instrument, Geen Eindscore: De auteurs zeggen niet dat "AI nutteloos is". Ze zeggen: "Hier is een specifiek instrument (AGI Maze) om aan te tonen waar AI precies tekortschiet." Het benadrukt dat om echt intelligente agenten te bouwen, we ze moeten leren hoe ze interne kaarten van de wereld maken en gebruiken, in plaats van alleen hoe ze moeten chatten.

Samenvatting van de Analogie

  • Huidige LLM's zijn als een gids die een script uit het hoofd heeft geleerd. Als je hen vraat een stad te beschrijven die ze nooit bezocht hebben, kunnen ze de woorden raden, maar als je hen vraagt om door een blind doolhof te navigeren, struikelen ze omdat ze geen kaart hebben.
  • AGI Maze is de blinddoek-doolhoftest.
  • Het "Notebook" is het geven van een pen en papier aan de gids. Het helpt een beetje, maar ze zijn nog steeds geen natuurlijke cartografen.

Het artikel betoogt dat voor AI om werkelijk intelligent (AGI) te worden, het moet leren hoe het zijn eigen kaarten tekent en deze bijwerkt terwijl het verkent, in plaats van alleen maar de volgende zin te raden.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →