Agentick: A Unified Benchmark for General Sequential Decision-Making Agents
Het artikel introduceert Agentick, een uniform benchmark met 37 procedureel gegenereerde taken over diverse modaliteiten en moeilijkheidsgraden om een eerlijke vergelijking mogelijk te maken en vooruitgang te stimuleren in sequentiële besluitvorming voor RL-, LLM-, VLM-, hybride en menselijke agenten.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je probeert uit te vinden wie de beste "probleemoplosser" ter wereld is. Je hebt drie zeer verschillende soorten deelnemers:
- Het Blankscherm: Een robot die niets weet en alles door middel van proef en error moet leren (zoals een baby die lopen leert).
- De Encyclopedie: Een superslimme computer die bijna het hele internet heeft gelezen, maar nooit echt iets in de echte wereld heeft gedaan.
- De Hybride: Een mix van beide.
Het probleem? Tot nu toe konden we ze niet eerlijk vergelijken. Het is alsof je een marathonloper, een schaakgrootmeester en een zwemmer probeert te vergelijken door ze allemaal te vragen om "een wedstrijd te rennen". De zwemmer zou verdrinken en de schaker zou verdwalen.
Maar dan komt "Agentick" in beeld.
De auteurs van dit paper hebben een nieuwe, universele testomgeving gebouwd die Agentick heet. Denk hierbij aan een enorm, procedueel gegenereerd "obstakelbaan" dat specifiek is ontworpen zodat elk type AI op hetzelfde speelveld kan concurreren.
De Obstakelbaan (De Benchmark)
Agentick is niet zomaar één spel; het is een collectie van 37 verschillende mini-spellen (zoals doolhoven, raadsels en schattenjachten) die progressief moeilijker worden. Deze spellen testen zes specifieke vaardigheden:
- Navigatie: Kun je je weg vinden?
- Planning: Kun je vooruitdenken?
- Redeneren: Kun je logische raadsels oplossen?
- Geheugen: Kun je je herinneren wat er 10 stappen geleden is gebeurd?
- Generalisatie: Kun je je aanpassen aan een nieuwe regel?
- Teamwork: Kun je werken met (of tegen) anderen?
De Universele Vertaler (De Interface)
Hier komt de magische truc: Agentick spreekt vijf verschillende talen tegelijkertijd voor elk moment in het spel.
- Voor het "Blankscherm" (RL): Het toont een gepixelde videospel-scherm (zoals een arcade-spel uit de oude school).
- Voor de "Encyclopedie" (LLMs): Het toont een tekstgebaseerde kaart met ASCII-tekens (zoals
#voor muren en.voor lege ruimte) of een geschreven beschrijving. - Voor Mensen: Het toont een 3D-achtig beeld.
Dit zorgt ervoor dat niemand bedrogen wordt. De "Encyclopedie" hoeft niet te raden wat de pixels betekenen, en het "Blankscherm" hoeft geen roman te lezen om de regels te begrijpen. Ze zien allemaal exact dezelfde staat van de wereld, alleen in het formaat waarin ze het beste presteren.
De Resultaten: Wie won?
De onderzoekers speelden meer dan 90.000 spellen om te zien wie het beste presteerde. Hier is wat ze vonden, met gebruikmaking van eenvoudige analogieën:
Geen Enige Held: Er is geen "beste" AI. Het hangt af van de taak.
- Het Blankscherm (RL) was geweldig in Planning en Teamwork. Het leerde de exacte mechanica van het spel door herhaling en werd een meester-tacticus.
- De Encyclopedie (LLMs) was geweldig in Navigatie en Generalisatie. Omdat het zoveel had gelezen, kon het het juiste pad in een nieuw doolhof raden zonder eerst te hoeven oefenen.
- Het Vonnis: Zelfs de slimste AI (GPT-5 mini) bereikte slechts ongeveer 30% van de "perfecte score". Er is nog steeds een enorm gat tussen wat AI vandaag kan doen en wat het zou moeten kunnen doen.
De "Denk"-Truc: Hoe je de AI vraagt om na te denken, is belangrijker dan hoe groot de AI is.
- Toen de onderzoekers de LLMs vertelden om "stap voor stap na te denken" (een methode genaamd Chain-of-Thought) voordat ze handelden, verdrievoudigde of zelfs verveelvoudigde hun prestatie met een factor tien. Het is alsof je een student zegt: "Raad niet zomaar; schrijf eerst je logica op." Plotseling lossen ze het raadsel veel beter op.
Kort en Krachtig is Beter: Voor AI die probeert een kaart te navigeren, werkten tekstroosters (ASCII) beter dan lange, fancy beschrijvingen.
- Stel je voor dat je iemand aanwijzingen geeft. Een simpele kaart met symbolen (
#= muur,.= pad) is vaak makkelijker voor een computer om te verwerken dan een alinea tekst die zegt: "Je staat in een kamer met een muur aan je linkerkant..." De compacte symbolen waren efficiënter voor ruimtelijk redeneren.
- Stel je voor dat je iemand aanwijzingen geeft. Een simpele kaart met symbolen (
Waarom Dit Belangrijk Is
Het paper stelt dat we, om echt capabele, autonome agenten te bouwen (robots of software die dingen zelfstandig kunnen doen), moeten stoppen met het behandelen van deze verschillende soorten AI als aparte werelden. Agentick biedt het gemeenschappelijke grond om te zien waar elk type uitblinkt en waar ze falen.
Het suggereert dat de toekomst van AI niet alleen gaat over het maken van grotere modellen of ze langer trainen; het gaat over het combineren van het "leren door te doen" van het Blankscherm met de "wereldkennis" van de Encyclopedie, allemaal terwijl je de juiste "prompting" (instructies) gebruikt om het beste uit hen te halen.
Kortom: Agentick is de eerste eerlijke scheidsrechter die een schaker, een zwemmer en een hardloper kan beoordelen in dezelfde arena, en bewijst dat we, hoewel we vooruitgang hebben geboekt, nog ver verwijderd zijn van het bouwen van de perfecte autonome agent.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.