← Nieuwste papers
🤖 AI

DungeonBench: A Benchmark for Rules-Rich Tactical Reasoning in Dungeons & Dragons Combat

Het artikel introduceert DungeonBench, een uitgebreide benchmark voor het evalueren van tactisch redeneren in Dungeons & Dragons-gevechten die geavanceerde taalmodellen uitdaagt om complexe regels, geometrie en middelenbeheer te navigeren tijdens zowel enkelvoudige ontmoetingen als dagen met meerdere ontmoetingen, wat aanzienlijke tekortkomingen onthult in hun vermogen om onmiddellijke tactische voordelen af te wegen tegen langetermijnstrategische duurzaamheid.

Oorspronkelijke auteurs: Ismayil Ismayilov, Atakan Kara, Kaan Oktay

Gepubliceerd 2026-08-03
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Ismayil Ismayilov, Atakan Kara, Kaan Oktay

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een robot probeert te leren hoe hij een spel moet spelen. Al een lange tijd zijn wetenschappers erg goed in het leren van robots om spellen te spelen waarbij de regels simpel zijn en het doel duidelijk is, zoals het verplaatsen van een stuk over een raster of het raken van een doelwit. Maar er is een speciaal soort denken dat veel moeilijker aan te leren is: tactisch redeneren. Dit gaat niet alleen over het kennen van de regels; het gaat over begrijpen hoe de regels met elkaar botsen. Het is het verschil tussen weten dat je kunt springen en weten dat als je nu springt, je in een plas kunt landen waardoor je uitglijdt, of dat later springen je een power-up laat pakken voordat een timer afloopt. Dit soort denken vereist het combineren van geometrie (waar dingen zijn), timing (wanneer dingen gebeuren) en schaarse middelen (zoals beperkte energie of munitie). Wetenschappers geven erom omdat als we computers kunnen leren om deze complexe, "wat-als"-keuzes in een spel te maken, we dichter bij het bouwen van AI komen die echte wereldproblemen kan oplossen waar alles met elkaar verbonden is en niets simpel is.

Maak kennis met DungeonBench, een nieuwe "testbaan" die ontworpen is om te zien of kunstmatige intelligentie daadwerkelijk dit soort rommelig, regel-zwaar denken kan beheersen. De onderzoekers bouwden een digitale simulator gebaseerd op het beroemde tabletopspel Dungeons & Dragons, maar ze haalden het verhalende aspect en de menselijke spelleider weg. In plaats daarvan creëerden ze een strikte, wiskundige versie van gevechten waarbij elke zet, spreuk en monsterkracht een hardgecodeerde regel is. Ze vroegen de AI niet alleen om een enkel gevecht te winnen; ze vroegen het om een hele "avonturendag" te overleven vol met meerdere gevechten, waarbij het te veel gebruiken van magie in het eerste gevecht het team machteloos kan achterlaten in het laatste gevecht.

Het paper test enkele van de slimste AI-modellen van vandaag (zoals GPT-5.5 en Gemini 3.1 Pro) om te zien of ze kunnen optreden als een ervaren dungeon master. De opzet is eerlijk: de AI ziet het hele slagveld, kent alle regels en heeft een lijst met legale zetten om uit te kiezen. De taak is om de beste zet te kiezen uit honderden opties, rekening houdend met zaken als: "Als ik deze vuurbel hier werp, raakt het dan de baas maar verbrandt het ook mijn vriend?" of "Moet ik mijn genezingsdrankje nu bewaren, of gebruik ik het om dit gevecht snel te beëindigen?"

De resultaten zijn een mix van indrukwekkende vaardigheid en grappige mislukkingen. Wanneer de AI slechts één gevecht tegenkwam (het "Encounter"-spoor), waren de beste modellen behoorlijk goed en wonnen ze ongeveer 82% tot 83% van de tijd. Ze waren slim genoeg om zichzelf goed te positioneren en hun spreuken effectief te gebruiken. Echter, wanneer de onderzoekers die gevechten aan elkaar koppelden tot een volledige dag (het "Day"-spoor), stortte de prestatie van de AI in. In deze moeilijkere modus slaagden de beste modellen er slechts in om 40% van de dagen te voltooien, en één model slaagde er niet in om ook maar één dag te voltooien.

Waarom faalden ze? Het paper suggereert dat hoewel deze AI's erg goed zijn in het "hier en nu", ze moeite hebben met middelenbeheer (resource budgeting). Ze hebben de neiging om hun beste spreuken en genezingsdrankjes te gebruiken om het eerste gemakkelijke gevecht te winnen, waardoor ze met lege handen en een lage gezondheid achterblijven voor de zware baas aan het einde van de dag. Ze winnen de strijd, maar verliezen de oorlog. De onderzoekers ontdekten dat zelfs al kon de AI het volledige schema aan gevechten vooraf zien, het kon niet uitzoeken hoe het zijn kracht voor later moest bewaren.

Kortom, DungeonBench laat zien dat de huidige AI erg goed wordt in het volgen van regels en het nemen van lokale beslissingen, maar het heeft nog niet echt de kunst van langetermijnstrategie geleerd. Het is als een schaker die een enkel spel kan winnen door de tegenstander te misleiden, maar die telkens zonder stukken komt te zitten voordat het toernooi voorbij is. Het paper concludeert dat hoewel we vooruitgang boeken, er nog een lange weg te gaan is voordat AI echt kan denken als een tactisch genie die weet wanneer hij moet afwachten en wanneer hij moet toeslaan.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →