← Nieuwste papers
💬 NLP

HERO'S JOURNEY: Testing Complex Rule Induction with Text Games

Het artikel introduceert HERO'S JOURNEY, een benchmark voor het evalueren van regelinductie in doelgerichte tekstspellen, wat onthult dat hoewel state-of-the-art LLM's enige bekwaamheid vertonen in het afleiden van verborgen regels, hun prestaties beperkt en ongelijkmatig blijven, met name wat betreft procedurele inductie en meerstaps-executie.

Oorspronkelijke auteurs: Anshun Asher Zheng, Kanishka Misra, David I. Beaver, Junyi Jessy Li

Gepubliceerd 2026-06-02
📖 6 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Anshun Asher Zheng, Kanishka Misra, David I. Beaver, Junyi Jessy Li

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Het Grote Plaatje: Een Videogame voor AI-Hersenen

Stel je voor dat je een tekstgebaseerd avonturenspel speelt (zoals een oude Zork of een kies-je-eigen-avontuur boek). Je bent een krijger die probeert een gevangene te redden. Om te winnen, moet je een bewaker-monster verslaan. Maar hier komt de crux: niemand vertelt je welk wapen welk monster verslaat.

De enige aanwijzingen die je hebt, zijn de "dagboeken" van andere krijgers die vóór jou hebben geprobeerd te winnen (en gefaald hebben of geslaagd zijn). Je moet hun verhalen lezen, het verborgen patroon ontdekken (bijv. "Oh, draken hebben vuurzwaarden nodig, maar goblins hebben waterzwaarden nodig") en die regel vervolgens toepassen op een nieuw monster dat je nog nooit eerder hebt gezien.

Dit artikel introduceert een nieuwe testsuite genaamd HERO'S JOURNEY. Het is als een sportschool voor Kunstmatige Intelligentie (AI) om te testen of het daadwerkelijk regels kan leren van voorbeelden en deze vervolgens correct kan uitvoeren, in plaats van simpelweg te gokken of antwoorden te onthouden.


De Twee Hoofduitdagingen

De onderzoekers ontdekten dat huidige AI-modellen (de "slimme" computers) moeite hebben met twee specifieke dingen in dit spel:

1. Het "Detective"-probleem (Regelinductie)

De AI moet optreden als een detective. Het bekijkt de aanwijzingen (de verhalen van andere krijgers) en moet de geheime wet van het universum afleiden.

  • De Analogie: Stel je voor dat je drie mensen een club ziet binnengaan.
    • Persoon A (draagt Rood) krijgt een VIP-pas.
    • Persoon B (draagt Blauw) krijgt een reguliere pas.
    • Persoon C (draagt Rood) krijgt een VIP-pas.
    • De Regel: "Rood betekent VIP."
    • De Test: Als er een nieuwe persoon (Persoon D) in het rood verschijnt, weet de AI dan dat hij een VIP-pas moet geven?
    • De Bevinding uit het Artikel: De AI is redelijk goed in dit eenvoudige detectivewerk, maar raakt vaak in de war wanneer de regels ingewikkelder worden (zoals als "Rood" VIP betekent tenzij de persoon ook een hoed draagt).

2. Het "Butler"-probleem (Procedurele Uitvoering)

De regel weten is één ding; de stappen uitvoeren om te winnen is iets anders. De AI wordt niet alleen gevraagd "Welk wapen heb je nodig?" Het moet het spel daadwerkelijk spelen: "Ga naar de winkel," "Koop het zwaard," "Loop naar het kasteel," "Vecht tegen het monster."

  • De Analogie: Stel je voor dat je het recept voor een taart kent (de regel). Maar wanneer je probeert te bakken, vergeet je de oven aan te zetten, of meng je het meel nadat je de taart in de oven hebt gezet.
  • De Bevinding uit het Artikel: Hier heeft de AI echt moeite mee. Zelfs als de AI het juiste wapen weet, maakt het vaak fouten in de volgorde van de acties. Het is als een brilante chef die het recept kent, maar de eieren steeds op de vloer laat vallen tijdens het bakken.

De Acht Moeilijkheidsgraden

De onderzoekers hebben acht verschillende "niveaus" in dit spel gebouwd om verschillende soorten denken te testen:

  1. Eenvoudige Rekenkunde (Additief): "De grootte van het wapen is de hoogte van het monster + het gewicht ervan." (Eenvoudige optelling).
  2. Mix en Match (Compositioneel): "De grootte van het wapen komt van de hoogte van het monster, en de kleur komt van het gewicht." (Twee aparte regels die tegelijkertief werken).
  3. De "Als/Dan" Schakelaar (Conditioneel): "Als het een Draak is, bepaalt het gewicht de kleur. Als het een Goblin is, bepaalt het gewicht de grootte." (De regels veranderen afhankelijk van de situatie).
  4. De "Speciale Uitzondering" (Override): "Normaal gesproken bepaalt de hoogte van het monster het wapen. MAAR, als het monster een 'Chirurgeon' is (een speciale rol), heeft het altijd een gigantisch zwaard nodig, ongeacht wat de rest zegt." (Eén regel breekt alle andere regels).

Ze testten zowel Attribuut-taken (bepalen welk item te gebruiken) als Procedurele taken (bepalen in welke volgorde acties te ondernemen).


Wat Hebben Ze Ontdekt?

1. Mensen Winnen, AI Struikelt

Wanneer mensen dit spel speelden, waren ze veel beter in zowel het ontdekken van de regels als het uitvoeren van de stappen.

  • Het Gat: Gemiddeld waren mensen 13% beter in het efficiënt voltooien van het spel en 30% beter in het hardop uitleggen van de regel.
  • De "Blinde Vlek": Sommige AI-modellen konden het spel succesvol voltooien, maar wanneer gevraagd werd hoe ze het deden, konden ze dat niet uitleggen. Dit suggereert dat ze misschien "valsspelen" door patronen uit de voorbeelden te raden of te kopiëren, in plaats van de logica echt te begrijpen.

2. De "Executie-bottleneck"

De onderzoekers ontdekten dat het moeilijkste deel voor AI niet altijd het denken is, maar het doen.

  • De Metafoor: Stel je een GPS voor die de perfecte route naar je bestemming kent (de regel), maar je steeds vertelt dat je linksaf moet slaan terwijl je al bij het benzinestation bent (de uitvoeringsfout).
  • De AI weet vaak het juiste antwoord, maar faalt in het correct uitvoeren van de reeks acties in de spelomgeving.

3. "Magische Woorden" Helpen Niet Veel

De onderzoekers probeerden de AI te misleiden door echte namen te gebruiken (zoals "Draak" en "Zwaard") versus nonsenswoorden (zoals "Krev" en "Zorp").

  • Het Resultaat: Het maakte nauwelijks uit. De AI kreeg geen boost door te weten wat een "Draak" normaal gesproken nodig heeft. Dit bewijst dat de test daadwerkelijk logica meet, en niet alleen het geheugen van de AI over films of boeken.

4. Huidige "Oplossingen" Zijn Zwak

De onderzoekers probeerden "prompting-trucs" te gebruiken (zoals de AI vragen om "stap voor stap te denken" of "zijn werk te controleren") om de AI te helpen.

  • Het Resultaat: Deze trucs hielpen een beetje bij de eenvoudige "welk item koop ik"-taken, maar ze hielpen niet bij de complexe "hoe voer ik de stappen uit"-taken. De kloof tussen de prestaties van AI en mens blijft groot.

De Kern van het Verhaal

HERO'S JOURNEY is een nieuwe manier om te testen of AI echt kan leren van ervaring en die kennis kan toepassen, in plaats van alleen antwoorden te memoriseren.

Het artikel concludeert dat hoewel AI steeds beter wordt in het herkennen van patronen, het nog steeds slecht is in het toepassen van die patronen in complexe, meerstaps scenario's in de echte wereld. Het is als een student die een wiskundeprobleem op een toets kan oplossen, maar niet kan uitzoeken hoe hij die wiskunde kan gebruiken om een brug te bouwen. De onderzoekers hopen dat dit spel ontwikkelaars zal helpen om AI te bouwen die daadwerkelijk dingen kan doen, en niet alleen dingen kan zeggen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →