← Nieuwste papers
🤖 AI

Evaluating Interactive Reasoning in Large Language Models: A Hierarchical Benchmark with Executable Games

Dit artikel introduceert een hiërarchische benchmark van 474 uitvoerbare games die de interactieve redeneercapaciteiten van grote taalmodellen evalueert door hen te vereisen actief bewijs te verzamelen en overtuigingen bij te stellen, wat aanzienlijke prestatiekloven onthult in efficiëntie, contextuele robuustheid en metacognitieve adaptatie over grensverleggende modellen heen.

Oorspronkelijke auteurs: Mingyuan Fan, Weiguang Han, Daixin Wang, Cen Chen, Zhiqiang Zhang, Jun Zhou

Gepubliceerd 2026-06-02
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Mingyuan Fan, Weiguang Han, Daixin Wang, Cen Chen, Zhiqiang Zhang, Jun Zhou

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een mysteriegame speelt waarbij je een verborgen schat moet vinden. In de meeste tests voor AI overhandigt de spelmeester je een kaart met de locatie van de schat al gemarkeerd en vraagt: "Waar is de schat?". De AI hoeft alleen maar de kaart te lezen en het antwoord te geven. Dit is als een statische test: de AI krijgt alle informatie in één keer en moet het in één keer oplossen.

Maar in de echte wereld krijgen we niet in één keer de hele kaart. We moeten vragen stellen, rondkijken en de boel gaandeweg bij elkaar puzzelen.

Dit artikel introduceert een nieuwe manier om AI te testen, genaamd Interactief Redeneren. In plaats van de AI een volledige kaart te geven, hebben de onderzoekers een "black box"-spel gecreëerd. De AI kent alleen de regels van het spel. Het moet:

  1. Specifieke vragen stellen aan het spel (zoals: "Ligt de sleutel onder het tapijt?").
  2. Luisteren naar de antjes.
  3. Zijn overtuigingen bijwerken op basis van wat het leert.
  4. Beslissen wanneer het genoeg weet om het uiteindelijke antwoord te raden.

Het "Speelbord"

Om er zeker van te zijn dat de AI niet gewoon feiten uit het hoofd leert of algemene kennis gebruikt (zoals weten dat "katten staarten hebben"), hebben de onderzoekers de spellen gebouwd met behulp van eenvoudige, abstracte bouwstenen:

  • Sets (groepen objecten),
  • Sequenties (lijsten),
  • Bomen (vertakkende structuren), en
  • Grafen (netwerken van verbindingen).

Ze creëerden 474 verschillende spellen met deze blokken, variërend van eenvoudige puzzels tot zeer moeilijke. Dit zorgt ervoor dat de test de logica van de AI meet, en niet het geheugen van Wikipedia-artikelen.

De "Stress-tests"

De onderzoekers stopten niet bij het kijken of de AI de puzzel kon oplossen. Ze voegden twee speciale "stress-tests" toe om te zien hoe robuust het denkvermogen van de AI werkelijk is:

1. De "Afleider"-test (Contextuele Robuustheid)
Stel je voor dat je een puzzel oplost, maar de spelmeester begint plotseling over het weer, of beschrijft de "rode sleutel" als een "crimson, glanzend object" in plaats van gewoon een "rode sleutel".

  • De Test: Ze voegden extra, nutteloze woorden toe of veranderden de namen van dingen (bijvoorbeeld een "knooppunt" een "patiënt" noemen in een ziekenhuisverhaal) zonder de eigenlijke logica te veranderen.
  • Het Resultaat: Veel AI's raakten in de war. Ze hadden moeite om de "ruis" te negeren en zich aan de kernlogica te houden, wat aantoont dat ze gemakkelijk worden afgeleid door hoe dingen worden beschreven in plaats van wat ze daadwerkelijk zijn.

2. De "Verandering van Hart"-test (Metacognitieve Adaptatie)
Stel je voor dat je een puzzel oplost en je bent voor 90% zeker van het antwoord. Plotseling zegt de spelmeester: "Wacht, ik heb eerder een fout gemaakt. De sleutel is eigenlijk blauw, niet rood."

  • De Test: De AI moet zijn oude conclusie intrekken, zijn denken bijwerken en opnieuw beginnen met de nieuwe informatie.
  • Het Resultaat: Dit was erg moeilijk voor de AI's. Wanneer het bewijs veranderde, slaagden veel modellen er niet in om hun overtuigingen correct bij te werken. Ze bleven proberen de puzzel op te lossen op basis van de oude (foutieve) informatie, zoals een persoon die weigert toe te geven dat hij een verkeerde afslag heeft genomen.

Wat ze vonden

De onderzoekers testten verschillende van de slimste AI-modellen van dit moment. Dit is wat zij ontdekten:

  • Ze kunnen spelen, maar niet efficiënt: Sommige AI's losten de spellen op, maar ze hadden een enorm aantal vragen (beurten) nodig om het te doen. Anderen waren snel maar maakten fouten. De beste modellen waren zowel accuraat als efficiënt.
  • Soorten logica doen ertoe: AI's waren goed in deductief redeneren (als A waar is, dan moet B waar zijn). Ze waren veel slechter in inductief redeneren (het patroon raden) en abductief redeneren (de beste verklaring vinden).
  • Het "Set"-probleem: Spellen die draaien om eenvoudige "sets" van objecten waren verrassend moeilijker dan complexe "bomen" of "grafen". Het lijkt erop dat AI's moeite hebben met het bijhouden van ongeordende groepen dingen in hun "geest".
  • De "Noodzakelijkheid"-kloof: Wanneer gevraagd werd om te identificeren welke stukken informatie daadwerkelijk noodzakelijk waren om de puzzel op te lossen (en welke slechts extra waren), gooiden de AI's vaak de verkeerde stukken weg. Ze konden het bewijs gebruiken wanneer het recht voor hun neus lag, maar ze konden niet aangeven welk bewijs echt essentieel was.

De Kern van het Verhaal

Dit artikel laat zien dat hoewel moderne AI steeds beter wordt in het stap voor stap oplossen van puzzels, het nog steeds worstelt met flexibiliteit. Het is goed in het volgen van een rechte lijn van logica, maar als je het decor verandert, ruis toevoegt of halverwege een fout corrigeert, raakt de AI vaak gestremd of in de war. Het is als een zeer slimme detective die een zaak kan oplossen als de aanwijzingen perfect zijn, maar in elkaar stort als een getuige halverwege het verhaal van koers verandert.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →