← Nieuwste papers
🤖 AI

Impartial Games: A Challenge for Reinforcement Learning

Dit artikel toont aan dat AlphaZero-stijl reinforcement learning-algoritmen er niet in slagen om een expert-niveau van meesterschap te bereiken in onpartijdige spellen zoals Nim vanwege een fundamentele representationele flessenhals bij het leren van abstracte wiskundige principes, wat onthult dat eenvoudige hyperparameteroptimalisatie de onmacht om te generaliseren voorbij gememoriseerde toestanden niet kan overwinnen.

Oorspronkelijke auteurs: Bei Zhou, Søren Riis

Gepubliceerd 2026-09-09
📖 6 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Bei Zhou, Søren Riis

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

In de wereld van kunstmatige intelligentie is een specifiek type computerprogramma onlangs beroemd geworden vanwege zijn vermogen om complexe strategische spellen te beheersen. Door miljoenen spellen tegen zichzelf te spelen, leren deze programma's zetten te maken die zelfs de grootste menselijke experts verrassen. Ze zijn kampioen geworden in spellen zoals schaken en Go, waarbij succes afhangt van het herkennen van patronen, het evalueren van posities en het plannen van vele stappen vooruit. Het onderliggende idee is dat als een machine kan leren winnen door het begrijpen van de flow van een spel, het uiteindelijk elk complex probleem zou kunnen oplossen. Deze successen hebben echter een vals gevoel van veiligheid gecreëerd. Het blijkt dat de manier waarop deze machines leren niet universeel is. Er is een specifieke klasse van spellen waarbij de regels eenvoudig zijn, de stukken door beide spelers worden gedeeld en de winnende strategie rust op een verborgen wiskundige logica in plaats van patroonherkenning. In deze spellen lopen de meest geavanceerde kunstmatige intelligentiesystemen tegen een muur aan, omdat ze er niet in slagen de principes te leren die het spel voor mensen oplosbaar maken.

Onderzoekers aan Imperial College London en Queen Mary University of London besloten dit blinde vlek te onderzoeken met behulp van een spel genaamd Nim. Nim is een spel dat wordt gespeeld met verschillende stapels objecten, waarbij twee spelers om de beurt een willekeurig aantal objecten uit een enkele stapel mogen verwijderen. Het doel is degene te zijn die het laatste object pakt. Hoewel het spel er eenvoudig uitziet, is het geheim om te winnen een specifieke wiskundige berekening die verband houdt met de binaire getallen van de stapelgroottes. Voor een mens is het leren van deze regel een kwestie van het begrijpen van één enkel abstract concept. Voor de kunstmatige intelligentie is de uitdaging anders. De onderzoekers wilden zien of dezelfde leeralgoritmen die schaken hadden veroverd, ook Nim konden leren spelen, en zo niet, waarom wel. Ze bouwden een aangepaste versie van het beroemde AlphaZero-leersysteem en trainden het om Nim te spelen op borden van toenemende grootte, waarbij ze nauwlettend observeerden hoe het begrip van de computer evolueerde.

De resultaten waren schokkend en onthullend. Toen de onderzoekers het systeem testten op een kleine Nim-bord met vijf stapels, leerde de computer goed spelen. De computer kon consistent winnen, als een kampioen die weet hoe hij een spel moet starten en het naar een overwinning kan sturen. Echter, zodezodra de bordgrootte toenam naar zes of zeven stapels, stortte de prestatie van het systeem in. De computer stopte met het leren hoe hij moest winnen. In plaats van de juiste zetten te vinden, begon de computer te gokken, waarbij hij niet beter presteerde dan wanneer hij zetten willekeurig had gekozen. De onderzoekers ontdekten dat het probleem niet was dat het spel te complex was of dat de computer meer tijd nodig had om te trainen. Het probleem was fundamenteel aan de manier waarop de hersenen van de computer, een type neuraal netwerk, informatie verwerken. Deze netwerken zijn uitstekend in het spotten van connecties tussen zaken, zoals het herkennen dat een bepaalde arrangement van schaakstukken meestal tot een winst leidt. Maar ze worstelen enorm met een specifiek type logica die pariteit wordt genoemd, wat in essentie een manier is om te tellen of een getal even of oneven is over een groep items. In Nim hangt de winnende zet volledig af van dit soort tel-logica.

Om te begrijpen waarom dit ertoe doet, introduceerden de onderzoekers een nieuwe manier om de vaardigheid van een kunstmatieve intelligentie te meten. Ze maakten een onderscheid tussen een "kampioen" en een "expert". Een kampioen is een speler die kan winnen vanuit de startpositie door het spel te leiden naar bekend terrein waar hij weet wat hij moet doen. Een expert kan echter de perfecte zet maken vanuit elke positie op het bord, zelfs posities die hij nog nooit heeft gezien. De studie toonde aan dat de kunstmatige intelligentie een kampioen kon worden op kleine borden door de juiste openingszetten te memoriseren. Maar het slaagde er niet in een expert te worden. Wanneer het spel de midden- of eindfasen bereikte, of wanneer het bord groter was, kon de computer de juiste zet niet uitzoeken. Zijn interne gids, die bedoeld is om aan te geven welke zetten goed zijn, raakte in de war. Het kende een hoge waarschijnlijkheid toe aan een verliezende zet en negeerde de winnende zet. Zelfs toen de computer miljoenen simulaties uitvoerde om zijn keuzes te controleren, kon hij zijn initiële fout niet corrigeren omdat zijn eerste gok zo ver naast de werkelijkheid zat.

De onderzoekers testten of deze mislukking te wijten was aan de leermethode zelf of aan de moeilijkheid van de logica van het spel. Ze creëerden een versie van het spel waarbij de twee spelers verschillende stapels controleerden en de pariteitslogica niet hoefden te gebruiken om te winnen. In dit aangepaste spel leerde dezelfde kunstmatige intelligentie snel en gemakkelijk, wat bewees dat het leersysteem zelf in staat was. Dit bevestigde dat het probleem niet het trainingsproces was, maar het specifieke type wiskunde dat vereist was voor het oorspronkelijke spel. De computer kon simpelweg de abstracte regel van pariteit niet leren van de data die het genereerde door tegen zichzelf te spelen. De ruis in de data, veroorzaakt door de fouten die de computer maakte tijdens zijn vroege leerfase, maakte het voor het netwerk onmogelijk om het onderliggende patroon te ontdekken.

Deze bevinding daagt het idee uit dat de huidige kunstmatige intelligentie elk probleem kan oplossen als er genoeg data en rekenkracht beschikbaar is. Het suggereert dat er bepaalde soorten logisch redeneren zijn die deze systemen niet uit zichzelf kunnen leren. De onderzoekers stellen voor dat om spellen zoals Nim echt te beheersen, en misschien andere complexe problemen die rusten op abstracte wiskunde, toekomstige kunstmatige intelligentie anders gebouwd moet worden. Ze suggereren het combineren van de patroonherkennende kracht van huidige systemen met een aparte, symbolische redeneermodule die deze specifieke logische regels kan afhandelen. Totdat een dergelijke verandering wordt doorgevoerd, zullen deze krachtige leersystemen in sommige gebieden kampioenen blijven, maar blind blijven voor de fundamentele logica van andere, niet in staat om het niveau van ware expertise te bereiken dat een mens met een enkel inzicht kan bereiken.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →