← Nieuwste papers
🤖 AI

Reinforcement learning for Quantum Tiq-Taq-Toe

Dit artikel introduceert de eerste toepassing van reinforcement learning op Quantum Tiq-Tac-Toe, waarbij de beheersbare complexiteit ervan in vergelijking met Quantum Chess wordt benut om een toegankelijke testomgeving te vestigen voor de integratie van quantumcomputing en machine learning, ondanks uitdagingen zoals gedeeltelijke observeerbaarheid en exponentiële staatcomplexiteit.

Oorspronkelijke auteurs: Catalin-Viorel Dinu, Thomas Moerland

Gepubliceerd 2026-09-10
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Catalin-Viorel Dinu, Thomas Moerland

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je een wereld voor waarin de regels van de logica net iets anders zijn, waar een enkel object op meerdere plaatsen tegelijk kan bestaan totdat iemand ernaar kijkt. Dit is het domein van de kwantummechanica, een tak van de natuurkunde die het gedrag van de kleinste deeltjes in het universum beheerst. Hoewel deze principes vaak zijn voorbehouden aan complexe theorieën over de structuur van de werkelijkheid, worden ze nu getest in de meest vertrouwde omgevingen: het eenvoudige raster van een boterkaas-en-eieren-bord. In deze kwantumversie wordt het spel niet gespeeld met statische tekens van X en O, maar met waarschijnlijkheden en verbindingen die de stukken op manieren aan elkaar koppelen die de gewone ervaring tarten. De uitdaging voor computers is om te leren hoe ze dit spel moeten spelen, niet door een vaste reeks instructies te volgen, maar door te leren van ervaring, net zoals een mens dat doet. Dit is het domein van reinforcement learning (versterkend leren), een methode waarbij een kunstmatige intelligentie haar strategie verbetert door zetten uit te proberen, de resultaten te zien en haar aanpak in de loop van de tijd aan te passen. Onderzoekers zijn geïnteresseerd in dit snijvlak omdat als een computer kan leren navigeren door het verwarrende, verschuivende landschap van een kwantumspel, het ons uiteindelijk kan helpen veel moeilijkere problemen in quantum computing op te lossen, zoals het corrigeren van fouten in delicate kwantummachines.

In een recente studie besloten onderzoekers van de Universiteit Leiden in Nederland te kijken of deze lerende machines een specifieke kwantumadaptatie van boterkaas-en-eieren konden beheersen. Ze kozen een versie van het spel die gebruikmaakt van drietoestands-kwantumeenheden, wat een rijkere variëteit aan zetten mogelijk maakt dan de standaard tweetoestandsystemen die vaak in de theorie worden gebruikt. Het spel zelf is lastig omdat het bord nooit volledig duidelijk is voor de speler. In plaats van een definitieve X of O in een vakje te zien, ziet een speler een kaart van waarschijnlijkheden, die laat zien waar een teken zich zou kunnen bevinden, en een verslag van hoe verschillende vakjes aan elkaar gekoppeld zijn. Elke keer dat een speler een zet doet, kunnen deze verbindingen instorten, waardoor er plotseling een definitieve staat wordt onthuld waar voorheen alleen onzekerheid heerste. Om hun theorieën te testen, richtte het team een digitale arena in waar kunstmatige intelligentie-agenten tegen zichzelf speelden. Ze creëerden twee verschillende versies van de spelregels. De eerste versie was enigszins beperkend en vereiste dat elke complexe kwantumzet ten minste één lege ruimte op het bord moest bevatten. De tweede versie was opener en stond een breder scala aan interacties en complexere verstrengelingen tussen de vakjes toe.

De onderzoekers trainden hun agenten met een methode waarbij ze duizenden spellen tegen elkaar speelden, lerend van elke winst, verlies of gelijkspel. Ze wilden zien wat voor soort informatie de agenten nodig hadden om goed te spelen. Ze testten drie soorten spelers: één die alleen de waarschijnlijkheidskaart kon zien, één die alleen de geschiedenis van hoe de stukken verbonden waren kon zien, en een derde die toegang had tot beide. In de meer beperkende versie van het spel lieten de simulaties een duidelijk patroon zien: de speler die als eerste beurt had, bezat een duidelijk voordeel. Hoewel het spel een mate van willekeur bevat die een gegarandeerde overwinning voorkomt, was de eerste speler in staat om vaker een pad naar de overwinning te vinden dan de tweede speler. Dit suggereert dat er zelfs in een spel met verschuivende regels onderscheidbare strategieën zijn die een lerende machine kan ontdekken. De resultaten werden gevisualiseerd door de best getrainde agenten tegen elkaar uit te spelen, waarbij werd getoond dat de eerste speler consistent meer overwinningen behaalde.

Toen de onderzoekers overgingen naar de complexere versie van het spel, waarbij de regels meer diverse kwantumtoestanden en interacties toelieten, veranderde de dynamiek. In dit scenario was het hebben van slechts één type informatie niet voldoende. De agenten presteerden het best wanneer ze zowel de huidige waarschijnlijkheidskaart als de geschiedenis van hoe de stukken verstrengeld waren, konden zien. Deze combinatie stelde de kunstmatige intelligentie in staat om de realtime staat van het bord te begrijpen en tegelijkertijd de complexe relaties te onthouden die in eerdere beurten waren gevormd. Het resultaat was een evenwichtiger spel, waarbij de uitkomsten meer gelijkwaardig waren tussen de spelers. Deze bevinding benadrukt dat in omgevingen waar informatie verborgen of gedeeltelijk zichtbaar is, het hebben van een volledig beeld van zowel het heden als het verleden cruciaal is voor het nemen van goede beslissingen.

De studie concludeert dat deze kwantumversie van boterkaas-en-eieren dient als een nuttige testomgeving voor het ontwikkelen van betere kunstmatige intelligentie voor kwantumsystemen. De onderzoekers merken op dat de inherente moeilijkheid van het spel, veroorzaakt door de gedeeltelijke zichtbaarheid van het bord, de uitdagingen weerspiegelt die men ervaart in de echte kwantumcomputing, waar het controleren en begrijpen van deze verborgen toestanden essentieel is. Hoewel het huidige werk zich richtte op het trainen van agenten om te spelen, suggereren de auteurs dat toekomstige inspanningen andere manieren kunnen verkennen om machines te helpen met deze onzekerheid omgaan, zoals het gebruik van geheugensystemen die voorbijgaande sequenties onthouden of meer geavanceerde verwerkingsmodellen. Voor nu demonstreert het werk dat reinforcement learning succesvol kan navigeren door de vreemde logica van kwantumspellen, wat een duidelijk pad biedt voor de integratie van machine learning met de toekomstige kwantumtechnologie.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →