Modeling quantum neural network gradient with reinforcement learning
Het artikel introduceert RLQ-Grad, een op reinforcement learning gebaseerde optimizer die kwantum neurale netwerken traint door een klassieke policy te gebruiken om parameterupdates voor te stellen, waardoor het barren plateau-probleem wordt omzeild en de computationele kosten worden verminderd om efficiënte training op nabije hardware met tot 20 qubits mogelijk te maken.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
In het opkomende veld van quantum computing proberen wetenschappers machines te bouwen die problemen kunnen oplossen die ver buiten het bereik van de huidige supercomputers liggen. Een centraal instrument in deze inspanning is het quantum neuraal netwerk, een hybride systeem dat de vreemde fysica van subatomaire deeltjes combineert met de leervermogens van kunstmatige intelligentie. Deze netwerken zijn ontworpen om patronen in data te vinden, vergelijkbaar met de software die gezichten in foto's herkent of talen vertaalt. Het trainen van deze quantum-systemen is echter tegen een hardnekkige muur aangelopen. Wanneer onderzoekers meer quantum bits, of qubits, aan hun circuits toevoegen om complexere problemen aan te pakken, verdwijnen de signalen die worden gebruikt om de machine te onderwijzen vaak in het niets. Dit fenomeen, bekend als een barren plateau (vruchtbare vlakte), laat het netwerk blind achter voor hoe het zichzelf kan verbeteren, terwijl de pure rekenkracht die nodig is om de noodzakelijke updates te berekenen zo groot wordt dat het onmogelijk is om op de huidige hardware uit te voeren.
Om deze barrière te doorbreken, heeft een team onderzoekers een nieuwe aanpak ontwikkeld die de traditionele manier van het onderwijzen van deze machines omzeilt. In plaats van te proberen de exacte wiskundige helling van het leertraject door het quantumcircuit te berekenen — een proces dat exponentieel moeilijker en geheugenintensiever wordt naarmidd de systeem groeit — hebben ze een apart, klassiek computerprogramma getraind om de volgende stap te raden. Dit programma, gebouwd met een techniek genaamd reinforcement learning (versterkingsleren), fungeert als een ervaren coach. Het observeert de prestaties van het quantumnetwerk, merkt de huidige fouten en eerdere zetten op, en stelt vervolgens een directe update voor aan de instellingen van het netwerk. De onderzoekers ontdekten dat deze methode niet alleen het probleem van de verdwijnende signalen vermijdt, maar ook duizenden keren sneller werkt en slechts een fractie van het geheugen vereist in vergelijking met standaardtechnieken.
Het team, geleid door onderzoekers uit Vietnam en Japan, testte hun nieuwe optimizer, die ze RLQ-Grad noemden, op een verscheidenheid aan gesimuleerde quantumcircuits variërend van slechts twee qubits tot twintig qubits. In de wereld van quantum computing is twintig qubits een aanzienlijke schaal, die een systeem vertegenwoordigt dat groot genoeg is voor relevante toepassingen in de echte wereld, maar klein genoeg om gesimuleerd te worden op krachtige klassieke computers. De resultaten waren opmerkelijk. Toen de onderzoekers hun methode vergeleken met de drie standaard manieren om updates te berekenen — backpropagation, parameter-shift en adjoint differentiation — behield RLQ-Grad een stabiel, sterk signaal voor het leren, ongeacht de omvang van het circuit. In tegenstelling hiertoe zagen de traditionele methoden hun leersignalen met ordes van grootte afnemen naarmidd het aantal qubits toenam, wat effectief leidde tot het stagneren van de training.
De winst in efficiëntie was even spectaculair. Op een standaard computerprocessor voltooide de nieuwe methode elke trainingsstap in minder dan een tiende van een seconde, zelfs voor de grootste circuits van twintig qubits. De traditionele backpropagation-methode deed er in vergelijking bijna tweehonderd seconden over voor dezelfde taak. Wat het geheugengebruik betreft, was het verschil nog diepgaander. Terwijl de standaard backpropagation-aanpak meer dan zesduizend megabytes aan geheugen vereiste om een circuit van twintig qubits te verwerken, had de nieuwe methode minder dan twee megabytes nodig. Deze reductie in de vraag naar middelen betekent dat onderzoekers potentieel deze complexe modellen kunnen trainen op veel bescheidener hardware, wat de toegang tot quantum machine learning-onderzoek democratiseert.
De onderzoekers onderzochten ook hoe goed het systeem daadwerkelijk leerde om data te classificeren. Ze testten de methode op vier verschillende datasets, waaronder afbeeldingen van handgeschreven cijfers en medische gegevens gerelateerd aan borstkanker. In elk geval presteerde de RLQ-Grad optimizer beter dan de traditionele gradiëntgebaseerde methoden. Op de eenvoudigere datasets verbeterde het de nauwkeurigheid van het quantumnetwerk met wel tien procent. Op de complexere dataset met afbeeldingen, waar de traditionele methoden begonnen te worstelen naarmidd het circuit groter werd, bleef de nieuwe methode verbeteren en evenaarde het de prestaties van gespecialiseerde technieken die specifiek zijn ontworpen om het barren plateau-probleem op te lossen. Cruciaal was dat dit gebeurde zonder de enorme computationele overhead die die gespecialiseerde technieken gewoonlijk vereisen.
Een van de belangrijkste aspecten van dit werk is wat het uitsluit. De onderzoekers testten expliciet of andere soorten optimalisatie, zoals evolutionaire algoritmen die natuurlijke selectie nabootsen of gradiëntvrije methoden die vallen en opstaan (guess and check), het probleem konden oplossen. Ze ontdekten dat deze alternatieve benaderingen instortten tot een niveau van willekeurige kans wanneer ze werden geconfronteerd met dezelfde circuits van twintig qubits, en niets nutigs leerden. Dit suggereert dat de oplossing niet simpelweg ligt in het vermijden van de berekening van gradiënten, maar in het gebruik van een slim, geleerd beleid om de updates te sturen. De studie verheldert ook dat hoewel deze methode het probleem van de verdwijnende signalen en de hoge geheugenkosten oplost, het niet magisch elk probleem in quantum learning oplost; als het quantumcircuit te klein is of het probleem te eenvoudig, kan het netwerk nog steeds vast komen te zitten in slechte oplossingen, en de methode werkt nog niet op werkelijke fysieke quantumhardware, die onderhevig is aan ruis en fouten.
Het team bewees wiskundig dat hun aanpak werkt omdat het "coach"-programma volledig op klassieke computers werkt, gescheiden van het quantumcircuit zelf. Omdat deze coach geen differentiatie hoeft uit te voeren door de complexe quantumvergelijkingen, is het niet onderhevig aan dezelfde exponentiële afname die de traditionele methoden teistert. De onderzoekers verifieerden dit door aan te tonen dat de variantie van het leersignaal vlak en stabiel bleef naarmidd ze meer qubits toevoegden, terwijl het signaal voor andere methoden snel afnam. Dit structurele voordeel maakt het mogelijk dat de methode efficiënt schaalt, waarbij het slechts lineair groeit met het aantal parameters in plaats van exponentieel met de omvang van het quantum systeem.
Hoewel de studie volledig op simulaties werd uitgevoerd, zijn de implicaties voor de toekomst van quantum computing aanzienlijk. Door de computationele kosten van het trainen met factoren van duizenden te verlagen, kan deze methode wetenschappers in staat stellen om veel grotere en complexere quantum neurale netwerken te verkennen dan voorheen mogelijk werd geacht. Het biedt een nieuw pad voorwaarts voor een veld dat al lang worstelt met de praktische beperkingen van het trainen van deze systemen. De onderzoekers merken op dat de volgende stap zal zijn om deze aanpak op echte quantumhardware te testen en te zien of de geleerde beleidskaders kunnen worden overgedragen op verschillende soorten problemen, wat potentieel een universeel hulpmiddel kan creëren voor het trainen van de quantummachines van morgen. Voor nu staat het werk als een demonstratie dat door de manier waarop we deze machines onderwijzen te veranderen, we de steile kliffen kunnen overwinnen die hun vooruitgang hebben geblokkeerd.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.