← Nieuwste papers
🔬 physics

Reinforcement learning for vertical position control on the EXL-50U spherical tokamak

Dit artikel presenteert een experimenteel gevalideerd reinforcement learning-framework voor verticale positiecontrole op de EXL-50U sferische tokamak, dat een millimeter-schaal nauwkeurigheid bereikt die vergelijkbaar is met traditionele PID-regelaars, terwijl het consistent de actuatorinspanning vermindert, waarmee de haalbaarheid van op leren gebaseerde controle voor toekomstige fusiesystemen wordt aangetoond.

Oorspronkelijke auteurs: Lei Xing, Huicong Ma, Changquan Yu, Xuanhe Wang, Jiayi Zhi, Pei Guo, Mengyao Li, Zhengyuan Chen, Yapeng Zhang, Guoyang Shi, Dongkai Qi, Xiang Gu, Siqi Ding, Yong Liu, Jianguo Chen, Tianyuan Liu, the E
Gepubliceerd 2026-08-24
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Lei Xing, Huicong Ma, Changquan Yu, Xuanhe Wang, Jiayi Zhi, Pei Guo, Mengyao Li, Zhengyuan Chen, Yapeng Zhang, Guoyang Shi, Dongkai Qi, Xiang Gu, Siqi Ding, Yong Liu, Jianguo Chen, Tianyuan Liu, the EXL-50U Teama

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

In de zoektocht naar schone, grenzeloze energie proberen wetenschappers de kracht van de zon hier op aarde na te bootsen. Dit doen ze door superheet gas, plasma genoemd, gevangen te houden in een magnetische kooi in de vorm van een donut. Dit proces, bekend als magnetische opsluiting door fusie, vereist dat het plasma perfect stil wordt gehouden. Als het gas zelfs maar een klein beetje uit het midden afwijkt, kan het de wanden van de machine raken, onmiddellijk afkoelen en stopt de reactie. Dit is vooral lastig in een specifiek type machine die een sferische tokamak wordt genoemd, die meer de vorm heeft van een kernappel dan van een platte donut. Deze machines zijn ontworpen om compact en efficiënt te zijn, maar hun unieke vorm maakt het plasma van nature onstabiel, gevoelig voor het omhoog of omlaag schieten zoals een ballon die niet op zijn plaats wil blijven. Het stabiel houden van deze zwevende vuurballon is het verschil tussen een succesvol experiment en een plotselinge, gewelddadige crash.

Jarenlang vertrouwden onderzoekers op standaard, op regels gebaseerde computerprogramma's om het plasma in het midden te houden. Deze programma's fungeren als een thermostaat, die voortdurend de positie controleert en kleine aanpassingen maakt aan de magnetische velden. Hoewel ze goed genoeg werken voor sommige opstellingen, hebben ze moeite wanneer het plasma uitgerekt is of wanneer de machine tot zijn uiterste wordt gedreven. In recente experimenten op een machine genaamd EXL-50U in China, lieten deze standaard controles het plasma vaak aanzienlijk wankelen, waarbij het soms enkele centimeters afweek. Dergelijke grote bewegingen zijn gevaarlijk; ze kunnen de machine beschadigen en het gebruik van geavanceerde verwarmingssystemen verhinderen. Om dit op te lossen, heeft een team van wetenschappers zich tot een ander soort intelligentie gekeerd: machine learning. In plaats van de computer met rigide regels te programmeren, hebben ze hem geleerd hoe hij het plasma moet besturen door te oefenen in een zeer gedetailleerde virtuele simulatie, net zoals een piloot traint in een vluchtsimulator voordat hij ooit een echt vliegtuig aanraakt.

De onderzoekers bouwden een digitale tweeling van de EXL-50U machine, een virtuele omgeving die de echte fysica van het plasma en de elektrische circuits met extreme precisie nabootst. Binnen deze simulatie testten ze een nieuw type controller gebaseerd op reinforcement learning. Dit is een methode waarbij een kunstmatige agent leert door middel van vallen en opstaan, waarbij hij een beloning krijgt voor het stabiel houden van het plasma en een straf voor het laten afwijken ervan. Het team trainde deze digitale agent op één specifieke experimentele run en daagde hem vervolgens uit om het plasma te besturen tijdens een volledig andere run, waarbij de omstandigheden iets anders waren. Ze vergeleken deze op leren gebaseerde aanpak met de standaard op regels gebaseerde controller en een andere geavanceerde methode die bekend staat als een lineaire kwadratische regulator, die steunt op complexe wiskundige modellen.

De resultaten uit de simulatie waren veelzeggend. De standaard op regels gebaseerde controller kon het plasma op koers houden, maar vereiste dat de magneten van de machine heel hard werkten, waarbij veel elektrische energie werd gebruikt om constante correcties uit te voeren. De op modellen gebaseerde aanpak had moeite om stabiel te blijven wanneer de omstandigheden veranderden, waardoor het plasma vaak in een licht verkeerde positie bleef. De reinforcement learning agent leerde het plasma echter met opmerkelijke vloeiendheid te leiden. Het volgde het gewenste pad net zo nauwkeurig als de standaard controller, maar deed dit met aanzienlijk minder inspanning van de magneten. Deze efficiëntie is cruciaal omdat het betekent dat de machine langer en stabieler kan draaien zonder de energiesystemen te overbelasten. Om te garanderen dat de lerende agent de onvermijdelijke verschillen tussen de virtuele wereld en de werkelijkheid kon afhandelen, voegde het team een eenvoudige correctiemechanisme toe dat hielp bij het aanpassen aan kleine fouten, een techniek die essentieel bleek voor het behoud van precisie.

Geënthousiasmeerd door deze virtuele successen, haalde het team de getrainde kunstmatige intelligentie uit de computer en plaatste deze in de echte machine. Ze implementeerden de lerende controller op de werkelijke EXL-50U tokamak, waarbij ze de controle overnamen tijdens live experimenten. In meer dan tien afzonderlijke schoten slaagde het systeem erin het plasma verticaal stabiel te houden binnen het aangewezen tijdsvenster. In een directe vergelijking over zeven van deze schoten, evenaarde de lerende controller de nauwkeurigheid van de standaard controller, waarbij het plasma binnen enkele millimeter van het doel werd gehouden. Tegelijkertijd gebruikte het consequent minder elektrische energie om deze stabiliteit te bereiken. Dit toonde aan dat een machine learning-systeem niet alleen de barre omgeving van een fusiereactor kan overleven, maar ook de traditionele methoden kan overtreffen in termen van efficiëntie.

De experimenten brachten echter ook de beperkingen van de huidige technologie aan het licht. Wanneer de plasmastroom aan het einde van een experiment begon te dalen, begon de lerende controller, die getraind was op stabiele omstandigheden, zijn grip te verliezen en begon het plasma weer af te wijken. Dit toonde aan dat hoewel de agent uitstekend was in het afhandelen van stabiele fasen, hij nog steeds robuustere instrumenten nodig had om zich aan snel veranderende omstandigheden aan te passen. De onderzoekers merkten op dat toekomstige verbeteringen waarschijnlijk zouden vereisen dat het systeem veranderingen in het gedrag van de machine in realtime identificeert en de strategie gaandeweg aanpast. Ondanks dat bleek de succesvolle inzet een belangrijke stap voorwaarts. Het bewijst dat op leren gebaseerde controle een levensvatbaar pad is voor het beheren van de complexe, onstabiele fysica van fusie, wat een praktische route biedt naar de meer stabiele en efficiënte reactoren die nodig zijn om schone energie op het elektriciteitsnet te brengen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →