← Nieuwste papers
🤖 machine learning

Noisy-Space Policy Gradient for Diffusion Policies in Offline Reinforcement Learning

Dit artikel introduceert Noisy-Space Policy Gradient (NSPG), een nieuw framework dat effectief offline reinforcement learning met diffusiebeleid mogelijk maakt door een KL-geregulariseerde doelstelling over diffusie-latenten af te leiden die optimaliseert met schone waarde-inschattingen in de actieruimte zonder backpropagation door het denoisingsproces te vereisen.

Oorspronkelijke auteurs: Mahmoud Selim, Cristina Cipriani, Karl H. Johansson

Gepubliceerd 2026-09-09
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Mahmoud Selim, Cristina Cipriani, Karl H. Johansson

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

In de wereld van kunstmatige intelligentie bestaat een hardnekkige uitdaging die bekend staat als offline reinforcement learning. Stel je een student voor die probeert een complexe videogame te leren spelen, maar die verboden is om de controller aan te raken. De student mag alleen uren aan opgenomen beelden bekijken van andere spelers, van wie sommigen experts waren en anderen veel fouten maakten. Het doel is om een strategie te leren die vaker wint dan de mensen in de video's, zonder ooit een nieuwe zet te riskeren die tot een crash zou kunnen leiden. Dit is moeilijk omdat de AI moet leren van een vaste set gegevens zonder het vangnet van vallen en opstaan. Als de AI een zet raadt die nooit in de opnames is gezien, kan het catastrofaal falen, omdat het geen manier heeft om te weten of die zet daadwerkelijk goed is of slechts een gevaarlijke hallucinatie.

Om dit op te lossen, hebben onderzoekers zich gericht op een type AI-model dat een diffusiebeleid (diffusion policy) wordt genoemd. Deze modellen zijn uitzonderlijk goed in het begrijpen van complexe patronen, zoals de vele verschillende manieren waarop een menselijke hand een gereedschap kan vastpakken of een robot door een doolhof kan navigeren. Ze werken door te beginnen met een chaotische, ruisachtige gok en deze stap voor stap te verfijnen totdat het een duidelijke, bruikbare actie wordt. Echter, een fundamenteel probleem doet zich voor bij het proberen te leren hoe dit model moet winnen: het model maakt zijn beslissingen in een verborgen, ruisachtige ruimte, maar de beloningen die het ontvangt, zijn gebaseerd op de uiteindelijke, schone acties die het daadwerkelijk uitvoert. Het is alsof je een essay van een student beoordeelt door naar de slordige, doorgestreepte concepten te kijken in plaats van naar de uiteindelijke, gepolijste pagina. De feedbackloop is onderbroken, en de AI worstelt ermee om te leren welke van zijn verborgen stappen tot succes leidden.

Een team van onderzoekers heeft deze kloof overbrugd met een nieuwe methode genaamd Noisy-Space Policy Gradient. In plaats van te proberen de ruisachtige, verborgen stappen direct te laten overeenkomen met de uiteindelijke beloningen, hebben ze een nieuwe manier ontwikkeld om waarde toe te kennen aan die verborgen stappen. Ze realiseerden zich dat een enkele ruisachtige gok niet slechts overeenkomt met één uiteindelijke actie, maar met een hele wolk van mogelijke acties die eruit zouden kunnen ontstaan. Door de gemiddelde beloning van alle mogelijke schone acties te berekenen die uit een specifieke ruisachtige gok kunnen voortkomen, creëerden ze een eerlijke en nauwkeurige score voor die gok. Deze score vertelt de AI precies hoe goed een bepaalde verborgen stap is, gebaseerd op de potentiële uitkomsten die het kan produceren, in plaats van te forceren dat het zich vastlegt op één enkel, mogelijk foutief eindantwoord.

De onderzoekers testten deze aanpak op een breed scala aan taken, variërend van eenvoudige robotbewegingen tot complexe visuele puzzels. In deze experimenten presteerde de nieuwe methode consequent beter dan eerdere technieken, vooral in moeilijke scenario's waar de data schaars was of de taken lange ketens van precieze acties vereisten. Bijvoorbeeld, in taken waarbij het navigeren door grote doolhoven of het manipuleren van delicate objecten centraal stond, behaalde de nieuwe methode aanzienlijk hogere succespercentages dan oudere modellen. Het bleek bijzonder effectief in situaties waarin de AI moest kiezen tussen een gebruikelijke, veilige actie en een zeldzame, hoog-belonende actie, een keuze die oudere modellen vaak in verwarring bracht. Door naar het volledige bereik van mogelijkheden te kijken in plaats van naar één enkel pad, leerde de AI om betrouwbaarder op de hoog-belonende uitkomsten te mikken.

Een van de meest significante aspecten van dit werk is hoe het de relatie tussen het interne denkproces van de AI en de echte wereld afhandelt. Eerdere methoden probeerden de verborgen stappen van de AI direct te evalueren, wat leidde tot verwarring en instabiliteit. Anderen probeerden het denkproces van de AI te vereenvoudigen om het gemakkelijker te kunnen evalueren, maar dit ontnam vaak juist de complexiteit die de AI zo krachtig maakte. De nieuwe aanpak vermijdt deze valkuilen door de evaluatie strikt in de wereld van echte acties te houden, terwijl de AI op zijn complexe, ruisachtige manier mag denken. Het fungeert als een vertaler, die ervoor zorgt dat de feedback die de AI ontvangt altijd geworteld is in de realiteit, ook al leert de AI in een verborgen ruimte.

De resultaten suggereren dat deze methode een solide fundament biedt voor het trainen van geavanceerde AI-systemen op historische data. De onderzoekers ontdekten dat de methode stabiel en efficiënt bleef, waarbij slechts een klein aantal berekeningen nodig was om de waarde van elke stap te schatten. Deze efficiëntie is cruciaal, aangezien het betekent dat de methode kan worden toegepast op grote, complexe problemen zonder te traag te worden om praktisch bruikbaar te zijn. Het team onderzocht ook hoe gevoelig het systeem was voor verschillende instellingen en stelde vast dat het goed functioneerde over een breed scala aan condities zonder dat er constante, delicate afstemming nodig was. Deze robuustheid maakt het een veelbelovende tool voor toekomstige toepassingen in robotica en automatisering, waar leren van historische data vaak de enige optie is.

Uiteindelijk lost dit werk een langdurige discontinuïteit op in de manier waarop AI van ervaring leert. Het demonstreert dat door het juiste begrip van de relatie tussen verborgen gedachten en zichtbare acties, we complexe systemen kunnen leren verbeteren zonder ooit buiten de grenzen van hun trainingsdata te treden. De methode vertrouwt niet op magie of gokwerk; het vertrouwt op een helder, wiskundig begrip van hoe ruis in actie verandert. Naarmate het veld van kunstmatige intelligentie zich blijft ontwikkelen, zullen benaderingen die veilig en effectief van het verleden kunnen leren, essentieel zijn voor het bouwen van systemen die zowel bekwaam als betrouwbaar zijn. Deze nieuwe techniek biedt een principiële weg voorwaarts, die het rommelige proces van leren van statische data transformeert naar een helder pad naar betere besluitvorming.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →