← Nieuwste papers
🤖 machine learning

Upper-Expectile Multi-Step Q-Learning for Off-Policy Reinforcement Learning

Dit artikel introduceert Expectile nn-step Q-learning (ENQ), een off-policy reinforcement learning-algoritme dat een asymmetrische expectile-verliesfunctie gebruikt om de pessimistische bias die inherent is aan multi-step returns te mitigeren, waarbij het theoretische garanties van contractie en superieure empirische prestaties over diverse taken biedt vergeleken met bestaande methoden zoals Long-Horizon Q-learning.

Oorspronkelijke auteurs: Abdelghani Ghanem, Mounir Ghogho

Gepubliceerd 2026-08-04
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Abdelghani Ghanem, Mounir Ghogho

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een robot leert navigeren door een gigantisch, complex doolhof. Je kunt niet elke route met hem samen afleggen; in plaats daarvan geef je hem een logboek met routes die door andere robots zijn afgelegd, waarvan sommige experts waren en vele gewoon doelloos ronddwaalden. Dit is de wereld van offline reinforcement learning: een tak van kunstmatige intelligentie waarbij een agent leert van historische gegevens in plaats van door live vallen en opstaan. Het doel is om de beste zetten te bepalen om een beloning te bereiken, zoals het vinden van de uitgang of het pakken van een object.

Om snel te leren, gebruiken deze robots een truc genaamd multi-step returns. In plaats van slechts één stap vooruit te kijken om te zien of een zet goed was, kijken ze tegelijkertijd meerdere stappen vooruit, alsof ze een heel hoofdstuk van een verhaal lezen om de plot te begrijpen, in plaats van slechts één zin. Dit helpt om beloningen sneller door het systeem te verspreiden. Er is echter een addertje onder het gras: als het logboek veel slechte paden bevat die zijn afgelegd door onhandige robots, kan te ver vooruitkijken de leerling overdreven pessimistisch maken. De leerling begint te denken: "Als ik deze stap zet, kom ik op een van die verschrikkelijke paden terecht," en weigert vervolgens risico's te nemen, zelfs als er een goed pad bestaat. Dit artikel pakt dit specifieke probleem aan: hoe behoud je de snelheid van ver vooruitkijken zonder vast te lopen in de pessimist van slechte historische data.

De onderzoekers stellen een nieuwe methode voor genaamd Expectile n-step Q-learning (ENQ). Denk aan leren van een logboek als het proberen te raden van de eindscore van een sportwedstrijd op basis van een seizoen van voorgaande wedstrijden. Een standaardbenadering zou de gemiddelde score nemen van alle wedstrijden die op een specifieke actie volgen. Maar als het logboek vol staat met wedstrijden waarin het team slecht heeft verloren, zal dat gemiddelde laag zijn, wat de speler ontmoedigt om die actie opnieuw te proberen. ENQ verandert de spelregels. In plaats van het gemiddelde te berekenen, berekent het een "upper expectile". In gewone mensentaal betekent dit dat het de slechtste uitkomsten negeert en zich richt op de betere, meer optimistische scenario's die wel in het logboek voorkwamen. Het is als een coach die, bij het beoordelen van de geschiedenis van een speler, zegt: "Negeer de dagen waarop je slecht speelde; laten we ons richten op de dagen waarop je goed speelde en uitzoeken hoe we daar weer kunnen komen."

Het artikel laat zien dat deze methode wiskundig onderbouwd is. De auteurs bewijzen dat het ENQ-systeem stabiel is en uiteindelijk zal bezinken op een betrouwbare strategie, zelfs wanneer er ver in de toekomst wordt gekeken. Ze demonstreren ook dat deze methode onder bepaalde omstandigheden de best mogelijke strategie perfect kan herstellen als de data ten minste één goed pad bevat. In de echte wereld hebben ze ENQ getest op 27 verschillende taken, variërend van robotarmen die kubussen stapelen tot humanoïde robots die door gigantische doolhoven navigeren. Ze ontdekten dat ENQ concurrerend is met, en vaak beter dan, de huidige topmethode (genaamd LQL), vooral wanneer het gebruik maakt van een groot team van "critics" (meerdere AI-modellen die samenwerken) om beslissingen te nemen.

Een van de meest interessante bevindingen gaat over snelheid. Omdat ENQ eenvoudiger is en niet elke individuele stap van een lang pad hoeft te controleren zoals andere methoden doen, draait het sneller. In hun tests verwerkte ENQ trainingsstappen ongeveer 1,27 tot 1,77 keer sneller dan de concurrentie, afhankelijk van hoeveel AI-modellen er in het team zaten. Dit suggereert dat door slimmer te zijn over welke delen van de historische data ze op moeten focussen, de robot sneller en effectiever leert.

De auteurs onderzochten ook hoe "optimistisch" de methode moet zijn. Ze testten een instelling waarbij de methode naar de allerbeste uitkomsten kijkt (een hoog "expectile"-niveau) versus een meer gebalanceerd beeld. Ze ontdekten dat hoewel extreem optimistisch zijn goed werkt voor sommige taken, het voor andere taken riskant kan zijn als de data ruis bevat. Echter, een middenweg-instelling (specifiek een expectile-niveau van 0,8) werkte consistent goed over bijna alle taken heen, zonder dat dit voor elk specifief doolhof of elke specifieke robot aangepast hoefde te worden.

Samenvattend introduceert dit artikel een slimme manier om robots te onderwijzen vanuit oude logs door de slechtste scenario's te negeren en zich te concentreren op de beste scenario's die daadwerkelijk hebben plaatsgevonden. Het is een methode die wiskundig bewezen stabiel is, sneller draait en zeer effectief is in het onderwijzen van robots om complexe omgevingen te navigeren, wat een veelbelovende weg biedt voor het efficiënter laten leren van AI-agents uit imperfecte ervaringen uit het verleden.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →