← Nieuwste papers
📊 statistics

On-Policy and Off-Policy Learning for Large Action Spaces

Deze thesis behandelt de uitdagingen van beleidsleren in contextuele bandits met grote actieruimtes door gestructureerde Bayesiaanse methoden voor on-policy leren voor te stellen om exploratie en regret-bounds te verbeteren, naast nieuwe off-policy technieken die schattingsfouten verminderen en de bias-variantie-afweging beheersen door middel van geoptimaliseerde doelstellingen en differentiabele pessimistische benaderingen.

Oorspronkelijke auteurs: Imad Aouali

Gepubliceerd 2026-07-31
📖 6 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Imad Aouali

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je de kapitein bent van een enorm ruimteschip dat probeert de beste route te vinden door een sterrenstelsel met miljoenen sterren. Elke keer dat je een ster kiest om te bezoeken, krijg je een klein, wazig signaal dat je vertelt of het een goede of een slechte keuze was. Dit is de wereld van contextuele bandits, een tak van kunstmatige intelligentie die computers helpt beslissingen te nemen wanneer ze de regels van het spel nog niet kennen. De "context" is de situatie waarin je je bevindt (zoals het weer of je stemming), de "actie" is wat je doet (zoals het kiezen van een ster) en de "beloning" is het resultaat (zoals het vinden van schatten of het raken van een asteroïde).

Het lastige deel is de enorme hoeveelheid keuzes. Als je moet raden welke van een miljoen sterren de beste is, en je kunt er slechts een paar tegelijk controleren, ben je misschien je hele leven bezig met het verkennen van de verkeerde sterren. Dit is het "large action space"-probleem. Het is also': proberen een specifieke naald in een hooiberg te vinden die zo groot is als een stad, terwijl je slechts één strohalm tegelijk kunt pakken en hoopt dat het de naald is. Wetenschappers geven hierom omdat het de motor is achter zaken als het aanbevelen van films, het tonen van de juiste advertenties of zelfs het ontwerpen van nieuwe medicijnen. Als de computer blijft gokken op basis van willekeur, verspilt hij tijd en geld.

Deze thesis behandelt het probleem van hoe je een computer kunt leren slimme keuzes te maken wanneer hij wordt geconfronteerd met miljoenen opties, gebruikmakend van twee verschillende strategieën: leren terwijl je onderweg bent (on-policy) en leren van oude logs (off-policy).

Het On-Policy Avontuur: Leren door te doen met een kaart

Eerst kijkt de auteur naar het "on-policy" scenario, waarbij de computer leert door in real-time met de wereld te interageren. Stel je voor dat je een enorme bibliotheek verkent met miljoenen boeken, maar je weet niet welke goed zijn. Een standaard ontdekkingsreiziger zou een boek kiezen, een pagina lezen, en als het saai is, naar een compleet ander boek gaan, beginnend vanaf nul. Dit is traag en inefficiënt.

De paper introduceert een slimmere ontdekkingsreiziger met behulp van Mixed-Effect Thompson Sampling (meTS). In plaats van elk boek als een uniek mysterie te behandelen, merkt deze ontdekkingsreiziger op dat boeken bij genres horen. Hij leert dat "Sci-Fi" boeken gemeenschappelijke kenmerken delen. Door boeken in categorieën te groeperen (zoals "Actie", "Romantiek" of "Mysterie"), kan de ontdekkingsreiziger over het hele genre leren door slechts enkele boeken te lezen. Als hij één geweldig Sci-Fi boek leest, krijgt hij een hint dat andere Sci-Fi boeken ook goed kunnen zijn. Dit "delen van informatie" versnelt het leren drastisch. De wiskunde laat zien dat in plaats van dat de computer over miljoenen individuele boeken moet leren, hij alleen over een paar dozijn "genres" (latente effecten) en de specifieke eigenaardigheden van elk boek binnen die genres hoeft te leren.

De auteur neemt dit idee vervolgens nog een stap verder met Diffusion Thompson Sampling (dTS). Als de eerste methode vergelijkbaar was met het groeperen van boeken per genre, dan is deze nieuwe methode als een super-slimme bibliothecaris die de diepe, complexe verbindingen tussen boeken begrijpt. Misschien is een boek een mix van "Cyberpunk" en "Historische Fictie", of misschien deelt het een specifieke schrijfstijl met een boek uit een andere eeuw. Gebruikmakend van een type AI genaamd een "diffusiemodel" (dezelfde technologie achter sommige beeldgeneratoren), leert de computer een rijke, diepe kaart van hoe alle boeken met elkaar verband houden. Dit stelt hem in staat om de bibliotheek veel sneller te verkennen, zelfs als de bibliotheek enorm groot is. In simulaties vonden deze methoden de beste boeken veel sneller dan oudere methoden die elk boek als een vreemde behandelden.

De Off-Policy Uitdaging: Leren van een rommelig dagboek

Vervolgens pakt de paper het "off-policy" scenario aan. Stel je voor dat je de bibliotheek niet meer zelf kunt verkennen. In plaats daarvan moet je leren van een rommelig dagboek achtergelaten door een vorige ontdekkingsreiziger die heel andere smaken had. Misschien las die ontdekkiger alleen horrorfilms, en moet jij nu de beste romantische films vinden. Dit is het "off-policy" probleem: leren van data verzameld door iemand anders.

De auteur daagt een algemeen geloof in het vakgebied uit: dat het belangrijkste is om de meest nauwkeurige "beloningsschatter" (een kristallen bol die voorspelt hoe goed een keuze zal zijn) te bouwen. De paper betoogt dat in enorme bibliotheken optimalisatie eigenlijk het grotere probleem is. Het is alsof je een perfecte kaart hebt (de schatter) maar probeert te navigeren met een kapotte kompas (het optimalisatiealgoritme). De wiskunde laat zien dat standaard manieren om deze kaarten te gebruiken vaak vastlopen in "vlakke plateaus" of lokale vallen, waardoor het onmogelijk is om het beste pad te vinden, ongeacht hoe goed de kaart is.

Om dit op te lossen, stelt de auteur een nieuwe aanpak voor: Policy-Weighted Log-Likelihood (PWLL). In plaats van te proberen de exacte beloning te voorspellen, richt deze methode zich op het maken van het optimalisatiepad vloeiend en gemakkelijk begaanbaar. Het is alsof je overstapt van een grillig, rotsachtig bergpad naar een zachte, kronkelende weg. Zelfs als de weg niet perfect recht is, is het veel gemakkelijker om de top te bereiken. In experimenten met tot wel één miljoen acties presteerde deze eenvoudige, vloeiende aanpak consequent beter dan de complexe, "slimme" schatters die vastliepen.

De paper introduceert ook een nieuwe manier om de "ruis" in het oude dagboek aan te pakken. Wanneer de vorige ontdekkingsreiziger zelden bepaalde secties bezocht, is de data onbetrouwbaar. De auteur stelt voor om Exponential Smoothing te combineren met "geprincipieerde pessimisme". Denk hierbij aan een voorzichtige ontdekkingsreiziger die het dagboek vertrouwt, maar een veiligheidsbuffer toevoegt. Als het dagboek zegt dat een pad geweldig is, maar de data is wankel, gaat de ontdekkingsreiziger ervan uit dat het pad iets minder goed is dan gerapporteerd om rampen te voorkomen. De paper bewijst wiskundig dat deze methode de ontdekkingsreiziger veilig houdt terwijl hij nog steeds effectief kan leren, en dat het goed werkt, zelfs wanneer de data schaars is.

Het Grote Plaatje

Kortom, deze thesis laat zien dat wanneer je met miljoenen keuzes te maken hebt, je niet simpelweg op brute-force wijze te werk kunt gaan. Je moet de verborgen structuren vinden (zoals genres of diepe verbindingen) om de informatie die je leert te delen, en je moet ervoor zorgen dat je leertraject vloeiend genoeg is om de oplossing daadwerkelijk te vinden. Of je nu leert in real-time of graaft in oude logs, de sleutel is om slim te zijn in hoe je informatie groepeert en hoe je de wiskunde navigeert. De resultaten, getest op zowel gesimuleerde data als echte datasets voor film aanbevelingen, suggereren dat deze nieuwe methoden een belangrijke stap voorwaarts zijn in het schaalbaar en efficiënt maken van AI-besluitvorming.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →