← Nieuwste papers
📊 statistics

Learning from the Unseen: Offline Reinforcement Learning with Hidden Actions

Dit artikel introduceert LURE, de eerste methode voor offline reinforcement learning met verborgen acties, die de volgende-toestand variabelen gebruikt als proxies om een meervoudig robuuste en statistisch geldige beleidswaardeschatting mogelijk te maken in oneindige-horizon Markov beslissingsprocessen.

Oorspronkelijke auteurs: Zeyu Bian, Ying Zhou, Yifan Cui

Gepubliceerd 2026-07-29
📖 8 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Zeyu Bian, Ying Zhou, Yifan Cui

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een robot probeert te leren hoe hij een complex spel moet spelen, zoals het navigeren door een stad of het beheren van de gezondheid van een patiënt. Je laat de robot het spel niet in realtime doorlopen; in plaats daarvan geef je hem een gigantisch logboek met eerdere pogingen die door een menselijke speler zijn gedaan. Dit is de wereld van Reinforcement Learning (RL), een tak van kunstmatige intelligentie waarbij computers leren door middel van vallen en opstaan om de beste beslissingen te nemen over een langere periode. Het doel is meestal om uit te vogelen: "Als we in de toekomst een specifieke set regels (een beleid) volgen, hoe goed zouden we dan presteren, gebaseerd op dit oude logboek?"

Er zit echter een addertje onder het gras. In de echte wereld zijn logboeken zelden perfect. Soms heeft de persoon die de aantekeningen maakte een fout gemaakt, of was het systeem dat de gegevens registreerde glitchy. In de taal van dit artikel kan de "actie" die de mens daadwerkelijk heeft ondernomen (zoals het toedienen van een specifiek medicijn) verborgen zijn, en zien we alleen een "proxy" of een ruizige schatting van wat er gebeurde (zoals een doktersnotitie die zegt "medicijn toegediend" terwijl dat eigenlijk niet zo was, of andersom). Als je de robot probeert te onderwijzen met een logboek vol van deze fouten, zal hij de verkeerde lessen leren, wat later leidt tot slechte beslissingen. Dit artikel pakt het lastige probleem aan van hoe je effectief kunt leren wanneer het belangrijkste deel van het verhaal — de ware actie — ontbreend of vermomd is.


Het Mysterie van de Ontbrekende Beweging

In het artikel getiteld "Learning from the Unseen" worden de auteurs, Zeyu Bian, Ying Zhou en Yifan Cui, geconfronteerd met een detectiveverhaal waarbij de belangrijkste aanwijzing ontbreekt. Stel je voor dat je een detective bent die een misdaad probeert op te lossen door naar een beveiligingsvideo te kijken. Maar hier komt de twist: de video toont de schaduw van de verdachte, niet de verdachte zelf. Je ziet de schaduw bewegen, maar je weet niet precies wat de handen van de verdachte deden. In de wereld van data science wordt dit "verborgen acties" genoemd.

Normaal gesproken, wanneer wetenschappers proberen een strategie te evalueren met behulp van historische gegevens (een proces dat Off-Policy Evaluation wordt genoemd), gaan ze ervan uit dat het logboek perfect is. Ze gaan ervan uit dat als het logboek zegt "Actie A werd ondernomen", dan Actie A ook daadwerkelijk is ondernomen. Maar in de rommelige realiteit — zoals ziekenhuisarchieven waar een arts een behandeling pas uren later opschrijft, of een systeem dat per ongeluk een knopdruk verkeerd labelt — is deze aanname een valstrik. Als je de fouten negeert, zal je evaluatie van de strategie bevooroordeeld zijn, zoals het beoordelen van de kookkunsten van een chef op basis van een menu met de verkeerde ingrediënten.

De Magie van de Volgende Stap

De grote doorbraak van de auteurs is het inzicht dat, zelfs als je de "actie" niet direct kunt zien, je de schaduw ervan vaak wel kunt zien in het volgende moment.

Denk er zo over na: Als een goochelaar een toverstaf zwaait (de verborgen actie), zie je de staf misschien niet duidelijk door een vlek op de camera. Maar je kunt wel zien dat het konijn in de hoed verschijnt (de volgende staat). Het konijn is niet zomaar uit het niets verschenen; het verscheen omdat de staf werd gezwaaid. Door de relatie tussen de "volgende staat" (het konijn) en de "ruizige notitie" (de vlekkerige video) te bestuderen, hebben de auteurs ontdekt hoe ze wiskundig kunnen reconstrueren wat de goochelaar daadwerkelijk deed.

Ze noemen hun nieuwe methode LURE (Learning from the Unseen: Robust Estimator). Het is als een super slimme detective die niet alleen naar de wazige foto van de verdachte kijelt, maar ook naar de voetstappen en het weerbericht kijkt om te deduceren wat er precies is gebeurd.

Hoe LURE Werkt: Het "Dubbelcheck"-Systeem en de Gereedschapskist van de Detective

Het artikel introduceert een slimme manier om de waarde van een strategie te schatten zonder gefopt te worden door de fouten. Ze gebruiken een concept genaamd Multiple Robustness.

Stel je voor dat je probeert te raden wat de temperatuur buiten is, maar je thermometer is kapot. Je hebt drie andere aanwijzingen: een natte hond, een wuivende boom en een wolkenformatie.

  • Als je thermometer kapot is, kun je nog steeds correct raden als je "natte hond" aanwijzing accuraat is.
  • Als de hond droog is maar de boom wuift, kun je nog steeds correct raden.
  • Het systeem is "robuust" omdat het niet nodig heeft dat elke aanwijzing perfect is; het heeft slechts een combinatie van hen nodig die juist is.

LURE werkt op dezelfde manier. Het bouwt een wiskundig model dat verschillende delen van de data controleert. Zelfs als het model voor de "ruizige actie" iets fout is, of het model voor de "volgende staat" iets afwijkt, kan de estimator nog steeds de ware waarde van de strategie vinden, zolang ten minste één van de andere delen correct is. Dit maakt het uiteindelijke antwoord veel betrouwbaarder dan eerdere methoden, die zouden instorten als slechts één deel van de data rommelig was.

Maar er zit een verborgen complexiteit in hoe LURE dit puzzelstukje oplost. Omdat de ware acties nooit direct zichtbaar zijn, moet de computer de waarschijnlijkheden van wat er daadwerkelijk is gebeurd, raden. Om dit te doen, hebben de auteurs een speciale iteratieve algoritme ontwikkeld (gebaseerd op een methode genaamd Expectation-Maximization, of EM). Zie dit als een detective die zijn theorie steeds verfijnt:

  1. De Gok (E-stap): De computer begint met een gok over wat de verborgen acties waren.
  2. De Update (M-stap): Met behulp van die gok werkt de computer zijn modellen bij over hoe acties leiden tot beloningen en volgende staten.
  3. De Verfijning: Vervolgens gebruikt de computer deze bijgewerkte modellen om een betere gok te doen over de verborgen acties, en herhaalt de cyclus totdat het verhaal perfect klopt.

Er is echter nog een laatste twist. Omdat de computer aan het raden is, kan hij per ongeluk de labels verwisselen. Hij zou kunnen besluiten dat "Actie 0" eigenlijk de "Medicatie" is en "Actie 1" "Geen Medicatie", terwijl het in werkelijkheid precies het tegenovergestelde is. De wiskunde werkt in beide gevallen, maar de betekenis is omgedraaid. Om dit op te lossen, voegen de auteurs een cruciale stap van label alignment toe. Voordat het definitieve antwoord wordt gegeven, controleert het systeem welke "gok" het meest logisch is met de ruizige data (bijvoorbeeld welke verborgen actie het meest waarschijnlijk resulteert in de geobserveerde "Medicatie"-notitie). Vervolgens draait het systeem de labels om indien nodig, om ervoor te zorgen dat het definitieve rapport overeenkomt met de werkelijkheid.

De Theorie Testen

De auteurs hebben de theorie niet alleen opgeschreven; ze hebben het op drie verschillende manieren getest:

  1. Simpele Simulaties: Ze creëerden een kleine, verzonnen wereld (een "Tabular MDP") met slechts drie staten en twee acties. Ze hebben de gegevens opzettelijk verpest door de acties 5% tot 30% van de tijd verkeerd te labelen. Terwijl andere methoden in de war raakten en foute antwoorden gaven, bleef LURE op koers en raadde de waarde van de strategie correct.
  2. Complexe Simulaties: Ze gingen over naar een complexere, continue wereld (zoals een robot die door een vloeiende ruimte beweegt) en vonden hetzelfde resultaat: LURE ging elegant om met de fouten, terwijl anderen faalden.
  3. Real-World Data: Ze testten LURE op een enorme database met echte patiëntgegevens uit een ziekenhuis (MIMIC-III), specifiek kijkend naar hoe men sepsis (een levensbedreigende reactie op infectie) behandelt. In dit real-world scenario vergeleken ze LURE met standaardmethoden. De resultaten waren opvallend: de standaardmethoden suggereerden dat de ene behandeling beter was dan de andere, maar LURE, door rekening te houden met de verborgen fouten in de medische dossiers, suggereerde een andere, meer betrouwbare rangschikking. Sterker nog, de betrouwbaarheidsintervallen (het bereik van waarschijnlijke antwoorden) van de standaardmethoden overlapten zo sterk dat ze het verschil niet konden zien, terwijl LURE een duidelijk, onderscheidend antwoord gaf.

De Conclusie

Het artikel concludeert dat het negeren van verborgen acties een gevaarlijk gokje is. Door de "volgende staat" te gebruiken als een natuurlijke aanwijzing om de waarheid te ontdekken, en door een systeem te bouwen dat robuust is tegen fouten in verschillende delen van het model, kunnen we strategieën eindelijk accuraat evalueren, zelfs wanneer onze gegevens imperfect zijn.

Dit is niet alleen een theoretische overwinning; het is een praktisch hulpmiddel voor de toekomst. Of het nu gaat om het beslissen over medische behandelingen, het beheren van verkeerslichten of het trainen van AI-agenten, LURE biedt een manier om te leren van het verleden zonder misleid te worden door de ruis. De auteurs laten zien dat we met het juiste wiskundige detectivewerk de onzichtbare zaken kunnen zien en betere beslissingen kunnen nemen voor morgen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →