← Nieuwste papers
🤖 machine learning

Cross-Domain Off-Policy Evaluation and Learning for Contextual Bandits

Dit artikel stelt een nieuw Cross-Domain Off-Policy Evaluation en Learning framework voor dat historische datasets van zowel doel- als brondomeinen benut om kritieke uitdagingen zoals few-shot data, deterministische logging-policies en nieuwe acties te overwinnen, waardoor effectieve policy-evaluatie en -optimalisatie mogelijk wordt in scenario's waar bestaande methoden falen vanwege hoge variantie of beperkte exploratie.

Oorspronkelijke auteurs: Yuta Natsubori, Masataka Ushiku, Yuta Saito

Gepubliceerd 2026-07-27
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Yuta Natsubori, Masataka Ushiku, Yuta Saito

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je de kapitein bent van een schip dat probeert te navigeren door een stormachtige zee, maar je hebt deze specifieke route nog nooit eerder gevaren. Je hebt een kaart van de eerdere reizen van je huidige schip (de "gelogde data"), maar die kaart is incompleet. Misschien was je oude kapitein te voorzichtig en voer hij alleen in kalme wateren, waardoor de gevaarlijke riffen niet in kaart zijn gebracht. Of misschien ontbreekt de kaart zelfs volledig omdat het schip te klein was om de hele oceaan te verkennen. In de wereld van de computerwetenschap, specif으로 een veld genaamd Machine Learning, is dit een bekend probleem dat bekend staat als Contextual Bandits. Dit is hoe computers leren beslissingen te nemen—zoals het aanbevelen van een film, het suggereren van een medicijn of het tonen van een advertentie—gebaseerd op de situatie (de "context") zonder dat ze elke optie in de echte wereld daadwerkelijk hoeven uit te proberen, wat duur of riskant kan zijn.

Om dit op te lossen, gebruiken wetenschappers een techniek genaamd Off-Policy Evaluation (OPE). Denk aan OPE als een "vluchtsimulator" voor besluitvorming. In plaats van een nieuwe strategie te testen op echte mensen (wat riskant is), draai je deze door een computer met behulp van oude data om te zien hoe het er zou hebben uitgezien. Het probleem is dat de meeste simulators vastlopen als de oude data te saai is (de kapitein deed maar één ding) of als de nieuwe strategie iets wil proberen wat de oude kapitein nooit heeft gedaan. Als de oude data geen verslag heeft van een specifieke actie, kan de simulator niet raden wat er zou gebeuren, wat leidt tot wilde gokken of totaal falen. Dit artikel pakt het lastige scenario aan waarbij de oude data ofwel te beperkt, te rigide, of volledig afwezig is wat betreft cruciale nieuwe opties.

Hier komen de onderzoekers van Hakuhodo DY Holdings en Cornell University kijken, die een slimme nieuwe manier voorstellen om deze defecte simulator te repareren. Ze noemen hun idee Cross-Domain Off-Policy Evaluation and Learning. Stel je voor dat je probeert te leren surfen in een nieuwe, onbekende oceaan (het "doeldomein"), maar je lokale strand (het "brondomein") heeft een ander golfpatroon. Als je alleen naar je lokale strand kijkt, raak je in de war wanneer je een enorme golf ziet die daar nooit is voorgekomen. Maar wat als je ook een video kunt bekijken van surfen in een naburige oceaan die vergelijkbare golven heeft? Zelfs als het water iets anders is, kan de fysica van de golf hetzelfde zijn.

De auteurs stellen voor dat je, in plaats van vast te zitten met de saaie of incomplete data van je huidige situatie, inzichten kunt lenen uit andere, vergelijkbare situaties (andere "domeinen"). Ze realiseerden zich dat hoewel elke ziekenhuis, land of gebruikersgroep uniek is, ze vaak onderliggende patronen delen. Bijvoorbeeld, een behandeling kan in twee verschillende ziekenhuizen vergelijkbaar werken, zelfs als de patiëntendemografie varieert. Het artikel introduceert een nieuwe methode genaamd COPE (Cross-domain Off-Policy Evaluation). Deze werkt door de "beloning" (de goede uitkomst) op te splitsen in twee delen: een gedeeld deel dat gemeenschappelijk is voor vergelijkbare groepen (zoals de algemene fysica van de golf) en een uniek deel dat specifiek is voor jouw groep (zoals de lokale wind).

Door data uit andere domeinen te gebruiken om het "gedeelde deel" te achterhalen, kan COPE de gaten opvullen voor acties die in jouw specifieke data nooit zijn geprobeerd. Het is alsoam met een kaart van een naburige stad gebruiken om de lay-out van een straat in jouw eigen stad te achterhalen die je eigen kaart vergeten was te tekenen. De onderzoekers hebben dit getest op echte data van een video-app (KuaiRec) en ontdekten dat wanneer de doeldata schaars was, of wanneer de oude data te rigide (deterministisch) was, of wanneer er volledig nieuwe acties waren om te proberen, hun methode veel nauwkeuriger was dan de oude manieren. Ze lieten zien dat door data van meerdere bronnen te combineren maar er zorgvuldig rekening mee te houden dat ze verschillen, ze nieuwe beleidstrategieën veel effectiever kunnen evalueren en leren.

In hun experimenten simuleerden ze scenario's waarbij de nieuwe acties tot wel 80% van de mogelijke keuzes vormden, of waarbij de oude data zo beperkt was dat er slechts één datapunt per actie was. In deze zware gevallen verminderde hun nieuwe methode de fouten aanzienlijk vergeleken met de standaard benaderingen. Ze toonden ook aan dat dit werkt voor "leren" (het vinden van de beste strategie), niet alleen voor "evalueren" (het controleren van een strategie). Het artikel suggereert dat door verschillende databronnen te behandelen als een verbonden familie in plaats van geïsoleerde eilanden, we slimmere, veiligere en aanpasbaardere beslissingssystemen kunnen bouwen, vooral wanneer we niet genoeg data hebben om vanaf nul te leren.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →