← Nieuwste papers
🤖 machine learning

Using Reward Uncertainty to Induce Diverse Behaviour in Reinforcement Learning

Dit artikel stelt een nieuw reinforcement learning-framework voor dat van nature diverse en controleerbare agentgedragingen induceert door de doelstelling te herformuleren zodat onzekerheid in beloning wordt behandeld als een distributie over beloningsfuncties, waardoor de trade-offs tussen prestatie en diversiteit die inherent zijn aan traditionele entropieregulering of heuristische methoden worden geëlimineerd.

Oorspronkelijke auteurs: Anthony GX-Chen, Ankit Anand, Gheorghe Comanici, Zaheer Abbas, Eser Aygün, David Smalling, Shibl Mourad, Doina Precup, André Barreto, Mark Rowland

Gepubliceerd 2026-06-03
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Anthony GX-Chen, Ankit Anand, Gheorghe Comanici, Zaheer Abbas, Eser Aygün, David Smalling, Shibl Mourad, Doina Precup, André Barreto, Mark Rowland

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een robot leert om verhalen te schrijven, wiskundige problemen op te lossen of nieuwe medicijnen te ontdekken. In de oude manier van doen (genoemd "Reinforcement Learning") zou je de robot één strikt regelboek geven: "Doe precies wat de hoogste score oplevert."

Het probleem? De robot leert snel een saaie, eendimensionale eenletterrakker te zijn. Hij vindt het ene perfecte antwoord en doet dat elke keer opnieuw, waarbij hij alle andere goede mogelijkheden negeert. Als je regelboek een klein beetje fout is (wat vaak gebeurt wanneer mensen de robot beoordelen), kan de robot die kleine fout overmatig aanleren en daardoor iets vreselijks gaan doen.

Dit artikel stelt een slimmere manier voor om de robot te onderwijzen. In plaats van hem één regelboek te geven, geef je hem een doos met veel verschillende, licht afwijkende regelboeken. Je zegt tegen de robot: "Ik weet niet 100% zeker welk regelboek het 'ware' is, dus leer alstublieft goed te zijn in alle deze regelboeken."

Hier is hoe de nieuwe methode van dit artikel, genaamd ROSA (Randomized Objectives, Set Actions), werkt, met behulp van alledaagse analogieën:

1. De "Doos met Regelboeken" (Beloningsonzekerheid)

In de echte wereld weten we vaak niet precies wat we willen.

  • De Oude Manier: Je vertelt een chef: "Maak de perfecte biefstuk." De chef maakt één specifieke biefstuk en serveert die voor altijd. Als je eigenlijk een medium-rare biefstuk wilde maar zei "perfect", zit de chef vast.
  • De Nieuwe Manier (ROSA): Je vertelt de chef: "Hier zijn 10 verschillende juryleden. Jury A houdt van rare, Jury B houdt van medium en Jury C houdt van well-done. Ik weet niet welke jury vandaag gelijk heeft. Leer alstublieft een biefstuk te maken die elke van deze juryleden zal plezieren."

De robot leert dat, omdat hij niet weet wat de "ware" regel is, de slimste zet is om zijn opties open te houden en klaar te zijn om tussen verschillende stijlen te schakelen. Dit creëert van nature diversiteit zonder de robot te dwingen tot willekeurheid louter om de willekeur zelf.

2. De "Best-of-Many" Truc (Set Actions)

Hoe leert de robot om met deze doos vol regelboeken om te gaan?

  • De Oude Manier: De robot probeert één actie, krijgt een score en werkt bij. Als de score laag is, raakt hij in paniek.
  • De Nieuwe Manier (ROSA): Stel je voor dat de robot een toets maakt. In plaats van één vraag te beantwoorden en op het beste te hopen, schrijft hij tegelijkertijd vijf verschillende antwoorden op.
    • Daarna kijkt de robot, voor elke mogelijke "regelboek" (jury) in de doos, naar zijn vijf antwoorden en kiest het beste antwoord voor die specifieke jury.
    • Hij krijgt een score gebaseerd op die "beste keuze".
    • Ten slotte middelt hij deze scores over alle juryleden.

Dit is alsof je zegt: "Ik hoef niet overal tegelijk perfect in te zijn. Ik moet er alleen maar voor zorgen dat ik voor elke jury die opduikt, minstens één antwoord in mijn zak heb dat hen zal imponeren."

3. Waarom dit beter is dan "Entropie"

Wetenschappers hebben geprobeerd robots eerder te dwingen tot diversiteit door een "verwarringsbonus" toe te voegen (genoemd entropie-regularisatie).

  • De Analogie: Dit is alsof je een student vertelt: "Je krijgt extra punten als je je antwoorden op een slordige, onvoorspelbare manier opschrijft." De student kan dan beginnen met het schrijven van onzin, puur om de bonus te krijgen, zelfs als het antwoord fout is.
  • Het ROSA-Voordeel: ROSA vraagt niet om slordigheid. Het vraagt om voorbereidheid. De robot blijft divers omdat hij nodig heeft om klaar te zijn voor verschillende juryleden. Hij offert het behalen van een hoge score niet op; hij wordt er zelfs beter door in het omgaan met onzekerheid.

4. Wat het Papier Bewezen Heeft

De auteurs hebben dit idee door een aantal tests gehaald:

  • Tegenstrijdige Jury's: Wanneer twee juryleden tegenovergestelde dingen wilden (bijv. "Maak het antwoord even" versus "Maak het antwoord oneven"), faalden oude methoden volledig omdat de instructies elkaar tegenwerkten. ROSA leerde om beide te doen, waarbij het tussen even en oneven antwoorden schakelde afhankelijk van de context.
  • Meerdere Correcte Antwoorden: Bij wiskundige problemen zijn er vaak veel manieren om een probleem op te lossen (kort en krachtig, of lang en gedetailleerd). Oude methoden kozen één stijl en bleven daarbij. ROSA leerde om alle verschillende geldige stijlen te genereren, waardoor de gebruiker meer keuzes krijgt.
  • Ruisende Jury's: Wanneer de juryleden in de war waren of fouten maakten (wat de onzekerheid in de echte wereld simuleert), raakte ROSA niet in de war. Het behield een gezonde variatie aan antwoorden, terwijl andere methoden vastliepen in slechte gewoontes.

De Kernboodschap

Het artikel betoogt dat diversiteit geen bug is, maar een feature van slim zijn wanneer je het niet zeker weet.

Door de beloning niet te behandelen als één enkel getal, maar als een verdeling van mogelijkheden, en door de robot te trainen om te kijken naar een verzameling potentiële antwoorden tegelijk, krijgen we een systeem dat:

  1. Robuust is: Het gaat niet kapot als de regels iets afwijken.
  2. Divers is: Het biedt van nature veel verschillende goede oplossingen aan.
  3. Efficiënt is: Het verspilt geen tijd aan proberen willekeurig te zijn; het blijft divers omdat dat de rationele keuze is wanneer de toekomst onzeker is.

Kortom: In plaats van een robot te trainen om een specialist te zijn die één antwoord kent, traint ROSA een robot om een generalist te zijn die voor alles klaar is.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →