Position: Deployed Reinforcement Learning should be Continual
Dit position paper betoogt dat ingezette reinforcement learning-systemen een paradigma van continu leren zouden moeten adopteren in plaats van de traditionele train-en-fix-benadering, aangezien real-world non-stationariteit vereist dat agenten nooit stoppen met adapteren om optimale prestaties te behouden.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een briljante chef-kok inhuurt om het diner voor je familie te koken. Je traint hen maandenlang in een testkeuken, waarbij je ze elk recept voert dat ze ooit nodig zouden kunnen hebben. Zodra ze het eindexamen hebben gehaald, sluit je de keukendeur, geef je ze een vast menu en zeg je: "Je bent klaar met leren. Kook dit menu voor altijd."
Dit is hoe de meeste AI-systemen vandaag de dag werken. Het artikel noemt dit het "Train-Then-Fix" paradigma (trainen-en-dan-vastzetten).
De auteurs van dit artikel stellen dat deze aanpak fundamenteel gebrekkig is voor AI in de echte wereld. Zij geloven dat zodra een AI wordt ingezet (aan het werk wordt gezet in de echte wereld), deze nooit moet stoppen met leren. Zij noemen dit "Continual Reinforcement Learning" (voortdurend versterkend leren).
Hier is een uiteenzetting van hun argument met behulp van eenvoudige analogieën:
1. Het Probleem: De Wereld is een Bewegend Doelwit
In de echte wereld veranderen de dingen constant.
- De Chef-analogie: Stel je voor dat de smaakpapillen van je familie veranderen. Misschien raken ze uitgekeken op pasta en hunkeren ze plotseling naar sushi. Of misschien wordt een nieuw ingrediënt populair. Als je chef vastzit aan het oude menu, zal het eten uiteindelijk slecht smaken en zal je familie stoppen met eten.
- De AI-realiteit: Het artikel stelt dat de echte wereld te complex is ("De Grote Wereld") voor een AI om alles te leren voordat hij begint met werken. Zelfs als de AI slim is, kan hij toekomstige veranderingen niet voorspellen. Als je zijn "brein" bevriest na de training, zal hij langzaam verouderd raken en slecht presteren.
2. Waarom "Train-Then-Fix" Faalt
De auteurs identificeren vier specifieke redenen waarom de wereld verandert nadat een AI aan het werk is gegaan, waardoor het onmogelijk is om simpelweg "instellen en vergeten":
- De AI verandert de wereld (Action-Induced Non-Stationarity):
- Analogie: Stel je een muziek aanbevelingsapp voor. Als de app steeds dezelfde soort muziek blijft suggereren, kan de gebruiker verveeld raken en stoppen met luisteren naar dat genre. De keuzes van de app zelf hebben de smaak van de gebruiker veranderd.
- Realiteit: De acties van een AI veranderen vaak de omgeving waarin hij opereert.
- De Wereld verandert op zichzelf (Environment Dynamics):
- Analogie: Seizoenen veranderen, verkeerspatronen verschuiven, of hardware (zoals de gewrichten van een robot) slijt in de loop der tijd.
- Realiteit: Dingen buiten de controle van de AI veranderen, waardoor oude regels nutteloos worden.
- De Doelen veranderen (Evolving Goals):
- Analogie: Een bedrijf kan besluiten dat "snelheid" vandaag de belangrijkste metriek is, maar volgend jaar wordt "veiligheid" de prioriteit.
- Realiteit: Menselijke prioriteiten en regelgeving veranderen, wat betekent dat wat telt als een "goede prestatie" ook verandert.
- Verrassingsevenementen (Emergent Novelty):
- Analogie: Een "Black Swan"-evenement, zoals een plotselinge wereldwijde pandemie of een vreemd nieuw type code die nog nooit eerder is gezien.
- Realiteit: Een AI zal onvermijdelijk situaties tegenkomen waar hij niet op getraind is.
3. De Oplossing: De "Measurable Deployment"
Het artikel richt zich op een specifieke situatie genaamd "Measurable Deployment" (meetbare inzet).
- De Analogie: Dit is als een chef-kok die nog steeds wordt geobserveerd. Hoewel hij voor echte klanten kookt, geven de klanten nog steeds recensies (beoordelingen, fooien of klachten). De chef weet in realtime of het eten goed of slecht is.
- Het Argument: Als de AI feedback krijgt (een "beloningssignaal") die vertelt hoe goed hij het doet, is het een verspilling van potentieel om die feedback te negeren. In plaats van te wachten tot een mens zegt: "Hé, je prestaties zijn gedaald, laten we je opnieuw trainen," zou de AI die feedback moeten gebruiken om direct te leren en zich aan te passen.
4. Voorbeelden uit de Praktijk
Het artikel wijst naar twee bedrijven die dit al succesvol doen:
- Cursor Tab (Coding Assistant): Deze tool helpt programmeurs bij het schrijven van code. Het zit niet alleen maar stil; het leert van welke codesuggesties programmeurs daadwerkelijk accepteren. Het werkt zijn "brein" elke paar uur bij op basis van realtime feedback, in plaats van te wachten op maandenlange software-updates.
- Lyft (Ride-Sharing): Lyft gebruikt AI om chauffeurs bij passagiers te matchen. Omdat verkeer, vraag en de locaties van chauffeurs elke seconde veranderen, leert en actualiseert hun AI hun strategie in realtime. Als ze hun model offline zouden hertrainen, zouden ze miljoenen dollars aan potentiële ritten missen.
5. De Oproep tot Actie
De auteurs dringen er bij twee groepen op aan om van mentaliteit te veranderen:
- Voor Praktici (De Bouwers): Stop met het behandelen van deployment als het "einde" van het leerproces. Bouw systemen waarbij de AI kan leren van zijn fouten en successen terwijl hij aan het werk is. Behandel live data als trainingsdata.
- Voor Onderzoekers: Stop met het proberen te bouwen van AI die "convergeert" (stopt met leren zodra het het perfecte antwoord heeft gevonden). Bouw in plaats daarvan AI die ontworpen is om voor altijd te blijven zoeken en aanpassen, want in de echte wereld bestaat het "perfecte antwoord" niet.
Samenvatting
De kernboodschap van het artikel is simpel: Als je een AI in de echte wereld plaatst waar hij feedback krijgt, moet je hem laten blijven leren. Het bevriezen van zijn kennis is also bij een bestuurder zeggen dat hij zijn ogen gesloten moet houden nadat hij zijn rijexamen heeft gehaald. De weg verandert, de auto verandert en de bestemming verandert. De enige manier om veilig en efficiënt te blijven, is door te blijven rijden, te blijven kijken en te blijven leren.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.