← Nieuwste papers
🤖 machine learning

Subspace Inference Enables Efficient Active Reward Learning from Preferences

Dit artikel introduceert PreferenceEKF, een steekproefefficiënte active learning-methode die extended Kalman filtering binnen een laagdimensionale parameteronderruimte benut om schaalbare onzekerheidskwantificatie voor neurale netwerkbeloningsmodellen mogelijk te maken, waardoor de efficiëntie en prestaties van reinforcement learning from human feedback worden verbeterd.

Oorspronkelijke auteurs: Yutai Zhou, Erdem Bıyık

Gepubliceerd 2026-09-04
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Yutai Zhou, Erdem Bıyık

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

In de wereld van kunstmatige intelligentie bestaat een hardnekkige uitdaging die bekend staat als de "sample-inefficiëntie" van leren van menselijke feedback. Stel je voor dat je een complex computerprogramma leert om zich te gedragen op een manier die in lijn is met menselijke waarden. De krachtigste methode die momenteel beschikbaar is, houdt in dat mensen twee verschillende uitkomsten laten vergelijken — zoals twee robotbewegingen of twee geschreven reacties — en aangeven welke zij de voorkeur geven. Hoewel deze feedback gemakkelijk door mensen te geven is, is het ongelooflijk schaars; een enkele voorkeur biedt slechts een minuscuul beetje informatie. Om een betrouwbaar model te bouwen van wat mensen willen, moet een algoritme duizenden van deze vragen stellen. Als de computer de verkeerde vragen stelt, verspilt hij tijd en geld. Als hij de juiste vragen stelt, leert hij veel sneller. De moeilijkheid ligt in het weten welke vragen het meest informatief zullen zijn. Om dit te doen, moet de computer begrijpen wat hij nog niet weet, een concept dat onzekerheid wordt genoemd. Het berekenen van deze onzekerheid voor enorme, moderne neurale netwerken is echter berucht moeilijk en rekentechnisch duur, omdat het vaak vereist dat er tientallen afzonderlijke modellen worden getraind om slechts een ruwe schatting te krijgen.

Een team onderzoekers aan de University of Southern California heeft een nieuwe aanpak ontwikkeld om deze flessenhals op te lossen, waardoor computers met veel meer snelheid en efficiëntie kunnen leren van menselijke voorkeuren. Ze introduceerden een methode genaamd PreferenceEKF, die het proces van het leren van voorkeuren behandelt als een continu, stapsgewijs filterprobleem in plaats van een enorme, eenmalige berekening. In plaats van te proberen elke mogelijke variatie van een gigantisch neuraal netwerk in één keer in kaart te brengen, realiseerden de onderzoekers zich dat het gedrag van het netwerk nauwkeurig gevolgd kon worden binnen een veel kleinere, lager-dimensionale ruimte. Door hun berekeningen te richten op deze compacte subruimte, konden ze een klassiek wiskundig hulpmiddel, het uitgebreide Kalman-filter (extended Kalman filter), gebruiken om het begrip van het model in realtime bij te werken naarmate er nieuwe antwoorden binnenkomen. Deze techniek stelde hen in staat om duizenden verschillende versies van het beloningsmodel direct te genereren, zonder de zware rekenkosten van het trainen van meerdere onafhankelijke netwerken.

De onderzoekers testten hun methode tegenover verschillende bestaande technieken met behulp van een verscheidenheid aan standaard benchmarks voor robotbesturing en besluitvorming. Ze ontdekten dat hun aanpak niet alleen aanzienlijk sneller was — tot wel veertig keer sneller dan sommige van de meest geavanceerde alternatieven — maar ook nauwkeuriger in zijn voorspellingen. In experimenten waarbij het doel was om een beloningsmodel te leren van een beperkt aantal menselijke vergelijkingen, leerde de nieuwe methode consequent de juiste voorkeuren met minder vragen dan de andere methoden. Bovendien waren de geproduceerde modellen beter gekalibreerd, wat betekent dat het vertrouwen van de computer in zijn antwoorden nauwer overeenkwam met de werkelijke nauwkeurigheid van die antwoorden. Deze precisie is essentieel voor actief leren, waarbij het systeem moet beslissen welke vraag het als volgende stelt; als het systeem onzeker is, stelt het een vraag om die onzekerheid op te lossen, en als het zelfverzekerd is, gaat het verder. De nieuwe methode blonk uit in dit evenwicht, wat leidde tot beloningsmodellen die in staat waren om robotbeleid te trainen om complexe taken uit te voeren, waarbij de prestaties overeenkwamen met die van beleid dat getraind is met veel duurdere en tijdrovendere methoden.

Een van de meest opvallende aspecten van dit werk is hoe het de workflow van het trainen van deze systemen verandert. Traditionele methoden vereisen vaak dat de computer zijn volledige begrip van de wereld opnieuw traint of evalueert telkens wanneer hij nieuwe feedback ontvangt, een proces dat trager wordt naarmate het systeem groter wordt. De nieuwe methode daarentegen werkt zijn kennis sequentieel bij, waarbij alleen de nieuwste informatie wordt opgenomen terwijl een lopende schatting wordt behouden van wat er tot nu toe is geleerd. Dit stelt het systeem in staat om efficiënt te schalen, waarbij grotere neurale netwerken worden afgehandeld en meer monsters van mogelijke beloningsmodellen worden gegenereerd zonder dat het geheugen of de tijd opraakt. De onderzoekers hebben ook aangetoond dat deze aanpak werkt, zelfs wanneer men begint met geen enkele initiële data, door gebruik te maken van een random projectietechniek om de noodzakelijke subruimte vanaf nul op te bouwen, en het toonde veelbelovendheid wanneer het werd toegepast op beeldgebaseerde taken waarbij de invoerdata veel complexer is dan eenvoudige getallen.

Hoewel de methode veelbelovend is, zijn de onderzoekers voorzichtig in het benoemen van de grenzen ervan. Het wiskundige kader dat zij gebruikten, gaat ervan uit dat de voorkeuren die worden geleerd afkomstig zijn van een enkele, consistente bron. Wanneer zij het systeem testten met gegevens van meerdere verschillende menselijke annotatoren die mogelijk conflicterende meningen hadden, had de methode moeite om de volledige complexiteit van die verschillende meningen te vatten. Dit suggereert dat hoewel de aanpak een krachtig hulpmiddel is om het leerproces te stroomlijnen, het het beste geschikt is voor scenario's waarin een enkele, samenhangende set voorkeuren wordt gemodelleerd. Desalniettemin wijzen de resultaten op een belangrijke stap voorwaarts in het toegankelijker maken van kunstmatige intelligentie voor menselijke intentie. Door het proces van leren van feedback sneller en efficiënter te maken, verwijdert dit werk een grote barrière voor de inzet van intelligente systemen in de echte wereld, van gepersonaliseerde aanbevelingen tot autonome robots, waar de kosten van menselijke tijd hoog zijn en de behoefte aan snel en nauwkeurig leren cruciaal is.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →