← Nieuwste papers
🤖 machine learning

Q-based Variational Inverse Reinforcement Learning

Dit artikel introduceert Q-gebaseerde Variational Inverse Reinforcement Learning (QVIRL), een nieuwe Bayesiaanse methode die een posterieure verdeling over beloningen leert door een variationele verdeling over Q-waarden te optimaliseren, waardoor het schaalbare onzekerheidskwantificering en succesvolle training vanuit ruwe pixelobservaties in diverse omgevingen bereikt.

Oorspronkelijke auteurs: Ondrej Bajgar, Peter Tisnikar, Alessandro Abate, Konstantinos Gatsis, Maike Osborne

Gepubliceerd 2026-08-18
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Ondrej Bajgar, Peter Tisnikar, Alessandro Abate, Konstantinos Gatsis, Maike Osborne

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Om kunstmatige intelligentie te bouwen die werkelijk nuttig en veilig is, moeten systemen leren handelen op een manier die strookt met menselijke waarden. Toch is het vragen aan een persoon om een precieze lijst met regels voor elke mogelijke situatie op te schrijven vaak onmogelijk; menselijke voorkeuren zijn te complex en subtiel om in een eenvoudige handleiding te vangen. In plaats daarvan kijken onderzoekers naar het menselijk gedrag zelf als de bron van waarheid. Door te kijken hoe een expert een taak uitvoert, kan een AI proberen terug te werken om de verborgen doelen en beloningen af te leiden die de keuzes van die expert aanstuurden. Dit proces, bekend als inverse reinforcement learning, stelt machines in staat om niet alleen te leren wat ze moeten doen, maar ook waarom ze het moeten doen. Er blijft echter een grote uitdaging bestaan: wanneer een AI probeert deze verborgen doelen te raden, produceert het vaak één enkel, rigide antwoord. Dit is gevaarlijk omdat hetzelfde gedrag door veel verschillende sets doelen verklaard kan worden, en de AI zijn eigen onzekerheid moet begrijpen om veilige beslissingen te nemen in de echte wereld.

Een team van onderzoekers heeft een nieuwe methode geïntroduceerd genaamd Q-based Variational IRL, of QVIRL, die deze onzekerheid aanpakt door machines te leren in kansen te denken in plaats van in vaste antwoorden. In plaats van één beloningsfunctie te raden, leert deze aanpak een heel scala aan mogelijke beloningen die het gedrag van een expert zouden kunnen verklaren. De onderzoekers hebben aangetoond dat hun methode complexe, hoogdimensionale omgevingen kan aan, waar eerdere technieken faalden, inclusief taken die betrokken zijn bij ruwe visuele gegevens van videogames. Door zich te concentreren op de verwachte toekomstige waarde van acties in plaats van alleen de onmiddellijke beloning, kan het systeem efficiënt een distributie van mogelijkheden berekenen. Dit stelt de AI niet alleen in staat om een beleid te leren dat goed presteert, maar ook om te identificeren wanneer het onzeker is, een cruciale capaciteit voor veiligheidskritische toepassingen zoals autonoom rijden of actief leren, waarbij het systeem precies kan vragen om meer gegevens op de plekken waar het het meest verward is.

De kerninnovatie van QVIRL ligt in de manier waarop het de wiskunde van het leren afhandelt. Traditionele methoden hebben vaak moeite omdat ze herhaaldelijk een complex planningsprobleem moeten oplossen om te achterhalen wat een expert vervolgens zou doen, een proces dat computationeel onmogelijk wordt naarmate de omgeving groter wordt. QVIRL omzeilt deze bottleneck door direct te werken met de verwachte toekomstige waarde van acties, bekend als Q-waarden. Stel je voor dat je probeert een kaart te begrijpen door naar de bestemming te kijken waar je naartoe streeft, in plaats van elke individuele stap van de reis te volgen; deze verschuiving in perspectief stelt het algoritme in staat om op te schalen. De onderzoekers trainden hun systeem op een verscheidenheid aan taken, van eenvoudige rastergebaseerde doolhoven tot de complexe, continue fysica van het landen van een ruimtevaartuig en het navigeren op een snelweg. In deze tests slaagde het systeem erin een distributie van beloningen te herstellen die nauw aansloot bij de ware onderliggende doelen, zelfs wanneer de gegevens beperkt waren.

Wat deze aanpak bijzonder krachtig maakt, is het vermogen om onzekerheid te kwantificeren. In veel eerdere pogingen om machines te onderwijzen vanuit menselijke voorbeelden, produceerde het systeem één enkele "beste gok" voor de beloning, waarmee het effectief deed alsof het het antwoord met absolute zekerheid wist. QVIRL behoudt daarentegen een wolk van mogelijkheden. Wanneer de onderzoekers dit testten in een gesimuleerde omgeving waar de AI moest kiezen tussen een veilig pad en een risicovolle kortere route door een onbekend gebied, veranderde het gedrag van het systeem op basis van zijn vertrouwen. Als de AI onzeker was over de beloning in het risicovolle gebied, koos het voor het veilige pad, wat effectief voorzichtig handelen betekende. Als het vertrouwen had, nam het de kortere route. Dit vermogen om risicomijdend te zijn bij onzekerheid is een belangrijke stap voorwaarts, aangezien het voorkomt dat de AI gevaarlijke fouten maakt simpelweg omdat het een gebrek aan gegevens heeft.

De onderzoekers toonden ook aan dat deze methode werkt met ruwe visuele input, zoals de pixelafbeeldingen van klassieke videogames. Terwijl andere methoden die proberen onzekerheid te schatten vaak vastlopen wanneer ze worden geconfronteerd met dergelijke hoogdimensionale gegevens, bleef QVIRL robuust. Het leerde games zoals Pong en Space Invaders spelen met een prestatie die vergelijkbaar is met de beste bestaande technieken, terwijl het tegelijkertijd een maatstaf leverde voor hoe zeker het was over zijn beslissingen. Deze schaalbaarheid suggereert dat de methode uiteindelijk toegepast kan worden op scenario's in de echte wereld waar sensoren complexe stromen visuele gegevens leveren, zoals bij zelfrijdende auto's of robotische assistenten.

Uiteindelijk demonstreert het werk dat het mogelijk is om AI-systemen te bouwen die zowel schaalbaar als bewust van hun eigen beperkingen zijn. Door af te stappen van single-point estimates en een volledige distributie van mogelijke beloningen te omarmen, biedt QVIRL een pad naar meer betrouwbare en veilige kunstmatige intelligentie. Het systeem leert niet alleen menselijk gedrag te imiteren; het leert de onzekerheid achter dat gedrag te begrijpen, waardoor het veiligere keuzes kan maken wanneer de weg vooruit onduidelijk is. Deze balans tussen leren van experts en weten wanneer om hulp te vragen, vertegenwoordigt een betekenisvolle vooruitgang in de zoektocht naar nuttige AI.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →