← Nieuwste papers
🤖 machine learning

Goal-Conditioned Agents that Learn Everything All at Once

Dit artikel introduceert Learning Everything all at Once (LEO), een methode die efficiënte, parallelle all-goals off-policy updates mogelijk maakt in op doelen gerichte versterkende leer door gezamenlijk waarden en acties voor elk doel te genereren, waardoor aanzienlijke prestatiewinst en enorme snelheidswinsten worden bereikt ten opzichte van traditionele herlabeltechnieken.

Oorspronkelijke auteurs: Michael Matthews, Matthew Jackson, Michael Beukman, Thomas Foster, Alistair Letcher, Scott Fujimoto, Cédric Colas, Jakob Foerster

Gepubliceerd 2026-05-25
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Michael Matthews, Matthew Jackson, Michael Beukman, Thomas Foster, Alistair Letcher, Scott Fujimoto, Cédric Colas, Jakob Foerster

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een robot leert navigeren door een gigantisch, voortdurend veranderend doolhof. Op de oude manier om dit te doen (genaamd Doel-geconditioneerde Versterkende Leer) geef je de robot een specifieke instructie, zoals "Ga naar de keuken". De robot zou dan ronddwalen, tegen muren aanlopen en uiteindelijk misschien de keuken vinden.

Wanneer de robot klaar is, bekijkt de leraar het pad dat het heeft afgelegd. Als de robot werd verteld naar de keuken te gaan, maar per ongeluk langs de bibliotheek liep op weg, zou de oude methode zeggen: "Dat bibliotheekgedeelte was een fout; gooi het weg. We geven alleen om de keuken."

Het Probleem: Dit is een verspilling van informatie! De robot leerde veel over de bibliotheek terwijl het probeerde de keuken te vinden. Door die data weg te gooien, moet de robot later opnieuw leren over de bibliotheek als je het ooit vraagt om daar naartoe te gaan.

De Oude "Oplossing" (Hindsight Experience Replay):
Voorheen probeerden onderzoekers dit op te lossen door het pad van de robot te bekijken en te zeggen: "Oh, het belandde bij de bibliotheek! Laten we doen alsof we wildten dat het naar de bibliotheek ging, de hele tijd." Dit helpt een beetje, maar het is alsof je probeert een hele film opnieuw te labelen nadat je hem hebt bekeken. Het is traag, en je kunt het maar voor een paar verschillende eindes tegelijk doen.

De Nieuwe Oplossing: "Alles Tegelijk Leren" (LEO)
De auteurs van dit artikel stellen een slimmere manier voor. In plaats van de robot één doel tegelijk te leren, bouwen ze een "super-brein" dat elk mogelijk doel gelijktijdig leert.

Denk eraan als een kok die een enorm banket bereidt.

  • De Oude Manier: De kok bereidt één gerecht (de keuken), proeft het, gooit de notities weg over hoe ze de uien sneden, en begint dan opnieuw om het volgende gerecht (de bibliotheek) te bereiden.
  • De LEO-Manier: De kok bereidt het hele banket in één keer. Ze hebben een gigantisch bord met 512 verschillende recepten (doelen) erop geschreven. Terwijl ze een ui snijden, updaten ze direct hun kennis voor alle 512 recepten tegelijk. Ze beseffen: "Hé, uien snijden is nuttig voor de soep, de stoofpot en de salade!"

Hoe het technisch werkt (maar simpel):
Normaal gesproken vraagt een computernetwerk: "Wat is de beste zet voor dit specifieke doel?"
LEO verandert het netwerk zodat het vraagt: "Wat is de beste zet voor elk enkel doel op dit moment?" Het geeft een gigantische lijst met antwoorden voor elke mogelijke bestemming in één enkele doorgang. Dit maakt leren ongelooflijk snel (meer dan 250 keer sneller dan de oude "opnieuw labelen"-methode) omdat de robot niet dezelfde reis honderden keren hoeft te herhalen.

De Haken: Het "Late Fusion"-Probleem
De auteurs vonden een klein gebrek. Omdat de robot over alle doelen tegelijk moet nadenken, raakt het soms in de war. Het is als een student die probeert te studeren voor 500 verschillende examens op precies hetzelfde moment. Ze krijgen misschien een algemeen gevoel van het materiaal, maar ze zijn misschien niet zo scherp in het beantwoorden van een specifieke vraag als een student die alleen voor dat ene examen heeft gestudeerd.

In het artikel betekende dit dat LEO geweldig was in het oplossen van moeilijke, complexe doelen, maar soms slechter in eenvoudige doelen omdat het zijn focus "verwaterde".

De Ultieme Oplossing: "Dual LEO" (Het Leraar-Student Systeem)
Om dit op te lossen, creëerden de auteurs een team-up:

  1. De Leraar (LEO): Dit netwerk is de "datasspons". Het leert alles over alles, zelfs als het een beetje rommelig is. Het biedt een ruwe kaart van de wereld.
  2. De Student (Standaard Netwerk): Dit netwerk is de specialist. Het richt zich alleen op het specifieke doel dat je momenteel vraagt om te doen.

De Leraar zegt tegen de Student: "Hé, ik ken de algemene richting naar de bibliotheek, zelfs als ik niet perfect ben. Hier is een hint." De Student neemt die hint en verfijnt deze om een expert te worden in het bereiken van de bibliotheek.

De Resultaten
Het team testte dit op een complex videospel genaamd Craftax (een beetje zoals Minecraft) en enkele robotbewegingstaken.

  • Op de grote, moeilijke versie van het spel met 512 verschillende doelen, was de nieuwe Dual LEO-methode de duidelijke winnaar, die alle andere methoden versloeg.
  • Het leerde veel sneller en kon een enorme verscheidenheid aan taken aan die andere methoden opgaven.
  • Ze toonden ook aan dat dit werkt voor continue bewegingen (zoals een robotarm die soepel beweegt), niet alleen voor videospelstappen.

Samenvatting
Dit artikel introduceert een methode waarbij een AI leert om elk mogelijk probleem tegelijk op te lossen, in plaats van één voor één. Wanneer het te breed wordt en zijn focus verliest, koppelen ze het aan een gespecialiseerd "student"-netwerk dat de brede kennis gebruikt als leidraad. Dit stelt robots en spelende AI's in staat om enorme hoeveelheden informatie veel sneller en efficiënter te leren dan voorheen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →