← Nieuwste papers
🤖 machine learning

The Terminal Representation in Reinforcement Learning

Dit artikel introduceert de Terminal Representation (TR), een nieuw, lager-dimensionaal alternatief voor de Successor en Default Representations in reinforcement learning dat beloningsgewogen trajecten vastlegt zonder dat eigendecompositie of symmetrische transitie-aannames vereist zijn, waardoor het een computationeel efficiënte basis biedt voor taken zoals option discovery en transfer learning.

Oorspronkelijke auteurs: Amir Esterhuysen, Anders Jonsson

Gepubliceerd 2026-06-01
📖 2 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Amir Esterhuysen, Anders Jonsson

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een robot leert navigeren door een doolhof. Het doel van de robot is om zo snel mogelijk van het begin naar de uitgang te komen, maar het doolhof is enorm en de robot kent de lay-out nog niet. Om efficiënt te leren, heeft de robot een "mentale kaart" nodig die niet alleen helpt begrijpen waar hij is, maar ook waar hij heen kan gaan en hoe goed die plekken zijn.

Dit artikel introduceert een nieuwe, slimmere manier voor robots om deze mentale kaarten te bouwen. De auteurs noemen het de Terminal Representation (TR).

Hier is de uitleg van hoe het werkt, met behulp van eenvoudige analogieën:

1. De Oude Manieren: De "Toekomstkaart" en de "Beloningskaart"

Voordat deze nieuwe methode bestond, gebruikten onderzoekers twee hoofdtools:

  • De Successor Representation (SR): Denk aan een kaart die alleen geeft om verkeer. Het vertelt de robot: "Als je hier staat, is de kans groot dat je later deze andere plekken zult bezoeken." Het negeert of die plekken goed of slecht zijn; het houdt alleen verkeerspatronen bij.
  • De Default Representation (DR): Dit is een geavanceerdere kaart. Deze combineert verkeer met beloningen. Het vertelt de robot: "Als je hier staat, zul je deze plekken waarschijnlijk bezoeken, en dit is hoeveel 'goedheid' (beloning) je daar zult krijgen."

Het Probleem met de Oude Manieren:
Om de DR effectief te gebruiken voor complexe taken (zoals het vinden van afkortingen of het aanpassen aan nieuwe doelen), moest de robot een enorme, trage wiskundige berekening uitvoaan genaamd eigendecompositie.

  • De Analogie: Stel je voor dat je een bibliotheek vol boeken hebt (de kaart), maar om het belangrijkste verhaal te vinden, moet je elk boek lezen, elke pagina kruisverwijzen en een samenvatting schrijven voordat je de informatie kunt gebruiken. Het is accuraat, maar het kost veel tijd en vereist veel hersencapaciteit. Bovendien werkt deze methode alleen goed als het verkeer in beide richtingen gelijkmatig stroomt (zoals een tweerichtingsweg), wat in veel echte doolhoven niet het geval is.

2. De Nieuwe Manier: De Terminal Representation (TR)

De auteurs stellen de Terminal Representation (TR) voor. Dit is als een "Bestemmingsgids."

In plaats van elke individuele stap die de robot kan zetten in kaart te brengen, richt de TR zich specif{%}

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →