← Nieuwste papers
🤖 machine learning

Scaling the Memory of Balanced Adam

Dit artikel stelt dat de momentumparameter β\beta in gebalanceerde Adam moet worden behandeld als een variabele voor de geheugenschaal in plaats van een vaste constante, en introduceert een verversingsregel (Rβ1000R_\beta \approx 1000) die de trainingsrobuustheid aanzienlijk verbetert over 11 visuele en taalexperimenten door de statistische geheugenhoriizon van de optimizer af te stemmen op de effectieve leerhorizon.

Oorspronkelijke auteurs: Alberto Fernández-Hernández, Cristian Pérez-Corral, Jose I. Mestre, Manuel F. Dolz, Enrique S. Quintana-Ortí

Gepubliceerd 2026-05-12
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Alberto Fernández-Hernández, Cristian Pérez-Corral, Jose I. Mestre, Manuel F. Dolz, Enrique S. Quintana-Ortí

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Het Grote Plaatje: Het Afstellen van het Geheugen van een Lerende Robot

Stel je voor dat je een robot leert katten te herkennen, gedichten te schrijven of wiskundeproblemen op te lossen. Hiervoor gebruikt de robot een hulpmiddel genaamd Adam (een "optimizer"). Denk aan Adam als de interne coach van de robot. Elke keer als de robot een fout maakt, kijkt de coach naar de geschiedenis van eerdere fouten om te beslissen hoe hij de hersenen van de robot voor de volgende poging moet aanpassen.

Lange tijd had deze coach twee verschillende "geheugenvoeringen" (genaamd β1\beta_1 en β2\beta_2). De ene instelling onthield de richting van de fouten, en de andere onthield de grootte van de fouten.

De Ontdekking:
Recent onderzoek (waaronder dit paper) heeft geconstateerd dat je eigenlijk geen twee verschillende instellingen nodig hebt. Als je ze exact hetzelfde instelt (β1=β2\beta_1 = \beta_2), leert de robot even goed, maar wordt het systeem veel eenvoudiger. Nu heeft de coach slechts één geheugendraai om te draaien.

Het Probleem:
De grote vraag is: Welk getal moeten we aan die draai geven?
De meeste mensen kiezen gewoon een standaardgetal (zoals 0,9) en houden daar vast aan, ongeacht de situatie. De auteurs van dit paper betogen dat dit hetzelfde is als dezelfde schoenen te dragen voor een wandeling van 5 mijl en een marathon van 100 mijl. Het heeft geen zin, omdat de "afstand" van de training verandert.

Het Kernidee: Het "Verversingsaantal"

De auteurs stellen een nieuwe manier voor om naar die geheugendraai te kijken. In plaats van te denken aan een vast getal, zeggen ze dat het gezien moet worden als een geheugenhorizon.

  • De Analogie: Stel je voor dat de robot een boek leest om een taal te leren.
    • Als de robot een kort geheugen heeft, onthoudt hij alleen de laatste paar zinnen.
    • Als de robot een lang geheugen heeft, onthoudt hij het hele hoofdstuk.

Het paper introduceert een concept genaamd het Verversingsaantal (RβR_\beta). Dit beantwoordt de vraag: "Hoe vaak ververs de robot zijn geheugen van het verleden volledig tijdens de hele trainingssessie?"

De auteurs ontdekten dat de robot het beste leert wanneer dit "verversingsaantal" ongeveer gelijk blijft, ongeacht hoe lang de trainingssessie duurt.

  • Korte Trainingssessie: De robot heeft een kort geheugen nodig (een lager getal) zodat hij zijn geheugen ongeveer 1.000 keer kan verversen.
  • Lange Trainingssessie: De robot heeft een lang geheugen nodig (een hoger getal) zodat hij zijn geheugen toch ongeveer 1.000 keer verversen.

De Oplossing: Een Eenvoudige Regel

Het paper testte dit idee op 11 verschillende taken, variërend van het leren van een robot om afbeeldingen te herkennen (zoals katten en auto's) tot het leren om tekst te schrijven (zoals LLM's).

Ze ontdekten een eenvoudige "Gouden Regel":
Stel de geheugendraai zo in dat de robot zijn geheugen precies 1.000 keer verversen tijdens het nuttige deel van de training.

  • Als de training kort is (bijvoorbeeld 6.000 stappen), kiest de regel een lager getal (zoals 0,82).
  • Als de training lang is (bijvoorbeeld 40.000 stappen), kiest de regel een hoger getal (zoals 0,97).

Waarom Is Dit Belangrijk? (De Resultaten)

De auteurs vergeleken hun "Verversingsregel" met de standaard "Vaste Regel" (waarbij iedereen gewoon 0,944 gebruikt).

  1. Gemiddelde Prestatie: Beide methoden zaten zeer dicht bij elkaar wat betreft gemiddeld succes. Het standaard vaste getal is eigenlijk best goed.
  2. Het "Veiligheidsnet" (Robuustheid): Hier blinkt de nieuwe regel uit.
    • Stel je voor dat je een auto rijdt. De "Vaste Regel" is als rijden met een snelheid die op de meeste wegen goed werkt, maar soms kun je in een kuil terechtkomen en crasht.
    • De "Verversingsregel" is als een slimme ophanging. Het past zich aan aan de lengte van de weg.
    • Het Resultaat: De nieuwe regel verminderde de "worst-case" storingen met 33%. Met andere woorden, het maakte de training veel betrouwbaarder. Het zorgde ervoor dat elk enkel experiment (alle 11 ervan) bijna perfect presteerde, terwijl de oude methode een paar experimenten had die aanzienlijk worstelden.

De Conclusie

Het paper betoogt dat we de geheugeninstelling in AI-training niet moeten behandelen als een statische, onveranderlijke constante. In plaats daarvan moeten we het behandelen als een schaal.

Net zoals je niet dezelfde kaartschaal zou gebruiken voor een stad en voor een heel land, zou je niet dezelfde geheugeninstelling moeten gebruiken voor een korte training en een lange. Door het geheugen aan te passen op basis van hoe lang de training duurt (het "verversingsaantal" op 1.000 houdend), maken we het AI-trainingproces robuuster en minder waarschijnlijk dat het op onverwachte manieren faalt.

Kortom: Kies niet zomaar een getal en hoop op het beste. Pas het geheugen van de robot aan op basis van hoe lang de reis is, en je krijgt een veel soepelere rit.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →