← Nieuwste papers
🤖 machine learning

TEMPO: Scaling Test-time Training for Large Reasoning Models

Het paper introduceert TEMPO, een testtijd-trainingsframework dat de prestaties en diversiteit van grote redeneringsmodellen aanzienlijk verbetert door een periodieke herkalibratie van de criticus te integreren in een Expectation-Maximization-proces, waardoor de beperkingen van bestaande methoden worden overwonnen.

Oorspronkelijke auteurs: Qingyang Zhang, Xinke Kong, Haitao Wu, Qinghua Hu, Minghao Wu, Baosong Yang, Yu Cheng, Yun Luo, Ganqu Cui, Changqing Zhang

Gepubliceerd 2026-04-22
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Qingyang Zhang, Xinke Kong, Haitao Wu, Qinghua Hu, Minghao Wu, Baosong Yang, Yu Cheng, Yun Luo, Ganqu Cui, Changqing Zhang

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

TEMPO: De "Snelheidslimiet" voor Slimme AI's Opgeheven

Stel je voor dat je een zeer slimme student hebt die zich voorbereidt op een heel moeilijk wiskundetoets (zoals de Olympiade). Deze student heeft al veel geleerd, maar er is een probleem: zodra de examens beginnen, mag hij geen nieuwe boeken meer openen en mag hij geen nieuwe lessen volgen. Hij moet het doen met wat hij al weet.

Meestal is dat prima, maar wat als de vragen heel anders zijn dan die hij in zijn training heeft gezien? Dan blijft hij steken.

Dit is precies het probleem met de huidige "grote redeneermodellen" (LRMs) van kunstmatige intelligentie. Ze zijn slim, maar ze kunnen niet leren terwijl ze een vraag beantwoorden. Ze blijven statisch.

De onderzoekers van dit paper hebben TEMPO bedacht. Laten we uitleggen wat dat is, zonder ingewikkelde wiskunde, maar met een paar leuke vergelijkingen.

Het Probleem: De "Zelfbedrog" Valstrik

Stel je voor dat deze AI-student alleen maar met zichzelf oefent. Hij bedenkt een antwoord, kijkt naar zichzelf en zegt: "Ja, dit klinkt logisch, dit is goed!" en leert van die conclusie.

Het probleem is dat hij al snel in een echo-kamer belandt.

  1. Hij wordt zelfverzekerd over één manier van redeneren.
  2. Hij begint alleen maar die ene manier te gebruiken.
  3. Als hij een fout maakt, denkt hij: "Nee, dit is gewoon een rare uitzondering, mijn andere antwoorden waren beter."
  4. Uiteindelijk stopt hij met verbeteren. Hij blijft steken op een bepaald niveau en wordt zelfs minder creatief (de "diversiteit" verdwijnt).

Dit noemen de auteurs reward drift: de beloningssignalen die de AI zichzelf geeft, worden steeds onnauwkeuriger naarmate hij verandert.

De Oplossing: TEMPO (De Slimme Mentor)

TEMPO lost dit op door een mentor in te schakelen. Het werkt in een cyclus van twee stappen, net als een goed trainingsschema:

Stap 1: De Oefening (De M-stap)

De AI (de "Speler") krijgt een heleboel moeilijke, onbeantwoorde vragen. Hij probeert ze op te lossen. Hij bedenkt verschillende oplossingen.

  • Vergelijking: De student schrijft zijn antwoorden op een kladblaadje.

Stap 2: De Correctie (De E-stap)

Hier komt het slimme deel. In plaats van dat de AI zichzelf beoordeelt, kijkt een Critic (de Mentor) naar de antwoorden.

  • Maar wacht, deze Mentor is niet willekeurig. De Mentor is getraind op een setje vragen met juiste antwoorden (een "gouden boekje").
  • De Mentor kijkt naar de antwoorden van de student en zegt: "Hé, dit antwoord is goed, maar dit andere is eigenlijk een beetje raar, zelfs als het klinkt logisch."
  • De Mentor geeft een eerlijke score.

Het Geheim van TEMPO:
De meeste andere methoden doen alleen Stap 1 en vergeten Stap 2, of ze gebruiken een Mentor die nooit meer wordt bijgeschoold. Daardoor wordt de Mentor na verloop van tijd net zo "geblindeerd" als de student.

TEMPO doet iets anders: Periodiek (elke paar stappen) neemt de Mentor even een pauze om terug te gaan naar het "gouden boekje" (de gelabelde data) om zijn oordeel te kalibreren.

  • Vergelijking: De mentor gaat even naar school om te kijken of hij nog steeds weet wat een "goed" antwoord is, voordat hij weer naar de student gaat. Zo blijft zijn oordeel eerlijk en scherp.

Waarom werkt dit zo goed?

  1. Geen Stagnatie: Omdat de Mentor steeds weer wordt "gekalibreerd" met echte feiten, blijft de AI leren van echte fouten in plaats van van zijn eigen zelfbedrog. Hij kan blijven groeien, zelfs na honderden oefeningen.
  2. Behoud van Creativiteit: Andere methoden dwingen de AI om alleen de "meest populaire" antwoorden te kiezen (wat saai maakt). TEMPO laat de AI zien dat er verschillende goede manieren zijn om een probleem op te lossen. De AI blijft dus creatief en divers.

De Resultaten in het Korte

De onderzoekers hebben dit getest op echte, moeilijke wiskundetoetsen (zoals de AIME, vergelijkbaar met de Nederlandse wiskundeolympiade).

  • Een model dat eerst maar 33% van de vragen goed had, kwam met TEMPO uit op 51%.
  • Een ander model ging van 42% naar 66%.
  • En het mooiste: ze werden niet alleen slimmer, ze werden ook diverser. Ze kwamen niet vast te zitten in één manier van denken.

Samenvatting in één zin

TEMPO is als een slimme student die niet alleen met zichzelf oefent, maar elke paar uur even terugkijkt naar de echte antwoorden van de leraar om te controleren of hij nog steeds op het goede pad zit, zodat hij nooit in een zelfbedrog-valstrik belandt en eindeloos kan blijven groeien.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →