← Nieuwste papers
💬 NLP

REAR: Test-time Preference Realignment through Reward Decomposition

Dit artikel introduceert REAR, een trainingsvrij test-time framework dat grote taalmodellen afstemt op diverse gebruikersvoorkeuren door beloningsfuncties te decomponeren om beloningscomponenten selectief te herschalen, waardoor efficiënte test-time scaling wordt uitgebreid van verifieerbare domeinen naar complexe voorkeursafstemmingstaken.

Oorspronkelijke auteurs: Fuxiang Zhang, Pengcheng Wang, Chenran Li, Yi-Chen Li, Yuxin Chen, Lang Feng, Chenfeng Xu, Masayoshi Tomizuka, Bo An

Gepubliceerd 2026-06-30
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Fuxiang Zhang, Pengcheng Wang, Chenran Li, Yi-Chen Li, Yuxin Chen, Lang Feng, Chenfeng Xu, Masayoshi Tomizuka, Bo An

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een zeer slimme, goed getrainde robotassistent hebt (een Large Language Model). Deze robot heeft geleerd om behulpzaam, beleefd en accuraat te zijn op basis van de enorme hoeveelheid data waarop hij is getraind. Echter, soms heb je een heel specifieke, persoonlijke vraag. Misschien wil je dat de robot wiskunde uitlegt op een manier die "leuk is, maar niet als een videogame", of wil je dat hij optreedt als een "grijze, chagrijnige detective".

Het probleem is dat de standaardinstelling van de robot niet perfect kan aansluiten bij jouw specifieke stemming of voorkeur. Normaal gesproken moet je de robot terugsturen naar de "school" (het hertrainen) met nieuwe data om dit op te lossen, wat duur, traag en intensief is qua middelen.

Dit artikel introduceert een slimme truc genaamd REAR (Realignment through Reward Decomposition) waarmee je het gedrag van de robot kunt aanpassen terwijl hij met je praat, zonder hem terug naar school te sturen.

Zo werkt het, onderverdeeld in eenvoudige analogieën:

1. Het Probleem: De "Standaard" van de Robot vs. Jouw "Wens"

Beschouw de hersenen van de robot als twee verschillende stemmen die tegelijkertijd spreken:

  • Stem A (De Vraag): "Hoe beantwoord ik deze wiskundevraag correct?"
  • Stem B (De Voorkeur): "Hoe beantwoord ik dit terwijl ik chagrijnig ben en metaforen over videogames vermijd?"

Wanneer de robot wordt getraind, leert hij een mix van deze twee stemmen. Maar wanneer je een specifieke vraag stelt, kan die mix fout zijn. Misschien is hij te gefocust op "correct zijn" en negeert hij je verzoek om "chagrijnig" te zijn.

2. De Oplossing: De "Volumehendel" (Reward Decomposition)

De auteurs realiseerden zich dat ze deze twee stemmen wiskundig van elkaar konden scheiden. Ze behandelen de interne "beloning" (het gevoel goed werk te leveren) van de robot als twee aparte ingrediënten:

  1. Het Vraag-ingrediënt: Hoe goed beantwoordt het de prompt?
  2. Het Voorkeurs-ingrediënt: Hoe goed volgt het jouw specifieke stijl?

REAR is als een volumehendel die je kunt draaien tijdens het gesprek.

  • Als je de hendel omhoog draait, luistert de robot meer naar je "Voorkeurs"-stem.
  • Als je hem omlaag draait, luistert de robot meer naar de "Vraag"-stem.

De magie is dat ze hebben uitgevogeld hoe je deze volumehendel kunt berekenen met alleen de interne gedachten van de robot (zijn waarschijnlijkheidsscores). Je hebt geen nieuwe leraar of een nieuwe dataset nodig; je gebruikt simpelweg de bestaande hersenen van de robot om zichzelf opnieuw in balans te brengen.

3. De Strategie: "Probeer, Probeer, Probeer het Nogmaals" (Test-Time Scaling)

Omdat de robot niet direct weet welk antwoord perfect is, gebruikt REAR een strategie genaamd Test-Time Scaling. Denk hierover als volgt:

  • De "Best of N"-benadering: Stel dat je de robot vraagt om een verhaal te schrijven. In plaats van het eerste concept te accepteren, vraag je hem om 16 verschillende versies te schrijven in de tijd die hij normaal gesproken voor één versie nodig heeft.
  • Het Scoreformulier: Voor elk van die 16 versies fungeert REAR als een rechter. Het gebruikt die "volumehendel"-wiskunde om ze te beoordelen. Het vraagt: "Welke van deze 16 verhalen beantwoordt de vraag het beste EN volgt de stijl van de chagrijnige detective?"
  • De Winnaar: De robot kiest de versie met de hoogste score en geeft die aan jou.

Ze gebruiken ook een geavanceerdere versie genaamd Tree Search (zoals een detective die verschillende paden verkent in een doolhof). In plaats van alleen 16 volledige verhalen te schrijven, verkent de robot verschillende zinskeuzes stap voor stap, waarbij hij constant de score controleert om er zeker van te zijn dat hij op het juiste pad blijft.

4. Waarom dit een Groot Ding is

  • Geen Training Nodig: Je hoeft de robot niet te hertrainen. Het is alsoak een radiostation afstemt terwijl je luistert, in plaats van een nieuwe radio te kopen.
  • Werkt voor Alles: Ze hebben aangetoond dat het niet alleen werkt voor "chagrijnige detectives", maar ook voor complexe wiskundige problemen en zelfs visuele taken (zoals een foto nauwkeurig beschrijven zonder dingen te verzinnen).
  • Efficiënt: Omdat het de eigen interne wiskunde van de robot gebruikt, hoeft het geen apart, zwaar "rechter"-programma te laden om de antwoorden te controleren. Het is sneller en goedkoper dan eerdere methoden.

Samenvatting

REAR is een hulpmiddel waarmee je de persoonlijkheid of focus van een slimme AI direct kunt aanpassen terwijl deze werkt. Dit doet het door "het beantwoorden van de vraag" wiskundig te scheiden van "het volgen van jouw stijl", en vervolgens een "probeer veel opties en kies de beste" strategie te gebruiken om de perfecte reactie te vinden. Het is als een afstandsbediening voor de persoonlijkheid van de AI die direct werkt, zonder dat je de AI vanaf nul opnieuw hoeft op te bouwen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →