← Nieuwste papers
🤖 machine learning

Compute Aligned Training: Optimizing for Test Time Inference

Dit artikel introduceert "Compute Aligned Training", een nieuw raamwerk dat de trainingsdoelen van grote taalmodellen afstemt op inferentiestrategieën tijdens het testen door nieuwe verliesfuncties af te leiden, waardoor de schaalbaarheid van de prestaties aanzienlijk wordt verbeterd ten opzichte van standaard SFT- en RL-benaderingen.

Oorspronkelijke auteurs: Adam Ousherovitch, Ambuj Tewari

Gepubliceerd 2026-04-29
📖 6 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Adam Ousherovitch, Ambuj Tewari

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een student traint voor een zeer specifiek type eindexamen.

De Oude Manier (Standaardtraining):
Traditioneel, wanneer we AI-modellen leren (zoals die die essays schrijven of wiskundeproblemen oplossen), gedragen we ons als een strenge leraar die elk individueel huiswerkopdracht apart beoordeelt. Als de student een vraag goed heeft, zeggen we "Goed gedaan!" en als ze het fout hebben, zeggen we "Probeer het opnieuw." We willen dat de student perfect is in het elke keer meteen het eerste antwoord goed te krijgen.

Het probleem is, dit bereidt ze niet voor op het echte examen. In de echte wereld vragen we het model niet om slechts één antwoord. We vragen het om veel verschillende antwoorden te genereren (zoals een student vragen om 10 verschillende concepten van een essay te schrijven) en vervolgens kiezen we het beste eruit, of we stemmen voor het meest voorkomende.

Als je een student traint om perfect te zijn in het eerste concept, kunnen ze te zelfverzekerd worden en stoppen met het verkennen van nieuwe ideeën. Ze kunnen vast komen te zitten in een "veilige" manier van denken. Als je ze later vraagt om 10 concepten te genereren, schrijven ze misschien gewoon 10 lichtelijk verschillende versies van hetzelfde "veilige" antwoord, en geen van hen is misschien de briljante, creatieve oplossing die je nodig had.

De Nieuwe Manier (Berekening-gealigneerde Training - CAT):
De auteurs van dit paper stellen een nieuwe trainingsmethode voor genaamd Compute Aligned Training (CAT). In plaats van de student te beoordelen op een enkele huiswerkopdracht, beoordelen ze de student op basis van hoe goed ze zouden presteren in het daadwerkelijke examenformaat.

Hier is hoe het werkt, met behulp van een paar analogieën:

1. De "Pass@N" Analogie (Het Loterijticket)

Stel je voor dat het examen je toestaat om N loterijtickets te kopen (laten we zeggen 64 tickets) voor één vraag. Je wint als een van je 64 tickets het winnende nummer is.

  • Standaardtraining: Als de student al een kans van 50% heeft om te winnen met één ticket, blijft de leraar hen pushen om naar 90% of 99% te gaan. Maar in een loterij met 64 tickets, zodra je een kans van 50% hebt, garandeert het kopen van meer tickets sowieso een winst. De leraar verspillen energie om een "goede" student "perfect" te maken op een makkelijke vraag, terwijl ze de moeilijke vragen negeren waar de student slechts een kans van 1% heeft.
  • CAT-training: De leraar realiseert zich: "Hé, deze student zal waarschijnlijk al winnen met 64 tickets. Ik ga stoppen met het zo streng beoordelen van deze makkelijke vraag." In plaats daarvan richten ze al hun energie op de moeilijke vragen waar de student momenteel faalt. Ze leren de student om hun kansen te spreiden, ervoor te zorgen dat minstens één van de 64 tickets een winnaar is, in plaats van te proberen één specifiek ticket perfect te maken.

2. De "Meerderheidsstem" Analogie (De Verkiezing)

Stel je voor dat het examen het model vraagt om 10 antwoorden te genereren, en de klas stemt voor het populairste.

  • Standaardtraining: De leraar probeert het eerste antwoord van de student tot het absoluut populairste te maken, zelfs als het al met een stekkerwinst wint. Dit is als een kandidaat die al 90% van de stemmen heeft; de leraar blijft hen vertellen om harder te campagnen, wat tijdverspilling is.
  • CAT-training: De leraar kijkt naar het "kantelpunt". Als het antwoord van de student momenteel met een kleine marge verliest, geeft de leraar hen een enorme boost om hen te helpen de finishlijn te kruisen. Als de student al comfortabel wint, stopt de leraar met het geven van extra punten. Dit dwingt het model om zich te richten op de "slagveldvragen" waar een beetje extra inspanning de stem kan omdraaien.

3. De "Best-of-N" Analogie (Het Talentenjacht)

Stel je voor dat het model 10 nummers genereert, en je houdt alleen het allerbeste nummer.

  • Standaardtraining: De leraar probeert het gemiddelde nummer goed te laten klinken. Dit leidt tot veilige, saaie, "middelmatige" muziek die nooit slecht is, maar ook nooit verbazingwekkend.
  • CAT-training: De leraar zegt tegen het model: "Het is oké als 9 van je nummers verschrikkelijk zijn, zolang het 10e maar een meesterwerk is." Dit moedigt het model aan om risico's te nemen en rare, hoog-variantie ideeën te proberen. Het leert een breed scala aan outputs te produceren, wetende dat het "zoekproces" (het kiezen van het beste) de mislukkingen zal filteren en de winnaar zal behouden.

Wat hebben ze eigenlijk gedaan?

De onderzoekers hebben dit idee op drie specifieke manieren getest:

  1. Wiskundeproblemen: Ze trainden AI-modellen om wiskundeproblemen op te lossen. Toen ze CAT gebruikten om de modellen voor te bereiden op "Pass@N" (veel antwoorden genereren en het juiste kiezen), werden de modellen aanzienlijk beter in het oplossen van moeilijke problemen vergeleken met de standaardmethode.
  2. Stemmen: Ze trainden modellen om antwoorden te genereren voor een "Meerderheidsstem". Ook hier presteerden CAT-modellen beter wanneer de stemstrategie werd toegepast.
  3. Proteïneontwerp: Ze testten dit zelfs op een compleet ander type AI dat proteïnen ontwerpt (de bouwstenen van het leven). In een scenario waarin de AI een zeldzame, hoogwaardige proteïne-structuur moest vinden tussen veel slechte, waren de CAT-getrainde modellen veel beter in het vinden van het "jackpot"-proteïne dan de standaardmodellen.

De Conclusie

Het paper stelt dat hoe je een model traint, moet overeenkomen met hoe je het gebruikt.

Als je van plan bent het model te gebruiken om veel opties te genereren en het beste te kiezen, moet je het niet trainen om perfect te zijn bij de eerste poging. Je moet het trainen om goed te zijn in het creëren van een pool van opties waar de beste waarschijnlijk te vinden is.

Ze noemen dit "Compute Aligned Training" omdat het het trainingsproces afstemt op de "berekening" (de extra denkkracht) die tijdens het testen wordt gebruikt. Het is een manier om betere resultaten te krijgen zonder krachtigere computers of meer trainingstijd nodig te hebben; je verandert gewoon de regels van het spel om overeen te komen met de realiteit van hoe het model zal worden gebruikt.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →