← Neueste Arbeiten
🤖 machine learning

Compute Aligned Training: Optimizing for Test Time Inference

Dieser Beitrag stellt „Compute Aligned Training" vor, ein neuartiges Framework, das die Trainingsziele von Large Language Models mit Inferenzstrategien zur Laufzeit durch die Herleitung neuer Verlustfunktionen in Einklang bringt und dadurch die Leistungsskalierung im Vergleich zu herkömmlichen SFT- und RL-Ansätzen erheblich verbessert.

Ursprüngliche Autoren: Adam Ousherovitch, Ambuj Tewari

Veröffentlicht 2026-04-29
📖 5 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Adam Ousherovitch, Ambuj Tewari

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich vor, Sie bereiten einen Schüler auf eine sehr spezifische Art von Abschlussprüfung vor.

Der alte Weg (Standard-Training):
Traditionell verhalten wir uns beim Unterrichten von KI-Modellen (wie denen, die Aufsätze schreiben oder Matheprobleme lösen) wie ein strenger Lehrer, der jede einzelne Hausaufgabe einzeln benotet. Wenn der Schüler eine Frage richtig beantwortet, sagen wir „Gut gemacht!", und wenn er sie falsch beantwortet, sagen wir „Versuch es noch einmal." Wir wollen, dass der Schüler perfekt darin ist, jedes Mal sofort die erste Antwort richtig zu haben.

Das Problem ist, dass dies sie nicht auf die eigentliche Prüfung vorbereitet. In der realen Welt fragen wir das Modell nicht nur nach einer einzigen Antwort. Wir bitten es, viele verschiedene Antworten zu generieren (wie wenn man einen Schüler auffordert, 10 verschiedene Entwürfe eines Aufsatzes zu schreiben), und wählen dann die beste aus oder stimmen für die häufigste.

Wenn Sie einen Schüler darauf trainieren, beim ersten Entwurf perfekt zu sein, könnte er zu selbstbewusst werden und aufhören, neue Ideen zu erkunden. Er könnte in einer „sicheren" Denkweise stecken bleiben. Wenn Sie ihn später bitten, 10 Entwürfe zu generieren, könnte er einfach 10 leicht abgewandelte Versionen derselben „sicheren" Antwort schreiben, und keine davon könnte die brillante, kreative Lösung sein, die Sie benötigten.

Der neue Weg (Compute Aligned Training – CAT):
Die Autoren dieses Papiers schlagen eine neue Trainingsmethode vor, die Compute Aligned Training (CAT) genannt wird. Anstatt den Schüler für eine einzelne Hausaufgabe zu benoten, bewerten sie ihn danach, wie gut er im Format der tatsächlichen Prüfung abschneiden würde.

So funktioniert es, anhand einiger Analogien:

1. Die „Pass@N"-Analogie (Der Lottoschein)

Stellen Sie sich vor, die Prüfung erlaubt es Ihnen, N Lottoscheine (sagen wir 64 Scheine) für eine Frage zu kaufen. Sie gewinnen, wenn irgendeiner Ihrer 64 Scheine die Gewinnzahl hat.

  • Standard-Training: Wenn der Schüler bereits eine 50-prozentige Chance hat, mit einem Schein zu gewinnen, drängt der Lehrer ihn weiter, auf 90 % oder 99 % zu kommen. Aber bei einem 64-Schein-Lotto garantiert ein Gewinn mit 50-prozentiger Chance durch den Kauf weiterer Scheine ohnehin einen Sieg. Der Lehrer verschwendet Energie damit, einen „guten" Schüler bei einer leichten Frage „perfekt" zu machen, und ignoriert dabei die schwierigen Fragen, bei denen der Schüler nur eine 1-prozentige Chance hat.
  • CAT-Training: Der Lehrer erkennt: „Hey, dieser Schüler wird mit 64 Scheinen wahrscheinlich gewinnen. Ich werde aufhören, diese leichte Frage so streng zu benoten." Stattdessen konzentriert er seine gesamte Energie auf die schwierigen Fragen, bei denen der Schüler aktuell versagt. Er lehrt den Schüler, seine Chancen zu streuen und sicherzustellen, dass mindestens einer der 64 Scheine ein Gewinner ist, anstatt zu versuchen, einen bestimmten Schein perfekt zu machen.

2. Die „Mehrheitswahl"-Analogie (Die Wahl)

Stellen Sie sich vor, die Prüfung verlangt vom Modell, 10 Antworten zu generieren, und die Klasse stimmt für die beliebteste ab.

  • Standard-Training: Der Lehrer versucht, die erste Antwort des Schülers zur absolut beliebtesten zu machen, selbst wenn sie bereits mit überwältigender Mehrheit gewinnt. Das ist wie ein Kandidat, der bereits 90 % der Stimmen hat; der Lehrer sagt ihm weiterhin, er müsse härter Wahlkampf betreiben, was Zeitverschwendung ist.
  • CAT-Training: Der Lehrer betrachtet den „Kipp-Punkt". Wenn die Antwort des Schülers aktuell mit einem kleinen Vorsprung verliert, gibt ihm der Lehrer einen enormen Schub, um ihm zu helfen, die Ziellinie zu überqueren. Wenn der Schüler bereits bequem gewinnt, gibt ihm der Lehrer keine zusätzlichen Punkte mehr. Dies zwingt das Modell, sich auf die „Schlachtenfeld"-Fragen zu konzentrieren, bei denen ein wenig zusätzliche Anstrengung die Stimmen wenden kann.

3. Die „Best-of-N"-Analogie (Die Talentshow)

Stellen Sie sich vor, das Modell generiert 10 Songs, und Sie behalten nur den einen besten.

  • Standard-Training: Der Lehrer versucht, den durchschnittlichen Song gut klingen zu lassen. Dies führt zu sicheren, langweiligen, „mittelmäßigen" Musikstücken, die nie schlecht sind, aber auch nie erstaunlich.
  • CAT-Training: Der Lehrer sagt dem Modell: „Es ist in Ordnung, wenn 9 deiner Songs schrecklich sind, solange der 10. ein Meisterwerk ist." Dies ermutigt das Modell, Risiken einzugehen und seltsame, hochvariante Ideen auszuprobieren. Es lernt, eine breite Vielfalt an Ausgaben zu produzieren, in dem Wissen, dass der „Such"-Prozess (das Auswählen des besten) die Misserfolge herausfiltert und den Gewinner behält.

Was haben sie tatsächlich getan?

Die Forscher haben diese Idee auf drei spezifische Arten getestet:

  1. Matheprobleme: Sie trainierten KI-Modelle, Matheprobleme zu lösen. Als sie CAT einsetzten, um die Modelle auf „Pass@N" vorzubereiten (viele Antworten generieren und die richtige auswählen), waren die Modelle im Vergleich zur Standardmethode deutlich besser darin, schwierige Probleme zu lösen.
  2. Abstimmung: Sie trainierten Modelle, Antworten für eine „Mehrheitswahl" zu generieren. Auch hier schnitten CAT-Modelle besser ab, wenn die Abstimmungsstrategie angewendet wurde.
  3. Proteindesign: Sie testeten dies sogar auf einer völlig anderen Art von KI, die Proteine (die Bausteine des Lebens) entwirft. In einem Szenario, in dem die KI eine seltene, hochwertige Proteinstruktur unter vielen schlechten finden musste, waren die mit CAT trainierten Modelle viel besser darin, den „Jackpot"-Protein zu finden als die Standardmodelle.

Das Fazit

Das Papier argumentiert, dass wie man ein Modell trainiert, übereinstimmen sollte mit der Art, wie man es einsetzt.

Wenn Sie planen, das Modell zu verwenden, um viele Optionen zu generieren und die beste auszuwählen, sollten Sie es nicht darauf trainieren, beim ersten Versuch perfekt zu sein. Sie sollten es darauf trainieren, gut darin zu sein, einen Pool von Optionen zu erstellen, in dem die beste mit hoher Wahrscheinlichkeit zu finden ist.

Sie nennen dies „Compute Aligned Training", weil es den Trainingsprozess mit dem „Compute" (der zusätzlichen Denkleistung) abstimmt, das zur Laufzeit eingesetzt wird. Es ist ein Weg, bessere Ergebnisse zu erzielen, ohne leistungsfähigere Computer oder mehr Trainingszeit zu benötigen; Sie ändern einfach die Spielregeln, um der Realität zu entsprechen, wie das Modell eingesetzt wird.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →