← Neueste Arbeiten
🤖 machine learning

Complementing reinforcement learning with SFT through logit averaging in the post training of LLMs

Dieser Beitrag stellt eine neuartige Nachtrainierungsmethode für große Sprachmodelle vor, die die Group Relative Policy Optimization (GRPO) durch die Mittelung der Logits einer eingefrorenen SFT-Referenzrichtlinie und einer trainierbaren Richtlinie verbessert, wodurch die Notwendigkeit einer KL-Regularisierung oder eines Critics entfällt, während gleichzeitig die推理fähigkeiten des RL mit der Formatierungsstabilität des SFT effektiv kombiniert werden.

Ursprüngliche Autoren: Xingwei Gan, Ying Zhu

Veröffentlicht 2026-05-21
📖 5 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Xingwei Gan, Ying Zhu

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Das große Ganze: Zwei Lehrer, ein Schüler

Stellen Sie sich vor, Sie trainieren ein großes Sprachmodell (eine KI), um Mathematikaufgaben zu lösen. Sie haben zwei unterschiedliche „Lehrer", die versuchen, es zu unterrichten:

  1. Der Formatierungs-Lehrer (SFT): Dieser Lehrer ist hervorragend darin, der KI beizubringen, Antworten ordentlich zu schreiben, die richtigen Symbole zu verwenden und strikte Regeln einzuhalten (wie das Umranden der finalen Antwort). Allerdings macht dieser Lehrer manchmal Fehler in der eigentlichen mathematischen Logik.
  2. Der Denk-Lehrer (RL): Dieser Lehrer ist ein Mathe-Genie, das komplexe Gleichungen perfekt lösen kann. Doch dieser Lehrer ist unordentlich; er vergisst oft, die Antwort zu umranden, überspringt Schritte oder schreibt in einem seltsamen Format, das nicht den Anforderungen der Prüfung entspricht.

Das Problem:
Traditionell, wenn man versucht, diese beiden zu kombinieren, verwendet man eine Methode namens „KL-Regularisierung". Stellen Sie sich dies wie ein Gummiband vor, das den Denk-Lehrer an den Formatierungs-Lehrer bindet. Das Gummiband zwingt den Denk-Lehrer, nah am Stil des Formatierungs-Lehrers zu bleiben.

  • Der Haken: Wenn der Formatierungs-Lehrer einen mathematischen Fehler macht, zieht das Gummiband den Denk-Lehrer in denselben Fehler hinein. Die KI bleibt stecken, versucht, „ordentlich" zu sein, scheitert aber daran, „klug" zu sein.

Die neue Lösung: Logit-Durchschnitt
Die Autoren dieses Papiers schlagen eine neue Art vor, diese Lehrer zu kombinieren. Anstatt sie mit einem Gummiband zusammenzubinden, erzeugen sie eine gemischte Stimme.

Stellen Sie sich die KI als Chor vor. Anstatt die Sänger zu zwingen, in perfekter Einmütigkeit zu bleiben (was ihren Umfang begrenzt), mischt die neue Methode ihre Stimmen, bevor sie singen.

  • Wenn der Formatierungs-Lehrer sagt: „Rahme die Antwort ein", und der Denk-Lehrer sagt: „Die Antwort ist 5", sagt die gemischte Stimme: „Rahme die Antwort ein: 5."
  • Wenn der Formatierungs-Lehrer einen mathematischen Fehler macht (und sagt, die Antwort sei 6), aber der Denk-Lehrer weiß, dass es 5 ist, lehnt sich die gemischte Stimme stark auf die Mathematik des Denk-Lehrers, behält aber die Anweisung des Formatierungs-Lehrers bei, sie „einzurahmen".

Wie es funktioniert (Die „Logit"-Magie)

In KI-Terminologie besteht die „Stimme" des Modells aus Zahlen, die Logits genannt werden (die angeben, wie wahrscheinlich es ist, dass das Modell als nächstes ein bestimmtes Wort oder eine bestimmte Zahl wählt).

  1. Die Mischung: Die Forscher nehmen die Zahlen des Formatierungs-Lehrers und des Denk-Lehrers und mitteln sie mathematisch zusammen.
  2. Das Ergebnis: Dies erzeugt eine neue, vorübergehende „gemischte Richtlinie".
  3. Das Training: Die KI lernt, indem sie an dieser gemischten Richtlinie übt. Sie erhält eine Belohnung (Punkte), wenn die finale Antwort korrekt ist.
    • Da der Formatierungs-Lehrer Teil der Mischung ist, vergisst die KI nie, wie man ordentlich schreibt.
    • Da der Denk-Lehrer Teil der Mischung ist, ist die KI frei, die mathematischen Fehler des Formatierungs-Lehrers zu korrigieren.

Warum dies besser ist (Das „Produkt von Experten")

Das Papier verwendet ein Konzept namens „Produkt von Experten". Stellen Sie es sich wie eine Komitee-Entscheidung vor:

  • Wenn Experte A (Formatierung) sich über den Stil sicher ist und Experte B (Denken) sich über die Mathematik sicher ist, ist die endgültige Entscheidung in beiden Bereichen stark.
  • Wenn Experte A in der Mathematik falsch liegt, überwiegt das Vertrauen von Experte B, aber das Vertrauen von Experte A bezüglich des Stils bleibt erhalten.

Das Papier fand heraus, dass dieser Ansatz der „gemischten Stimme" besser funktioniert als die alte „Gummiband"-Methode. Die KI lernte, Mathematikaufgaben korrekt zu lösen und behielt ihre ordentliche Formatierung bei, während die alte Methode oft dazu führte, dass die KI vergaß, wie man korrekt formatiert, oder in den mathematischen Fehlern des Formatierungs-Lehrers stecken blieb.

Die Experimente

Die Forscher testeten dies an drei verschiedenen „Prüfungen" (Datensätzen):

  1. MATH: Schwierige Mathematikaufgaben.
  2. cn-k12: Chinesische Mittel- und Oberstufenmathematik.
  3. MMLU: Allgemeinwissen und Schlussfolgerungen.

Sie testeten es an drei verschiedenen Größen von KI-Modellen (klein, mittel und groß).

Die Ergebnisse:

  • In fast allen Fällen erzielte die neue Methode der „gemischten Stimme" höhere Punktzahlen als die traditionelle Methode.
  • Sie war besonders gut darin, ein spezifisches Problem zu beheben: Die traditionelle Methode ließ die KI oft „vergessen", wie man Antworten formatiert, während sie lernte, schwierigere Mathematik zu lösen. Die neue Methode behielt die Formatierungsfähigkeiten intakt, während sie die mathematischen Fähigkeiten verbesserte.

Ein konkretes Beispiel aus dem Papier

Das Papier gibt ein spezifisches Beispiel einer Geometrie-Aufgabe:

  • Der Formatierungs-Lehrer (SFT): Stellt die Gleichung korrekt auf, macht aber einen mathematischen Fehler und kommt zu dem Schluss, dass der Radius 6 ist. Er rahmt die Antwort ordentlich ein.
  • Der Denk-Lehrer (RL): Berechnet die Mathematik korrekt, findet heraus, dass der Radius 5 ist, vergisst aber, die Antwort einzurahmen oder sie im endgültigen Format zu schreiben.
  • Die gemischte Stimme: Sie nimmt die korrekte Mathematik (5) vom Denk-Lehrer und die ordentliche Einrahmungs-Anweisung vom Formatierungs-Lehrer. Die endgültige Ausgabe ist eine ordentlich eingerahmte 5.

Zusammenfassung

Das Papier stellt eine Methode vor, KI-Modelle zu trainieren, die wie ein kooperatives Team funktioniert, anstatt wie eine strikte Hierarchie. Indem die „Gedanken" (Logits) eines ordentlichen, aber unordentlichen Lehrers und eines klugen, aber unordentlichen Lehrers mathematisch gemittelt werden, lernt die KI, sowohl klug als auch ordentlich zu sein, und vermeidet die Fallstricke, einen strikt dem anderen folgen zu lassen.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →