← Neueste Arbeiten
🤖 AI

Where Rollouts Begin: Low-Load, High-Leverage First-Token Diversification for RLVR

Das Papier stellt REFT vor, eine leichte Methode, die Reinforcement Learning mit verifizierbaren Belohnungen (RLVR) verbessert, indem sie den ersten Token nach dem Reasoning-Marker diversifiziert, um die Rollout-Exploration zu erweitern und dadurch die Modellleistung über verschiedene Größen und Schwierigkeitsgrade hinweg zu steigern, ohne die Kern-Trainingspipeline zu verändern.

Ursprüngliche Autoren: Soeun Kim, Albert No

Veröffentlicht 2026-05-28
📖 3 Min. Lesezeit☕ Kaffeepausen-Lektüre

Ursprüngliche Autoren: Soeun Kim, Albert No

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

`) ist fast immer derselbe.

  • Die Analogie: Stellen Sie sich vor, Sie bitten eine Gruppe von Schülern, ein Matheproblem zu lösen. Obwohl sie klug sind, beginnen sie alle instinktiv ihren Satz mit „Zuerst, lassen Sie uns..." oder „Um dies zu lösen...".
  • Das Problem: Der Roboter ist diesen einleitenden Worten so sicher, dass er es fast nie versucht, mit „Lassen Sie uns...", „Angesichts dessen..." oder „Anfänglich..." zu beginnen. Er gerät in eine Schiene und wiederholt denselben einleitenden Satz immer und immer wieder.

Die Autoren entdeckten etwas Überraschendes: Das erste Wort verändert die Mathematik tatsächlich nicht.

  • Die Analogie: Es ist wie ein Reisender, der zwischen einem roten, einem blauen oder einem grünen Bus wählt, um dieselbe Stadt zu erreichen. Die Farbe des Busses (das erste Wort) ändert weder das Ziel noch die Route innerhalb des Busses. Wenn Sie dem Roboter jedoch nur den roten Bus nehmen lassen, sehen Sie nie, wie die blauen oder grünen Busse aussehen.
  • Die Entdeckung: Obwohl der Roboter glaubt, der „rote Bus" (das häufigste erste Wort) sei die beste Wahl, führen die „blauen" und „grünen" Busse (seltener vorkommende erste Wörter) genauso wahrscheinlich zur richtigen Antwort. Der Roboter ist einfach zu wählerisch bezüglich der Busfarbe.

Die Lösung: REFT (Rollout Exploration with First-Token Diversification)

Die Autoren schufen eine einfache Korrektur namens REFT. Anstatt dem Roboter zu erlauben, das erste Wort natürlich auszuwählen (was meist zum selben Wort führt), zwingt REFT den Roboter, absichtlich einige verschiedene einleitende Wörter zu versuchen.

  • Funktionsweise:

    1. Der Roboter betrachtet seine 20 beliebtesten einleitenden Wörter.
    2. REFT wählt 4 verschiedene davon aus dieser Liste aus (z. B. „Zuerst", „Lassen", „Angesichts", „Anfänglich").
    3. Anschließend schickt es den Roboter auf 4 verschiedene Pfade, einen für jedes einleitende Wort.
    4. Sobald das erste Wort feststeht, setzt der Roboter die Lösung des restlichen Problems genau so fort, wie er es normalerweise tun würde.
  • Die Analogie: Stellen Sie sich einen Trainer vor, der einer Gruppe von Läufern sagt: „Statt alle mit demselben Aufwärmlied zu beginnen, lassen Sie uns vier Gruppen mit vier verschiedenen Liedern starten." Sobald die Musik beginnt, laufen alle dasselbe Rennen. Der Trainer ändert das Rennen nicht; er stellt lediglich sicher, dass das Team verschiedene Startstimmungen erkundet, um zu sehen, ob eine zu einem besseren Ziel führt.

Warum dies wichtig ist

Die Arbeit zeigt, dass durch das Erzwingen dieser verschiedenen „Einleitungssätze" der Roboter mehr korrekte Lösungen findet, ohne dass mehr Rechenleistung benötigt wird oder die komplexe Mathematik hinter dem Training verändert werden muss.

  • Bessere Ergebnisse: Der Roboter wurde besser im Lösen von Matheproblemen (gemessen daran, wie oft er die richtige Antwort beim 1., 8. oder 64. Versuch erhielt).
  • Keine zusätzlichen Kosten: Das Training dauerte nicht länger. Tatsächlich, da der Roboter die richtige Antwort schneller fand, schloss er die Aufgaben manchmal sogar etwas schneller ab.
  • Vermeidung von „Alles-falsch"-Gruppen: Manchmal scheitert eine ganze Gruppe von Versuchen, weil sie alle mit derselben „falschen" Denkweise begonnen haben. Durch die Diversifizierung des Starts stellt REFT sicher, dass mindestens eine Gruppe den richtigen Weg findet.

Zusammenfassung

Die Arbeit argumentiert, dass wir bei der KI-Argumentation oft nach Vielfalt in der Mitte des Denkprozesses (den schwierigen Mathe-Schritten) suchen. Die Autoren fanden jedoch heraus, dass das sehr erste Wort ein Ort mit „geringem Aufwand und hoher Hebelwirkung" ist. Es ist einfach zu ändern (es ist nur ein Wort), hat aber einen enormen Einfluss auf die Vielfalt der Lösungen, die die KI erkundet. Durch einfaches Aufmischen des ersten Wortes wird die KI zu einem besseren Problemlöser.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →