← Neueste Arbeiten
🤖 machine learning

Transformation-Augmented GRPO for Enhancing Exploration in Reasoning of Large Language Models

Dieser Artikel stellt Transformation-Augmented GRPO (TA-GRPO) vor, eine Methode, die das Verschwinden von Gradienten und den Zusammenbruch der Diversität beim Schlussfolgern von Large Language Models mildert, indem sie problemäquivalente Umformulierungen generiert, um gemischte Belohnungen und diverse Erkundungspfade zu schaffen, wodurch die Leistung auf komplexen mathematischen Benchmarks erheblich verbessert wird.

Ursprüngliche Autoren: Khiem Le, Phuc Nguyen, Youssef Mroueh, Chi-Heng Lin, Shangqian Gao, Ting Hua, Nitesh V. Chawla

Veröffentlicht 2026-05-20
📖 5 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Khiem Le, Phuc Nguyen, Youssef Mroueh, Chi-Heng Lin, Shangqian Gao, Ting Hua, Nitesh V. Chawla

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich vor, Sie versuchen, einem sehr klugen Schüler (ein Large Language Model) beizubringen, wie man schwierige Matheaufgaben löst. Der derzeit beste Weg, dies zu tun, ist eine Methode namens GRPO. Stellen Sie sich GRPO als einen Lehrer vor, der den Schüler auffordert, 8 verschiedene Antworten auf dieselbe Frage aufzuschreiben. Der Lehrer vergleicht dann diese 8 Antworten: Wenn einige richtig und einige falsch sind, lernt der Schüler, welche Strategie am besten funktioniert hat.

Das Papier weist jedoch darauf hin, dass diese „8-Antworten"-Methode zwei große Mängel hat, wie zwei Fallen, in die der Schüler tappen kann:

  1. Die „Alles-oder-Nichts"-Falle (Gradienten-Verschwinden):

    • Das Problem: Wenn die Frage zu einfach ist, bekommt der Schüler alle 8 Antworten richtig. Wenn sie zu schwer ist, bekommt er alle 8 falsch. In beiden Fällen kann der Lehrer dem Schüler nicht sagen, wie er sich verbessern soll, da es keinen Unterschied zwischen den Antworten gibt. Es ist, als würde ein Lehrer sagen: „Gut gemacht!" oder „Versuch es nochmal!", ohne zu erklären, warum. Der Schüler erhält kein nützliches Feedback und hört auf zu lernen.
    • Die Lösung des Papiers: Anstatt dieselbe Frage einfach 8 Mal zu stellen, fragt der Lehrer dieselbe Frage, aber formuliert sie anders (z. B. durch Ändern der Wortreihenfolge, Verwendung eines anderen Formats oder Erzählen der Geschichte aus einer anderen Perspektive).
    • Die Analogie: Stellen Sie sich vor, Sie fragen einen Freund: „Was ist 2+2?" Er sagt „4". Einfach. Jetzt fragen Sie: „Wenn Sie zwei Äpfel haben und zwei weitere bekommen, wie viele haben Sie dann?" Er könnte sagen „4". Jetzt fragen Sie: „Ich habe zwei Paar Schuhe; wie viele Schuhe sind das?" Er könnte innehalten und nachdenken. Obwohl die Mathematik dieselbe ist, verändert die Art und Weise, wie die Frage gestellt wird, wie der Schüler denkt. Durch das Mischen der ursprünglichen Frage mit diesen „umformulierten Nachbarn" ist es wahrscheinlicher, dass der Schüler über die gesamte Gruppe hinweg eine Mischung aus richtigen und falschen Antworten erhält, was dem Lehrer reichlich nützliches Feedback für die Arbeit liefert.
  2. Die „Echokammer"-Falle (Zusammenbruch der Vielfalt):

    • Das Problem: Selbst wenn der Schüler einige Antworten richtig und einige falsch bekommt, neigt er dazu, bei allen 8 Antworten im selben Denk Muster stecken zu bleiben. Es ist, als hätte der Schüler eine „Lieblings"-Methode zur Problemlösung und weigert sich, etwas anderes auszuprobieren. Er hört auf, neue Strategien zu erkunden.
    • Die Lösung des Papiers: Da die umformulierten Fragen anders aussehen, ist der Schüler gezwungen, verschiedene Strategien zu deren Lösung auszuprobieren. Eine Version der Frage könnte einen „Formel"-Ansatz auslösen, während eine andere einen „visuellen" Ansatz auslöst.
    • Die Analogie: Es ist, als würde man einen Koch bitten, einen Burger zuzubereiten. Wenn Sie nur sagen „Machen Sie einen Burger", könnte er jedes Mal genau denselben machen. Aber wenn Sie sagen: „Machen Sie einen Burger mit dem Brötchen unten", „Machen Sie einen Burger mit dem Fleisch in Würfeln geschnitten" und „Machen Sie einen Burger, bei dem der Käse zuerst geschmolzen wird", muss der Koch mit verschiedenen Techniken experimentieren. Dies zwingt den Koch, eine breitere Vielfalt an Kochstilen zu erkunden, was ihn insgesamt zu einem besseren, vielseitigeren Koch macht.

Wie die neue Methode (TA-GRPO) funktioniert

Die Autoren nennen ihre neue Methode TA-GRPO (Transformation-Augmented GRPO). Hier ist das einfache Rezept:

  1. Nehmen Sie ein Matheproblem.
  2. Verwenden Sie ein KI-Tool (wie GPT-4), um dieses Problem dreimal auf unterschiedliche Weise umzuschreiben, wobei die Bedeutung gleich bleibt.
  3. Bitten Sie den Schüler, das ursprüngliche Problem und die 3 neuen Versionen zu lösen und dabei 8 Antworten für jede der 4 Versionen zu generieren. Das sind insgesamt 32 Antworten!
  4. Der Lehrer betrachtet alle 32 Antworten gemeinsam, um herauszufinden, welche Strategien am besten funktioniert haben.
  5. Entscheidend ist, dass der Lehrer das Gehirn des Schülers basierend auf der ursprünglichen Frage aktualisiert, obwohl der Schüler verschiedene Versionen der Frage gelöst hat. Dies stellt sicher, dass der Schüler das Kernkonzept lernt und nicht nur, wie man auf eine bestimmte Formulierung antwortet.

Die Ergebnisse

Das Papier testete dies an vier verschiedenen KI-Modellen (von klein bis mittelgroß) unter Verwendung harter Mathewettbewerbe (wie AMC und AIME).

  • Bessere Scores: TA-GRPO erzielte konsistent höhere Scores als die Standardmethode. Zum Beispiel verbesserte es bei den schwierigsten Mathe-Tests die Erfolgsrate im Durchschnitt um etwa 5 Punkte.
  • Intelligentere Erkundung: Die Modelle hatten nicht einfach nur Glück; sie versuchten tatsächlich vielfältigere Wege zur Problemlösung.
  • Dateneffizienz: Das beeindruckendste Ergebnis ist, dass TA-GRPO Ergebnisse erzielte, die dem Training eines Modells mit 2,5-mal mehr Daten entsprachen. Mit anderen Worten: Indem die Fragen auf intelligentere Weise gestellt wurden, lernte das Modell so viel, als hätte man ihm eine riesige Bibliothek zusätzlicher Lehrbücher gegeben.

Der Haken

Das Papier weist auf einen kleinen Preis hin: Um diese umformulierten Fragen zu erhalten, muss man eine kleine Gebühr zahlen, um eine leistungsfähige KI (GPT-4-Turbo) für die Umschreibung einzusetzen. Außerdem dauert das Training etwas länger, da das Modell pro Schritt mehr Fragen verarbeiten muss. Die Autoren argumentieren jedoch, dass die Leistungsverbesserung diese zusätzliche Anstrengung wert ist.

Kurz gesagt: TA-GRPO verhindert, dass KI-Modelle sich langweilen oder feststecken, indem es ihnen dieselbe Frage in vielen verschiedenen „Kostümen" stellt. Dies zwingt sie, kreativer zu denken und effektiver zu lernen, was Zeit und Geld spart, im Vergleich dazu, einfach mehr Daten auf das Problem zu werfen.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →