← Neueste Arbeiten
🤖 machine learning

Hölder Policy Optimisation

Dieser Beitrag stellt HölderPO vor, ein generalisiertes Rahmenwerk zur Politikoptimierung, das den Parameter des Hölder-Mittels dynamisch anpasst, um Gradientenkonzentration und Varianzstabilität auszubalancieren, wodurch die Einschränkungen der festen Aggregation in der Group Relative Policy Optimization (GRPO) behoben und State-of-the-Art-Leistung auf mathematischen und aufgabenorientierten Benchmarks erreicht werden.

Ursprüngliche Autoren: Yuxiang Chen, Dingli Liang, Yihang Chen, Ziqin Gong, Chenyang Le, Zhaokai Wang, Jiachen Zhu, Lingyu Yang, Jianghao Lin, Weinan Zhang, Jun Wang

Veröffentlicht 2026-05-13
📖 4 Min. Lesezeit☕ Kaffeepausen-Lektüre

Ursprüngliche Autoren: Yuxiang Chen, Dingli Liang, Yihang Chen, Ziqin Gong, Chenyang Le, Zhaokai Wang, Jiachen Zhu, Lingyu Yang, Jianghao Lin, Weinan Zhang, Jun Wang

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich vor, Sie unterrichten einen brillanten, aber leicht verwirrten Schüler (ein Large Language Model) darin, komplexe mathematische Probleme zu lösen oder eine Videospielwelt zu navigieren. Sie geben ihm eine Reihe von Übungsversuchen, und für jeden Versuch müssen Sie entscheiden: "Welche spezifischen Wörter in seiner Antwort waren am wichtigsten, um sie richtig zu haben?"

Dies ist die Kernherausforderung, die der Artikel adressiert. Die Autoren schlagen eine neue Unterrichtsmethode namens HölderPO (Hölder Policy Optimisation) vor.

Hier ist die Aufschlüsselung mit einfachen Analogien:

1. Das Problem: Der "Ein-Größe-Passt-Alle"-Lehrer

Frühere Methoden (wie GRPO) verhielten sich wie ein Lehrer, der immer dieselbe Regel anwendet, um einen Schüleraufsatz zu benoten.

  • Das arithmetische Mittel (Standard-GRPO): Dieser Lehrer mittelt jedes Wort gleich. Wenn der Schüler 90 % der Wörter richtig hat, aber einen entscheidenden "Aha!"-Moment bei einem schwierigen mathematischen Problem verpasst, behandelt der Lehrer diesen verpassten Moment nur als winzigen Ausschlag im Durchschnitt. Der Schüler lernt aus diesem spezifischen Fehler nicht genug.
  • Das geometrische Mittel (Andere Methoden): Dieser Lehrer ist sehr sanft. Er glättet die Noten so, dass kein einzelnes Wort zu viel zählt. Das ist großartig für einfache Aufgaben, bei denen der Schüler nur konsistent sein muss, aber bei schwierigen Aufgaben ignoriert es die seltenen, kritischen Momente, in denen der Schüler endlich etwas begriffen hat.

Das Problem: Der Artikel stellt fest, dass es keine einzelne "perfekte" Regel gibt.

  • Bei schwierigen, spärlichen Aufgaben (wie dem AIME-Mathematikwettbewerb) hängt die richtige Antwort von wenigen seltenen, brillanten Schritten ab. Sie brauchen einen Lehrer, der auf diese spezifischen Schritte zoomt und den Rest ignoriert.
  • Bei dichten Aufgaben (wie standardmäßiger Mathematik-Hausaufgaben) ist die richtige Antwort über viele Wörter verteilt. Sie brauchen einen Lehrer, der das ganze Bild betrachtet, um nicht durch Rauschen verwirrt zu werden.

2. Die Lösung: Der "Regler"-Lehrer (HölderPO)

Die Autoren haben ein neues System mit einem einzigen Regler (Parameter pp) entwickelt, der steuert, wie der Lehrer den Schüler benotet.

  • Den Regler NACH OBEN drehen (Hohe pp): Der Lehrer wird zu einem Scheinwerfer. Er ignoriert die langweiligen, durchschnittlichen Wörter und konzentriert sich intensiv auf die wenigen Wörter, die "super richtig" oder "super falsch" waren. Das ist wie ein Trainer, der schreit: "Dieser eine Zug, den du gemacht hast, war perfekt! Mach das nochmal!" Das hilft dem Schüler, seltene, schwierige Fähigkeiten zu erlernen.
  • Den Regler NACH UNTEN drehen (Niedrige pp): Der Lehrer wird zu einem Weitwinkelobjektiv. Er betrachtet die gesamte Wortsequenz gleichmäßig. Das verhindert, dass der Schüler verrückt wird, indem er versucht, ein winziges Detail perfekt zu machen und den Rest ignoriert. Das hält das Training stabil und ruhig.

3. Das Geheimnis: Der "Dynamische Zeitplan"

Die größte Durchbruchsleistung des Artikels ist die Erkenntnis, dass Sie den Regler nicht für immer an einer Stelle lassen sollten.

Stellen Sie sich das Training eines Marathonläufers vor:

  1. Frühe Phase (Der Sprint): Wenn der Läufer neu ist, muss er die spezifischen, explosiven Bewegungen lernen, um anzufangen. Sie drehen den Regler NACH OBEN (Hohe pp). Sie rufen: "Konzentriere dich auf diesen einen perfekten Schritt!" Dies verstärkt die seltenen, guten Signale, um ihn in Bewegung zu bringen.
  2. Späte Phase (Die Ausdauer): Sobald er weiß, wie man läuft, muss er ein gleichmäßiges, stabiles Tempo halten, ohne über die eigenen Füße zu stolpern. Sie drehen den Regler NACH UNTEN (Niedrige pp). Sie sagen: "Halte deinen ganzen Körper im Gleichgewicht und geschmeidig." Das verhindert, dass er überkorrigiert und abstürzt.

HölderPO bewegt den Regler automatisch von "Hoch" nach "Niedrig", während das Training fortschreitet. Es beginnt damit, aggressiv nach den "Aha!"-Momenten zu suchen, und endet damit, alles zu glätten, um ein stabiles Finish zu erreichen.

4. Die Ergebnisse: Das Rennen gewinnen

Die Autoren testeten diesen "Regler-Lehrer" an zwei Arten von Herausforderungen:

  • Mathematikwettbewerbe (AIME, MATH, usw.): Die dynamische Methode erreichte eine durchschnittliche Genauigkeit von 54,9 % und schlug die bisherigen besten Methoden mit einem signifikanten Vorsprung. Sie brach Rekorde bei den schwierigsten Mathematikproblemen (AIME), indem sie diese seltenen, korrekten Denkprozesse erfolgreich verstärkte.
  • Roboter-/Agenten-Aufgaben (ALFWorld): In einer simulierten Welt, in der ein Agent Objekte finden, reinigen und erhitzen muss, erreichte die Methode eine Erfolgsrate von 93,8 %. Das ist enorm, da es bedeutet, dass der Agent bei langen, mehrstufigen Aufgaben selten verloren geht oder verwirrt ist.

Zusammenfassung

Stellen Sie sich HölderPO als einen intelligenten Trainingscoach vor, der weiß, wann er den Schüler anschreien muss, um sich auf einen spezifischen Durchbruch zu konzentrieren, und wann er ihn beruhigen muss, um sicherzustellen, dass er keine Fehler macht. Indem es automatisch zwischen diesen beiden Modi wechselt, lehrt es KI-Modelle, schwierige Probleme schneller und zuverlässiger zu lösen als je zuvor.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →