← Neueste Arbeiten
🤖 machine learning

Single-Rollout Asynchronous Optimization for Agentic Reinforcement Learning

Dieses Paper stellt Single-rollout Asynchronous Optimization (SAO) vor, ein stabiles und effizientes asynchrones Reinforcement-Learning-Framework, das gruppenweises Sampling durch Single-Rollout-Strategien ersetzt und striktes Token-Level-Clipping einsetzt, um groß angelegte agentische Modelle wie GLM-5.2 erfolgreich auf komplexen Coding- und Reasoning-Benchmarks zu trainieren.

Ursprüngliche Autoren: Zhenyu Hou, Yujiang Li, Jie Tang, Yuxiao Dong

Veröffentlicht 2026-07-09
📖 5 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Zhenyu Hou, Yujiang Li, Jie Tang, Yuxiao Dong

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich vor, Sie trainieren ein Team von Jungkoch-Studenten, um das perfekte Gericht zu kochen. Auf die alte Art und Weise (die das Paper als Synchrones RL bezeichnet) würde der Chefkoch rufen: „Alle, fangt an zu kochen!“ und dann warten. Die Studenten würden alle mit ihren Gerichten beginnen. Aber hier liegt das Problem: Einige Studenten sind schnell, andere sind langsam. Die schnellen Studenten würden ihre Gerichte fertigstellen und dann nur an der Wand stehen und starren, während sie darauf warten, dass der langsamste Student fertig wird. Erst wenn alle fertig waren, konnte der Chefkoch das Essen probieren, Feedback geben und allen sagen, was als Nächstes zu tun ist. Dies ist unglaublich ineffizient; die Küche ist voller Leerlaufzeiten.

Um dies zu beheben, versuchten Forscher es mit Asynchronem RL. In dieser Version sagt der Chefkoch, sobald ein Student ein Gericht fertiggestellt hat, sofort das Essen und gibt Feedback. Der Student kann sofort mit seinem nächsten Gericht beginnen. Die Küche steht niemals still. Das geht viel schneller.

Es gab jedoch einen großen Haken. Da der Chefkoch Gerichte von Studenten verkostete, die zu unterschiedlichen Zeiten angefangen hatten zu kochen, änderte sich das „Rezept“, dem die Studenten folgten, ständig. Einige Studenten kochten basierend auf einem alten Rezept, während andere ein neues verwendeten. Diese Verwirrung machte das Training instabil, und die Studenten wurden oft schlechter im Kochen, anstatt besser zu werden. Außerdem erforderte die populäre Methode, mit der diese Studenten bewertet wurden (genannt GRPO), dass der Chefkoch auf eine Gruppe von Studenten wartete, bevor er eine Note gab, was das Warteproblem wieder mit sich brachte.

Die Autoren dieses Papers haben eine neue Methode namens SAO (Single-Rollout Asynchronous Optimization) eingeführt. Sie lösten das Chaos mit drei cleveren Tricks:

1. Die „Sofortiges Feedback“-Regel (Single-Rollout)

Anstatt darauf zu warten, dass eine Gruppe von Studenten eine Charge fertigstellt, sagt SAO: „Sobald ein einzelner Student ein Gericht fertiggestellt hat, bewerte es sofort.“

  • Die Metapher: Stellen Sie sich ein Videospiel vor, bei dem Sie Ihren Score in dem Moment erhalten, in dem Sie ein Level abschließen, anstatt darauf zu warten, dass Ihre gesamte Gruppe fertig ist. Dies verhindert die „Warten auf den langsamsten Teilnehmer“-Verzögerung.
  • Das Problem, das es löst: Es verhindert, dass die „Gruppe“ auf das langsamste Mitglied warten muss, wodurch das Training mit voller Geschwindigkeit weiterläuft.

2. Das „Strikte Sicherheitsnetz“ (Double-Sided Clipping)

Da die Studenten so schnell arbeiten und die Rezepte sich ständig ändern, besteht das Risiko, dass sie verrückt werden und versuchen könnten, etwas völlig Wildes und Gefährliches auszuprobieren.

  • Die Metapher: Die Autoren haben einen „Zaun“ um das Training errichtet. Wenn die neue Idee eines Studenten zu weit von dem abweicht, was der Lehrer erwartet (zu weit links oder zu weit rechts), ignoriert das System dies nicht einfach; es blockiert den Studenten komplett dabei, aus diesem spezifischen Fehler zu lernen. Es ist wie ein strenger Trainer, der sagt: „Wenn du versuchst, rückwärts zu laufen, werde ich dich gar nicht erst von diesem Lauf lernen lassen.“
  • Das Problem, das es löst: Dies verhindert, dass das Training instabil wird oder „explodiert“, wenn die Studenten durch das hohe Tempo verwirrt werden.

3. Der „Super-Coach“ (Besseres Value-Modell)

In der alten „Gruppen“-Methode konnte der Coach die Gerichte eines Studenten mit den Gerichten seiner Klassenkameraden vergleichen, um zu sehen, ob es gut war. Aber in dieser „eins-zu-eins“-Methode gibt es keine Klassenkameraden, mit denen man vergleichen kann. Der Coach muss unglaublich klug sein, um zu wissen, ob ein einzelnes Gericht für sich genommen gut oder schlecht ist.

  • Die Metapher: Die Autoren haben einen speziellen „Value-Coach“ (einen Critic) trainiert, der viel klüger ist und sein Wissen doppelt so schnell aktualisiert wie die Jungkoch-Studenten. Sie haben auch die „Instinkte“ (Attention-Layer) des Coaches eingefroren, damit er nicht verwirrt wird, und erlaubten ihm nur, die spezifischen Details des Rezepts zu lernen.
  • Das Problem, das es löst: Dies stellt sicher, dass der Coach selbst dann, wenn der Student alleine arbeitet, präzise sagen kann: „Ja, das war ein guter Zug“ oder „Nein, das war schlecht“, ohne eine Gruppe zum Vergleich zu benötigen.

Die Ergebnisse

Das Paper testete diese neue Methode bei zwei sehr schwierigen Aufgaben:

  1. Coding: Einem KI die Aufgabe zu stellen, Bugs in Software zu beheben (wie ein Mechaniker, der ein Auto repariert).
  2. Mathematisches Denken: Einer KI die Aufgabe zu stellen, komplexe mathematische Probleme zu lösen (wie ein Schüler, der eine schwere Prüfung schreibt).

Das Ergebnis:

  • Die alte Methode (GRPO) startete gut, stürzte dann aber nach einer Weile ab und scheiterte, weil sie zu verwirrt wurde.
  • Die neue SAO-Methode hielt das Training über einen langen Zeitraum (bis zu 1.000 Schritte) reibungslos aufrecht und verbesserte die Scores konsistent.
  • Sie bewies auch, dass diese Methode perfekt für Online Learning ist, bei dem sich die Regeln des Spiels während des Spielens ändern. Wenn der Lehrer zum Beispiel plötzlich sagt: „Jetzt möchte ich süße Geschichten“, könnte die mit SAO trainierte KI ihren Stil schnell anpassen, während andere Methoden zu langsam darin waren, sich anzupassen.

Kurz gesagt sagt das Paper: „Hören Sie auf, auf Gruppen zu warten. Lassen Sie jeden in seinem eigenen Tempo arbeiten, aber geben Sie ihnen ein striktes Sicherheitsnetz und einen super-klugen Coach, der sein Wissen sofort aktualisiert. Dies macht das KI-Training schneller, stabiler und besser darin, schwierige, sich ändernde Probleme zu lösen.“

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →