← Neueste Arbeiten
💬 NLP

Negative Advantage Is a Double-Edged Sword: Calibrating Advantage in GRPO for Deep Search

Die Arbeit stellt CalibAdv vor, eine Methode zur Feinabstimmung des Vorteils in GRPO für Deep-Search-Agenten, die durch die Korrektur von Bestrafungen korrekter Zwischenschritte und die Neuausgewogenheit positiver und negativer Vorteile die Trainingsstabilität und Leistung verbessert.

Ursprüngliche Autoren: Jiayi Wu, Ruobing Xie, Zeqian Huang, Lei Jiang, Can Xu, Kangyang Luo, Ming Gao, Xiang Li

Veröffentlicht 2026-04-21
📖 1 Min. Lesezeit☕ Kaffeepausen-Lektüre

Ursprüngliche Autoren: Jiayi Wu, Ruobing Xie, Zeqian Huang, Lei Jiang, Can Xu, Kangyang Luo, Ming Gao, Xiang Li

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

`), der sagt: "Jetzt fange ich an zu denken."

  • Das Problem: Da dieser Befehl immer gleich ist, bekam er in der alten Methode riesige Lob- oder Tadel-Signale, je nachdem, ob die Antwort danach richtig war. Das verwirrte den Assistenten, weil er dachte, der Befehl selbst sei das Problem.
  • Die Lösung: CalibAdv sagt: "Der Befehl 'Ich denke' ist nur ein Schild am Anfang. Wir bestrafen oder loben ihn nicht." So bleibt der Start stabil, und der Assistent kann sich auf den Inhalt konzentrieren.

3. Das Ergebnis: Ein stabiler Super-Detektiv

Durch diese drei Tricks passiert Folgendes:

  1. Der Assistent wird besser in Beantworten von Fragen (er findet die richtigen Antworten öfter).
  2. Er bricht nicht mehr zusammen. Er bleibt ruhig, logisch und spricht weiterhin wie ein normaler Mensch, statt in Unsinn zu verfallen.

Zusammenfassend:
Statt den KI-Assistenten blindlings für das Endergebnis zu bestrafen (was ihn verrückt macht), hat CalibAdv ihn wie einen guten Coach behandelt: Gute Zwischenschritte wurden anerkannt, das Gleichgewicht zwischen Lob und Tadel wurde wiederhergestellt, und unnötige Verwirrung wurde vermieden. Das Ergebnis ist ein KI-System, das wirklich lernen kann, ohne den Verstand zu verlieren.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →