← Neueste Arbeiten
💬 NLP

Process Rewards with Learned Reliability

Dieser Beitrag stellt BetaPRM vor, ein verteiltes Prozess-Reward-Modell, das sowohl Erfolgswahrscheinlichkeiten auf Schrittebene als auch deren Zuverlässigkeit vorhersagt, um eine adaptive Berechnungszuweisung zu ermöglichen, die den Genauigkeit-Token-Tradeoff beim Best-of-N-Reasoning durch dynamische Anpassung der Berechnung basierend auf der Vorhersagezuverlässigkeit erheblich verbessert.

Ursprüngliche Autoren: Jinyuan Li, Langlin Huang, Chengsong Huang, Shaoyang Xu, Donghong Cai, Yuyi Yang, Wenxuan Zhang, Jiaxin Huang

Veröffentlicht 2026-05-18
📖 5 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Jinyuan Li, Langlin Huang, Chengsong Huang, Shaoyang Xu, Donghong Cai, Yuyi Yang, Wenxuan Zhang, Jiaxin Huang

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich vor, Sie sind ein Lehrer, der einen langen, mehrstufigen Mathematik-Essay eines Schülers bewertet. Sie möchten zu jedem einzelnen Schritt Feedback geben, nicht nur zur endgültigen Antwort. Genau das tun Process Reward Models (PRMs) für KI: Sie fungieren als Schritt-für-Schritt-Trainer und sagen der KI: „Gute Arbeit bei Schritt 1" oder „Das sieht bei Schritt 2 falsch aus."

Allerdings weist die Studie einen Mangel in der aktuellen Funktionsweise dieser Trainer auf. Sie geben eine einzelne Zahl (wie eine Note von 8/10) aus und tun so, als wäre diese Zahl zu 100 % sicher. In Wirklichkeit könnte der Trainer jedoch raten. Wenn die KI einen seltsamen Pfad einschlägt, der gut aussieht, aber möglicherweise in eine Sackgasse führt, gibt der alte Trainer ihm dennoch eine hohe Bewertung, und die KI vertraut ihr blind.

Die Autoren schlagen einen neuen Trainer namens BETAPRM vor, der nicht nur eine Note vergibt, sondern eine Note und ein Konfidenzniveau liefert.

Hier ist die Aufschlüsselung mit einfachen Analogien:

1. Das Problem: Der „rätsende" Trainer

Stellen Sie sich vor, Sie versuchen vorherzusagen, ob ein Münzwurf Kopf oder Zahl zeigt.

  • Alte Methode (Standard-PRM): Sie werfen die Münze 8 Mal, und sie landet 5 Mal auf Kopf. Der alte Trainer sagt: „Die Wahrscheinlichkeit beträgt exakt 62,5 %." Er behandelt diese kleine Stichprobe als perfekte, unveränderliche Tatsache.
  • Das Problem: Wenn Sie die Münze erneut 8 Mal werfen, könnten Sie 4 oder 6 Köpfe erhalten. Der alte Trainer weiß das nicht. Er behandelt die „62,5 %" als harte Tatsache, obwohl sie auf einer winzigen, verrauschten Stichprobe basiert. Dies führt dazu, dass die KI in unsicheren Situationen übermäßig selbstbewusst ist.

2. Die Lösung: Der „ehrliche" Trainer (BETAPRM)

BETAPRM ändert das Spiel. Anstatt eine einzelne Zahl zu nennen, gibt es einen Bereich möglicher Werte an und sagt Ihnen, wie sicher es bezüglich dieses Bereichs ist.

  • Die Analogie: Stellen Sie sich vor, der Trainer hält ein Gummiband.
    • Die Mitte des Bandes: Dies ist die vorhergesagte Note (z. B. „Dieser Schritt sieht zu 70 % korrekt aus").
    • Die Spannung des Bandes: Dies ist die Zuverlässigkeit.
      • Straffes Band (Hohe Konfidenz): Der Trainer ist sich sehr sicher. Das Gummiband ist straff um die 70 %-Marke gespannt. Wenn Sie die Münze erneut werfen, wird sie wahrscheinlich nahe bei 70 % bleiben.
      • Loses Band (Niedrige Konfidenz): Der Trainer ist unsicher. Das Gummiband ist weit gedehnt und deckt alles von 40 % bis 90 % ab. Der Trainer sagt: „Ich denke, es sind 70 %, aber ich könnte völlig danebenliegen."

Indem es diese „Spannung" lernt (die die Studie Konzentration nennt), lernt das Modell zu sagen: „Ich bin bei diesem Schritt zuversichtlich" oder „Ich rate hier nur, also vertrauen Sie mir nicht zu sehr."

3. Wie es lernt: Das „Monte-Carlo"-Training

Wie lernt der Trainer, ehrlich zu sein?

  • Die Studie verwendet eine Methode namens Monte-Carlo-Fortsetzungen. Stellen Sie sich vor, die KI versucht, ein Problem zu lösen, hält bei Schritt 3 an und versucht dann, das Problem von genau diesem Punkt aus 16 verschiedene Male zu Ende zu führen.
  • Einige dieser 16 Versuche gelingen; einige scheitern.
  • Alter Trainer: Betrachtet die 16 Versuche, zählt die Erfolge (sagen wir, 10) und merkt sich „10/16 = 0,625" als absolute Wahrheit.
  • BETAPRM: Betrachtet die 16 Versuche und denkt: „Okay, ich habe 10 Erfolge gesehen. Das ist ein gutes Zeichen, aber da ich nur 16 Versuche gesehen habe, gibt es viel Zufall. Ich sollte mein Gummiband locker halten, um dieses Rauschen zu berücksichtigen."

Es verwendet ein mathematisches Werkzeug namens Beta-Binomial-Verteilung, um dieses Gleichgewicht zwischen der Note und der Unsicherheit zu erlernen.

4. Die Superkraft: Adaptive Berechnung (ACA)

Die Studie stellt eine neue Art vor, diesen „ehrlichen Trainer" einzusetzen, genannt Adaptive Computation Allocation (ACA).

Stellen Sie sich dies wie ein Budget für eine Roadtrip vor. Sie haben eine feste Menge an Benzin (oder Geld), um die beste Route zu finden.

  • Der alte Weg (Festes Budget): Sie schicken 16 verschiedene Autos los, um die beste Route zu finden, egal was passiert. Selbst wenn Auto #1 nach der ersten Meile klar der Gewinner ist, schicken Sie trotzdem die anderen 15 Autos los, nur um auf der sicheren Seite zu sein. Das verschwendet Benzin.
  • Der neue Weg (ACA):
    1. Sie schicken eine kleine Gruppe von Autos los (sagen wir, 4).
    2. Sie prüfen den „ehrlichen Trainer" (BETAPRM).
    3. Szenario A (Hohe Konfidenz): Der Trainer sagt: „Auto #1 ist der Gewinner, und ich bin sehr zuversichtlich (straffes Gummiband), dass kein anderes Auto es schlagen kann."
      • Aktion: Sofort stoppen! Benzin sparen. Sie müssen die anderen 12 Autos nicht loschicken.
    4. Szenario B (Niedrige Konfidenz): Der Trainer sagt: „Auto #1 sieht gut aus, aber mein Gummiband ist locker. Ich bin mir nicht sicher, ob Auto #2 oder #3 tatsächlich besser sein könnten."
      • Aktion: Nicht stoppen. Schicken Sie mehr Autos los, um die unsicheren Pfade zu erkunden.

Die Ergebnisse

Die Studie testete dies an vier verschiedenen KI-Modellen und vier mathematischen Benchmarks.

  • Bessere Auswahl: Indem es den „straffen Gummiband"-Noten mehr vertraut, wählte die KI häufiger die richtigen Antworten als die alte Methode.
  • Benzin sparen: Die neue Methode (ACA) sparte bis zu 33,57 % der für die Problemlösung benötigten Rechenleistung (Tokens). Sie hörte auf, Zeit bei Problemen zu verschwenden, bei denen die Antwort bereits offensichtlich war, und verbrachte nur dann zusätzliche Zeit, wenn sie tatsächlich unsicher war.

Zusammenfassung

BETAPRM ist ein klügerer Trainer, der nicht nur eine Note gibt; er sagt Ihnen, wie sehr Sie dieser Note vertrauen sollten. Indem es weiß, wann es nur rät, kann die KI aufhören, Energie bei einfachen Problemen zu verschwenden, und konzentriert ihre Rechenkraft nur auf die schwierigen, unsicheren.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →