← Neueste Arbeiten
💻 computer science

OpenReward: Learning to Reward Long-form Agentic Tasks via Reinforcement Learning

Dieses Paper stellt OpenRM vor, ein werkzeugaugmentiertes Belohnungsmodell, das mittels Group Relative Policy Optimization trainiert wurde, um externe Evidenz zur präzisen Bewertung langgestreckter agentischer Aufgaben zu nutzen und dadurch die nachgelagerte LLM-Ausrichtung sowie die Evaluierungsleistung signifikant zu verbessern.

Ursprüngliche Autoren: Ziyou Hu, Zhengliang Shi, Minghang Zhu, Haitao Li, Teng Sun, Pengjie Ren, Suzan Verberne, Zhaochun Ren

Veröffentlicht 2026-07-02
📖 4 Min. Lesezeit☕ Kaffeepausen-Lektüre

Ursprüngliche Autoren: Ziyou Hu, Zhengliang Shi, Minghang Zhu, Haitao Li, Teng Sun, Pengjie Ren, Suzan Verberne, Zhaochun Ren

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich vor, Sie hätten einen sehr klugen Bibliothekar (die KI), der großartig darin ist, lange, detaillierte Berichte zu schreiben. Aber manchmal erfindet dieser Bibliothekar Dinge oder gibt falsche Fakten an, weil er sich nur auf das verlässt, was in seinem eigenen Kopf steckt, anstatt die tatsächlichen Bücher in den Regalen zu überprüfen.

Um dies zu beheben, benötigen wir einen Richter, der die Berichte des Bibliothekars bewertet. In der Vergangenheit waren diese Richter wie Schüler, die die ganze Bibliothek auswendig lernen mussten. Wenn die Frage über eine spezifische, obskure Tatsache oder eine brandneue medizinische Entdeckung lautete, rät der Richter oft falsch, weil er nicht das richtige „Buch“ vor sich liegen hatte.

OPENREWARD ist eine neue Art von Richter, der sich nicht nur auf sein Gedächtnis verlässt. Es ist wie ein Detektiv mit einem magischen Telefon.

So funktioniert es, einfach erklärt:

1. Das Problem: Der „Gedächtnis-basierte“ Richter

Stellen Sie sich vor, Sie bitten einen Richter, zwei lange Reiseführer zu vergleichen. Ein Reiseführer sagt: „Besuchen Sie den Eiffelturm in Paris“, und der andere sagt: „Besuchen Sie den Eiffelturm in London.“

  • Alte Richter: Sie würden vielleicht einfach raten, basierend auf dem, was sie zu wissen glauben. Wenn sie müde sind oder die Frage knifflig ist, scheitern sie vielleicht daran, zu erkennen, dass es keinen Eiffelturm in London gibt.
  • Das Problem: Für lange, komplexe Antworten (wie medizinische Ratschläge oder wissenschaftliche Forschung) reicht Raten nicht aus. Man braucht Beweise.

2. Die Lösung: Der „Detektiv“-Richter (OPENREWARD)

OPENREWARD ist anders. Wenn es zwei Antworten sieht, wählt es nicht sofort eine aus. Stattdessen sagt es: „Warte, ich muss zuerst die Fakten prüfen.“

  • Das magische Telefon (Werkzeuge): Es hat ein Telefon, mit dem es sofort Wikipedia anrufen, nach wissenschaftlichen Arbeiten suchen oder medizinische Datenbanken abfragen kann.
  • Die Untersuchung: Es nutzt diese Werkzeuge aktiv, um Beweise zu sammeln. Es könnte nach „Balanced Winnow classifier“ oder „medizinischen Symptomen“ suchen, um zu sehen, was die realen Daten sagen.
  • Das Urteil: Erst nachdem es diese Beweise gesammelt hat, entscheidet es, welche Antwort besser ist. Es ist wie ein Richter, der sich weigert, ein Urteil zu fällen, bis er den eigentlichen Polizeibericht gelesen hat.

3. Wie wir den Detektiven gelehrt haben (Training)

Man kann einem Computer nicht einfach sagen: „Geh und sei ein Detektiv.“ Man muss ihm beibringen, wie er seine Werkzeuge benutzt, ohne sich ablenken zu lassen.

  • Die „fiktive“ Bibliothek: Die Forscher konnten nicht genügend reale Beispiele für „Gute Antwort vs. Schlechte Antwort“ für diese komplexen Aufgaben finden. Also bauten sie eine simulierte Bibliothek.
    • Sie nahmen ein echtes Dokument (wie eine Wikipedia-Seite).
    • Sie ließen eine KI eine Frage dazu formulieren.
    • Dann ließen sie die KI zwei Antworten schreiben:
      1. Die gute Antwort: Die KI durfte das Dokument lesen.
      2. Die schlechte Antwort: Die KI durfte das Dokument nicht lesen (also musste sie raten oder halluzinieren).
  • Die Lektion: Sie zeigten dem Detektiv-Richter diese Paare (Gut vs. Schlecht) und lehrten ihn: „Wenn du dein Telefon benutzt, um die Fakten zu prüfen, bekommst du einen goldenen Stern. Wenn du nur rätst, bekommst du einen Punktabzug.“
  • Das Belohnungssystem: Der Richter lernte, dass er, um die beste Punktzahl zu erhalten, seine Werkzeuge korrekt nutzen muss, um die Wahrheit zu finden, anstatt eine schnelle Vermutung anzustellen.

4. Die Ergebnisse: Warum es wichtig ist

Die Forscher testeten diesen neuen Detektiv-Richter gegen andere berühmte Richter (wie GPT-4 oder spezialisierte KI-Richter).

  • Bessere Genauigkeit: OPENREWARD war viel besser darin, die Wahrheit in langen, komplexen Antworten zu erkennen, insbesondere in der Wissenschaft, Medizin und im allgemeinen Wissen.
  • Besserer Lehrer: Sie nutzten OPENREWARD auch, um andere KIs zu trainieren. Indem sie OPENREWARD nutzten, um die besten Antworten aus einem Haufen unordentlicher Daten auszuwählen, schufen sie ein „saubereres“ Lehrbuch für andere KIs. Die KIs, die mit diesen „sauberen“ Daten trainiert wurden, wurden intelligenter und zuverlässiger.

Zusammenfassende Analogie

Denken Sie an die alten KI-Richter als Schüler, die eine Prüfung ohne Lehrbücher ablegen dürfen. Sie müssen raten.
OPENREWARD ist ein Schüler, der erlaubt ist, die Bibliothek und das Internet während der Prüfung zu benutzen. Weil er die Antworten nachschlagen kann, erzielt er eine viel bessere Punktzahl und hilft der ganzen Klasse, besser zu lernen.

Das Paper behauptet, dass diese Methode die KI-Evaluierung für komplexe Aufgaben zuverlässiger macht und hilft, bessere KI-Modelle zu trainieren, kommt aber nicht dazu zu sagen, dass sie für reale klinische Diagnosen oder andere spezifische zukünftige Anwendungen über das in der Studie getestete Maß hinaus bereit ist.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →