← Nieuwste papers
💻 computer science

OpenReward: Learning to Reward Long-form Agentic Tasks via Reinforcement Learning

Dit artikel introduceert OpenRM, een met tools uitgebreid beloningsmodel dat is getraind via Group Relative Policy Optimization om externe bewijsvoering te benutten voor het nauwkeurig evalueren van langdurige agentische taken, waardoor de downstream LLM-alignement en evaluatieprestaties aanzienlijk worden verbeterd.

Oorspronkelijke auteurs: Ziyou Hu, Zhengliang Shi, Minghang Zhu, Haitao Li, Teng Sun, Pengjie Ren, Suzan Verberne, Zhaochun Ren

Gepubliceerd 2026-07-02
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Ziyou Hu, Zhengliang Shi, Minghang Zhu, Haitao Li, Teng Sun, Pengjie Ren, Suzan Verberne, Zhaochun Ren

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een zeer slimme bibliothecaris hebt (de AI) die geweldig is in het schrijven van lange, gedetailleerde rapporten. Maar soms verzint de bibliothecaris dingen of kloppen de feiten niet omdat hij alleen vertrouwt op wat er in zijn eigen hoofd zit, zonder de werkelijke boeken in de planken te controleren.

Om dit op te lossen, hebben we een Rechter nodig om de rapporten van de bibliothecaris te beoordelen. In het verleden waren deze Rechters als studenten die de hele bibliotheek uit hun hoofd moesten leren. Als de vraag over een specifiek, obscuur feit of een gloednieuwe medische ontdekking ging, gokten ze vaak fout omdat ze niet het juiste "boek" voor zich open hadden liggen.

OPENREWARD is een nieuw soort Rechter die niet alleen op geheugen vertrouwt. Het is als een Detective met een Magische Telefoon.

Zo werkt het, eenvoudig uitgelegd:

1. Het Probleisme: De "Alleen Geheugen" Rechter

Stel je voor dat je een Rechter vraagt om twee lange reisgidsen te vergelijken. De ene gids zegt: "Bezoek de Eiffeltoren in Parijs," en de andere zegt: "Bezoek de Eiffeltoren in Londen."

  • Oude Rechters: Zij zouden misschien gewoon gokken op basis van wat ze denken te weten. Als ze moe zijn of de vraag is lastig, kunnen ze er niet bij bedenken dat er geen Eiffeltoren in Londen staat.
  • Het Probleem: Voor lange, complexe antwoorden (zoals medisch advies of wetenschappelijk onderzoek) is gokken niet goed genoeg. Je hebt bewijs nodig.

2. De Oplossing: De "Detective" Rechter (OPENREWARD)

OPENREWARD is anders. Wanneer het twee antwoorden ziet, kiest het niet meteen één antwoord. In plaats daarvan zegt het: "Wacht, ik moet eerst de feiten controleren."

  • De Magische Telefoon (Tools): Het heeft een telefoon waarmee het direct Wikipedia kan oproepen, naar wetenschappelijke artikelen kan zoeken of medische databases kan raadplegen.
  • Het Onderzoek: Het gebruikt deze tools actief om bewijs te verzamelen. Het kan zoeken naar "Balanced Winnow classifier" of "medische symptomen" om te zien wat de werkelijke data zeggen.
  • Het Vonnis: Pas nadat het dit bewijs heeft verzameld, beslist het welk antwoord beter is. Het is als een rechter die weigert een vonnis te vellen totdat hij het werkelijke politierapport heeft gelezen.

3. Hoe we de Detective hebben opgeleid (Training)

Je kunt een computer niet simpelweg vertellen: "Ga een detective zijn." Je moet het leren hoe het zijn tools moet gebruiken zonder afgeleid te raken.

  • De "Nep" Bibliotheek: De onderzoekers konden niet genoeg echte voorbeelden vinden van "Goed Antwoord vs. Slecht Antwoord" voor deze complexe taken. Daarom bouwden ze een gesimuleerde bibliotheek.
    • Ze namen een echt document (zoals een Wikipedia-pagina).
    • Ze vroegen een AI om een vraag over dit document te schrijven.
    • Daarna vroegen ze de AI om twee antwoorden te schrijven:
      1. Het Goede Antwoord: De AI mocht het document lezen.
      2. Het Slechte Antwoord: De AI mocht het document niet lezen (zodat de AI moest gokken of hallucineren).
  • De Les: Ze lieten de Detective Rechter deze paren (Goed vs. Slecht) zien en leerden het: "Als je je telefoon gebruikt om de feiten te controleren, krijg je een gouden ster. Als je gewoon gokt, krijg je een strafpunt."
  • Het Beloningssysteem: De Rechter leerde dat hij, om de beste score te krijgen, zijn tools correct moet gebruiken om de waarheid te vinden, in plaats van een snelle gok te wagen.

4. De Resultaten: Waarom het ertoe doet

De onderzoekers testten deze nieuwe Detective Rechter tegen andere beroemde Rechters (zoals GPT-4 of gespecialiseerde AI-rechters).

  • Betere Nauwkeurigheid: OPENREWARD was veel beter in het opsporen van de waarheid in lange, complexe antwoorden, vooral in de wetenschap, geneeskunde en algemene kennis.
  • Betere Docent: Ze gebruikten OPENREWARD ook om andere AI's te helpen trainen. Door OPENREWARD te gebruiken om de beste antwoorden uit een berg rommelige data te selecteren, creëerden ze een "schoner" tekstboek voor andere AI's om van te leren. De AI's die getraind werden met deze "schone" data werden slimmer en betrouwbaarder.

Samenvattende Analogie

Denk aan de oude AI-rechters als studenten die een toets maken zonder studieboeken toegestaan. Ze moeten gokken.
OPENREWARD is een student die toegestaan is om de bibliotheek en het internet te gebruiken tijdens de toets. Omdat het de antwoorden kan opzoeken, haalt het een veel hogere score en helpt het de hele klas beter te leren.

Het artikel beweert dat deze methode de evaluatie van AI betrouwbaarder maakt voor complexe taken en helpt bij het trainen van betere AI-modellen, maar het stelt zich niet op als klaar voor klinische diagnoses in de echte wereld of andere specifieke toekomstige toepassingen buiten wat in de studie is getest.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →