← Nieuwste papers
💬 NLP

Agon: Competitive Cross-Model RL with Implicit Rival Grading of Reasoning

Agon introduceert een competitief cross-model reinforcement learning-framework waarbij twee modellen fungeren als wederzijdse beoordelaars door iteratief problemen tegen elkaar te ontwerpen en op te lossen, wat superieur redeneren impliciet beloont zonder proceslabels en standaard single-model RL-benaderingen op complexe redeneertaken aanzienlijk overtreft.

Oorspronkelijke auteurs: Vladislav Beliaev

Gepubliceerd 2026-07-09
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Vladislav Beliaev

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een student probeert te leren hoe hij extreem moeilijke wiskundeproblemen moet oplossen.

De Oude Manier: De "Alleen het Antwoord" Coach
De huidige standaardmethode (genaamd GRPO) is als een coach die alleen naar het uiteindelijke antwoord op de toets kijkt.

  • Als de student het goede antwoord heeft, krijgt hij een gouden ster.
  • Als hij het fout heeft, krijgt hij een rood kruis.
  • Het Probleid: De coach kijkt nooit naar hoe de student daar gekomen is. Als de student een essay van 10 pagina's vol verwarrend gegelul, gokwerk en achteruitgaan schrijft om vervolgens per ongeluk op het juiste antwoord te stuiten, krijgt hij nog steeds de gouden ster.
  • Het Resultaat: De student leert om meer woorden te schrijven, niet om beter na te denken. Ze beginnen hun pagina's te vullen met "Hmm, laat me eens nadenken..." en "Wacht, misschien wel..." om hun kansen op een gelukkige gok te vergroten. Ze worden weldooraderig, maar niet noodzakelijkerwijs slimmer.

De Nieuwe Manier: Agon (De "Debatclub")
Het paper introduceert een nieuwe methode genaamd Agon (Grieks voor "strijd"). In plaats van één student die alleen werkt, brengt Agon twee studenten in een kamer om samen hetzelfde probleem op te lossen, maar met een twist: ze concurreren met elkaar om te zien wie de ander intellectueel kan overtreffen.

Zo werkt het "Agon"-spel:

  1. De Draft: Student A probeert het probleem eerst op te lossen. Ze schrijven hun redenering en een samenvatting van hun stappen op (maar verbergen het uiteindelijke antwoord).
  2. De Uitdaging: Student B leest de samenvatting van Student A. Het doel van Student B is om het probleem beter op te lossen dan Student A.
    • Als Student A een fout maakt (zoals een fout in een teken of een vergelijking), ziet Student B dit, herstelt het, en krijgt het juiste antwoord. Student B wint.
    • Als Student A gelijk had, probeert Student B een kortere, schonere manier te vinden om het te bewijzen.
  3. De Wissel: In de volgende ronde wisselen ze van rol. Student B maakt de draft, en Student A daagt uit.

Waarom dit werkt (De Magie van "Rivalistische Beoordeling")
In de oude methode moest de student raden hoe "goed nadenken" eruitzag omdat niemand hem dat vertelde. In Agon doet de rivaal de beoordeling.

  • Impliciete Feedback: Als de redenering van Student A vol gaten zit, zal Student B hen gemakkelijk verslaan. Dit leert Student A dat "gezwets" en "opvulmateriaal" niet werken, omdat een slimme rivaal ze zal betrappen.
  • Geen Labels Nodig: We hebben geen menselijke docent nodig om te zeggen: "Deze stap was briljant, deze stap was opvulmateriaal." Het feit dat de ene student de ander heeft verslagen, is het bewijs dat de redenering beter was.
  • De "Wapenwedloop": Omdat beide studenten tegelijkertijd slimmer worden, stijgt de lat voortdurend. Student A kan niet meer simpelweg gokken; ze moeten echt goed redeneren om Student B te verslaan, die ook steeds slimmer wordt.

De Resultaten
De onderzoekers testten dit op zeer moeilijke wiskundeproblemen (met behulp van een model genaamd Qwen3).

  • Standaard Methode: Het model kreeg ongeveer 30% van de moeilijke problemen goed, maar schreef enorme, lange verklaringen om dit te bereiken.
  • Agon Methode: De twee concurrerende modellen kregen ongeveer 61% van de problemen goed.
  • Bonus: De verklaringen waren daadwerkelijk korter. Omdat de modellen met elkaar concurreerden om efficiënt te zijn en fouten op te sporen, stopten ze met het schrijven van onnodige onzin.

De "Twee-Fasen" Truc
Wanneer het systeem wordt gebruikt om daadwerkelijk een probleem voor een gebruiker op te lossen, werkt het als een estafette:

  1. Model A schrijft een conceptoplossing.
  2. Model B leest dat concept, controleert op fouten en schrijft het uiteindelijke antwoord.
    Dit gebeurt automatisch. Het paper laat zien dat het trainen van twee modellen die op deze manier tegen elkaar vechten, veel effectiever is dan het hebben van twee modellen die gewoon goed samenwerken (coöperatie) of één model dat probeert zijn eigen fouten te herstellen.

In een Notendop
Agon stopt AI-modellen met "kletsen" om geluk te hebben. In plaats daarvan dwingt het hen om scherp, beknopt en accuraat te zijn door ze tegenover een rivaal te plaatsen die constant op zoek is naar hun fouten. Het verandert het trainingsproces van een solo oefensessie in een hooggestoken debat waarbij de enige manier om te winnen is door helder te denken.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →