← Nieuwste papers
🤖 AI

Reward-Free Evolving Agents via Pairwise Validator

Dit artikel stelt een kosteneffectief zelfevoluerend agent-framework voor dat dure scalaire beloningssignalen vervangt door een bevroren LLM-gebaseerde paarwijze validator om de verbetering van de agent te sturen, waarmee competitieve prestaties worden bereikt over meerdere engines en substraten zonder dat gelabelde data of aanvullende training vereist is.

Oorspronkelijke auteurs: Minghao Liu, Yu Wang, Jiayun Wang, Wei Wei

Gepubliceerd 2026-07-17
📖 7 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Minghao Liu, Yu Wang, Jiayun Wang, Wei Wei

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je een wereld voor waarin computers niet alleen opdrachten opvolgen, maar ook daadwerkelijk leren om hun eigen instructies te schrijven. Dit is het domein van AI Agents, slimme programma's die complexe puzzels oplossen door ze op te delen in stappen, hulpmiddelen te gebruiken en over problemen na te denken. Normaal gesproken moeten mensen, om deze agents beter te maken, optreden als strikte coaches. Elke keer dat de agent een nieuwe manier van denken probeert, moet de coach het beoordelen met een specifieke score, zoals een leraar die een toets cijfer geeft. Maar hier komt de adder onder het gras: het maken van die perfecte toetsen en nakijkmodellen is ongelooflijk moeilijk, duur en vereist diepgaande menselijke expertise. Het is alsof je een robot probeert te leren koken door een handleiding van 100 pagina's te schrijven over hoe je precies een ui snijdt, om er vervolgens achter te komen dat je voor elke groente een nieuwe handleiding nodig hebt.

Maak kennis met het concept van Self-Evolving Agents. In plaats van te wachten tot een menselijke coach elke poging beoordeelt, proberen deze agents zichzelf te verbeteren in een lus: ze maken een kleine aanpassing, testen het, en als het er beter uitziet, houden ze het erbij. De grote vraag die wetenschappers zich hebben gesteld is: Kunnen we de dure menselijke beoordeling volledig overslaan? Wat als de agent simpelweg naar zijn "oude zelf" en zijn "nieuwe zelf" kan kijken en kan beslissen welke beter is, zonder een perfect cijfer nodig te hebben? Dit artikel duikt in die exacte vraag en stelt een slimme afkorting voor die het zware, dure beoordelingssysteem vervangt door een eenvoudige, snelle vergelijking.


Het Probleem: De Dure "Scorekaart"

Denk bij het bouwen van een superintelligente AI-agent aan het trainen van een hond om trucjes te doen. Op de oude manier moet er elke keer dat de hond een nieuwe beweging probeert, een menselijke trainer tussenbeide komen, nauwlettend kijken en een precieze score geven: "Dat was een 7,5 van de 10." Om een betrouwbare score te krijgen, heeft de trainer een enorme bibliotheek aan perfecte voorbeelden nodig om mee te vergelijken. Voor AI wordt deze "scorekaart" een scalar reward genoemd. Het is een enkel getal dat de agent vertelt hoe goed hij het heeft gedaan.

Het probleem is dat het maken van deze scorekaart een nachtmerrie is. Het vereist het inhuren van experts, het labelen van duizenden voorbeelden en het kost een fortuin. Soms is de taak zo vreemd of complex dat mensen het zelfs niet met elkaar eens kunnen worden over hoe een "goede" score eruitz ziet. Het is als het proberen te beoordelen van een schilderij van een droom: er is geen juist antwoord, dus het geven van een cijfer is onmogelijk.

De Oplossing: Het "Wie is Beter?" Spel

De auteurs van dit artikel, Minghao Liu en zijn team, stelden een simpele vraag: Wat als we stoppen met vragen "Hoe goed is dit?" en beginnen met vragen "Welke is beter?"

In plaats van een mens (of een complexe computer) te laten proberen een moeilijk getal toe te kennen aan een enkele poging, introduceerden ze een Pairwise Validator. Stel je twee deelnemers voor in een boksring: de "Parent" (de huidige versie van de agent) en de "Child" (de nieuwe, aangepaste versie). Een bevroren, vooraf getraind Large Language Model (LLM) fungeert als scheidsrechter. Het hoeft niet de exacte score te weten; het kijkt er gewoon naar en zegt: "Ik denk dat de Child beter is," of "De Parent wint."

Dit is veel makkelijker voor de AI-scheidsrechter. Het is also wordt gevraagd aan een vriend: "Heb je liever chocolade of vanille?" in plaats van te vragen om beide smaken op een schaal van 1 tot 100 te beoordelen met perfecte precisie. Het artikel laat zien dat dit "Wie is Beter?" spel veel stabieler is en geen extra training vereist voor de scheidsrechter.

De Twee Nieuwe Playbooks

Het team testte dit idee op twee verschillende manieren en creëerde zo twee nieuwe "playbooks" voor de agents:

  1. Adaptive Focus: Dit is de "Slimme Coach"-aanpak. De agent gebruikt nog steeds een kleine set door mensen beoordeelde voorbeelden om te kiezen welke versie de "parent" wordt voor de volgende ronde. Echter, op het moment dat beslist wordt of een nieuwe verandering wordt geaccepteerd, slaat hij de dure scorecard over en gebruikt hij simpelweg de "Wie is Beter?" scheidsrechter. Het is een hybride die geld bespaart op de dagelijkse beslissingen, maar de menselijke veiligheidsnet behoudt voor de lange termijn.
  2. Soft Elo: Dit is de "Pure Tournament"-aanpak. Hierbij gooit de agent de menselijke scorecard volledig weg. De agent gebruikt de "Wie is Beter?"-oordelen van de scheidsrechter om een ratingsysteem te draaien (vergelijkbaar met hoe schakers gerangschikt worden). Als de Child wint van de Parent, krijgt de Child een ratingboost. Na verloop van tijd evolueert de agent puur op basis van deze directe confrontaties, zonder ooit een mens nodig te hebben om een getal toe te kennen.

De Resultaten: Werkt het?

Het team heeft deze methoden getest bij een verscheidenheid aan uitdagingen, van het beantwoorden van lastige trivia-vragen en het oplossen van wiskundige problemen tot het schrijven van code die gegevens organiseert. Ze vergeleken deze nieuwe "Pairwise"-methoden met de oude "Full-Reward"-methoden (de dure, door mensen beoordeelde manier).

De bevindingen waren verrassend sterk. In de meeste tests presteerden de agents die de "Wie is Beter?"-scheidsrechter gebruikten net zo goed als, of zelfs beter dan, de agents die de dure menselijke scorekaarten gebruikten.

  • Voor Trivia en Instructies: Bij taken zoals het beantwoorden van vragen uit een reeks documenten, hielp de "Soft Elo"-methode de agent zelfs beter te generaliseren, wat betekent dat hij niet alleen de oefenvragen uit het hoofd leerde, maar de werkelijke logica begreep.
  • Voor Wiskunde: Zelfs bij moeilijke wiskundige problemen slaagden de nieuwe methoden erin evenveel problemen op te lossen als de oude methoden, wat bewijst dat je geen perfecte score nodig hebt om een goede oplossing te vinden.
  • Voor Code: Bij het evolueren van computerprogramma's werkte de pairwise gate net zo goed als de full-reward baseline, waardoor de code succesvol efficiënter werd gemaakt.

De Kanttekening en de Toekomst

Het artikel merkt voorzichtig op dat dit geen toverstaf is voor elke situatie. De methode werkt het best wanneer er nog ruimte is voor de agent om te verbeteren. Als de agent al op het toppunt van zijn kunnen is, of als de scheidsrechter (de LLM) in de war is door de taak, kan het systeem vastlopen. Ook, als de "test" te klein is (zoals een wiskundetoets met slechts 15 vragen), kunnen de resultaten wat ruizig ogen, net zoals het een paar keer opwerpen van een muntje niet vertelt of de munt eerlijk is.

De kernontdekking is echter een game-changer: Je hebt geen perfecte, dure scorecard nodig om een slimme AI te laten evolueren. Door simpelweg een bevroren AI-scheidsrechter te vragen om twee versies te vergelijken en de winnaar aan te wijzen, kunnen we zelfverbeterende agents bouwen die net zo bekwaam zijn als de agents die we met menselijke experts bouwen, maar dan zonder de enorme kosten en inspanning van het labelen van data. Het is een verschuiving van "elk examen beoordelen" naar "gewoon de beste essay kiezen", en het blijkt dat dat genoeg is om een machine te leren hoe hij moet denken.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →