← Nieuwste papers
🤖 AI

MASPRM: Multi-Agent System Process Reward Model

Het artikel introduceert MASPRM, een multi-agent systeem procesbeloningsmodel getraind op terminale uitkomsten om tussenliggende agentberichten te scoren, wat de zoekprestaties tijdens de inferentie op redeneerbenchmarks aanzienlijk verbetert vergeleken met bestaande modellen door effectievere stapniveau beam search en Monte Carlo Tree Search mogelijk te maken.

Oorspronkelijke auteurs: Milad Yazdani, Mahdi Mostajabdaveh, Zirui Zhou, Ying Xiong

Gepubliceerd 2026-07-16
📖 7 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Milad Yazdani, Mahdi Mostajabdaveh, Zirui Zhou, Ying Xiong

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een echt lastige puzzel probeert op te lossen, zoals een complex wiskundig probleem of een logische raadsel. In de wereld van kunstmatige intelligentie hebben we "Large Language Models" (LLM's) die lijken op superintelligente, maar soms wat chaotische studenten. Als je hen een moeilijke vraag stelt, proberen ze het vaak in één keer te beantwoorden, maar ze raken vaak gestrand of maken een fout in een vroeg stadium en gaan dan de verkeerde weg verder in. Om dit te oplossen, zijn wetenschappers "Multi-Agent Systems" gaan gebruiken. Denk hierbij niet aan één student die alleen werkt, maar aan een studiegroep. Je hebt een "Lezer" die de vraag leest, een "Planner" die een strategie maakt, een "Oplosser" die de wiskunde doet, en een "Verifieerder" die het werk controleert. Ze geven briefjes aan elkaar in een specifieke volgorde.

Echter, er is een addertje onder het gras. Als je deze studiegroep ongecontroleerd laat rondgaan, verspillen ze veel tijd en energie (rekenkracht) door te discussiëren over ideeën die al fout zijn. Het is als een groep vrienden die een mysterie probeert op te lossen, maar ze blijven achter een dwaalspoor aanrennen omdat niemand even stop zegt: "Wacht, dit aanwijzing klopt niet." Om deze verspilling te stoppen, gebruiken onderzoekers "zoekalgoritmen" zoals Monte Carlo Tree Search (MCTS). Dit is als een coach die zegt: "Laten we vijf verschillende paden voor de volgende stap proberen, kijken welke het meest veelbelovend lijkt, en ons daar vervolgens op concentragen." Maar hier is het grote probleem: hoe weet de coach welk pad veelbelovend is? Meestal weet de coach pas of het is als het eindantwoord goed of fout is. De coach weet niet of de tussenstappen goed waren. Dit artikel introduceert een nieuw hulpmiddel om de coach te helpen betere beslissingen te nemen, midden in het spel.

Het Papier: MASPRM

De onderzoekers achter dit papier, van de University of British Columbia en Huawei, pakken precies dat probleem aan. Ze hebben iets gecreëerd dat MASPRM (Multi-Agent System Process Reward Model) wordt genoemd. Je kunt MASPRM zien als een "Supercoach" of een "Procesrechter" die niet alleen wacht op het eindantwoord om te zien of de groep geslaagd is. In plaats daarvan kijkt het de conversatie van de studiegroep tijdens het proces na en scoort het elke enkele boodschap die ze naar elkaar sturen.

In het verleden, als een AI-team een fout maakte in stap 3, wist het systeem dat pas aan het einde wanneer het eindantwoord fout was. Tegen die tijd had de AI al een enorme hoeveelheid energie verspild aan het verkennen van dat slechte pad. MASPRM verandert het spel. Het kijkt naar het "gerouteerde transcript" – wat een chique woord is voor de geordende lijst met berichten die de agenten naar elkaar hebben gestuurd. Het scoort deze berichten om te zeggen: "Hé, dit specifieke bericht van de Planner was een geweldig idee, laten we doorgaan," of "Dit bericht van de Oplosser leidt ons nergens heen, laten we die tak onmiddellijk afsnijden."

Hoe ze de Coach hebben geleerd

Een van de coolste onderdelen van dit papier is hoe ze deze Supercoach hebben getraind. Normaal gesproken, om een computer te leren stappen te beoordelen, heb je een mens nodig die daar zit en elke stap als "goed" of "bad" labelt. Dat is ongelooflijk duur en traag. De auteurs vonden een slimme afkorting. Ze lieten de AI-agenten duizenden simulaties draaien met een zoekmethode genaamd MCTS. In deze simulaties verkenden de agenten vele paden. Aan het einde van elk pad wisten ze of het antwoord juist (+1) of onjuist (-1) was.

Vervolgens gebruikten ze een wiskundige truc genaamd "backpropagation". Stel je een boom voor waarbij de bladeren de eindresultaten zijn. Als een blad een "winst" is, vloeit de waarde van die winst terug omhoog langs de takken, waardoor de eerdere stappen waardevol lijken. Als een blad een "verlies" is, vloeit de waarde terug omhoog als een negatief. MASPRM leerde deze waarden te voorspellen door simpelweg naar de geschiedenis van de conversatie te kijken, zonder dat er ooit een mens aan te pas kwam om te zeggen: "Deze stap was goed." Het leerde het verschil te herkennen tussen een veelbelovende conversatie en een doodlopende discussie, puur door te zien welke uiteindelijk tot het juiste antwoord leidden.

Wat ze vonden

Het team heeft deze nieuwe coach getest op vier beroemde benchmarks: GSM8K en MATH (voor wiskundevragen), en MMLU en LOGIQA (voor algemene kennis en logica). Ze vergeleken MASPRM met twee andere methoden:

  1. Policy Likelihood: Dit is alsover de AI gewoon gokt: "Ik denk dat het volgende woord waarschijnlijk is," zonder echt begrip van het doel.
  2. ORM (Outcome Reward Model): Dit is de ouderwetse coach die alleen het eindantwoord controleert en de stappen daartussen negeert.

De resultaten waren heel duidelijk. Wanneer de onderzoekers MASPRM gebruikten om de zoektocht te sturen (specifiek met MCTS en een methode genaamd Step-Level Beam Search), werd de AI aanzienlijk beter in het oplossen van problemen.

  • Op het 1,5 miljard parameter model (een kleiner, sneller AI), verbeterde MASPRM het succespercentage met 2,0 tot 3,0 punten vergeleken met het oude Outcome Reward Model.
  • Op het 7 miljard parameter model (een grotere, slimmere AI), was de verbetering enorm, met een sprong van 4,1 tot 14,5 punten.
  • In de moeilijkste test (GSM8K), bereikte de combinatie van het 7B model en MASPRM een Hit@1 van 82,9%, wat betekent dat het bijna 83% van de tijd het juiste antwoord bij de eerste poging vond.

Het artikel suggereert dat MASPRM vooral goed is in "stapgewijze zoektocht" (stepwise search). Dit is wanneer de AI een reeks beslissingen moet nemen, zoals kiezen welke agent als volgende spreekt of wat de volgende zin moet zijn. Omdat MASPRM deze tussenliggende stappen kan beoordelen, voorkomt het dat de AI tijd verspilt aan slechte ideeën. Het maakte de keuzes van de AI ook betrouwbaarder; de kloof tussen de "beste" gok en de "vijfde beste" gok kromp, wat betekende dat de AI meer vertrouwen had in zijn topkeuzes.

De Limieten en de Toekomst

De auteurs merken er voorzichtig bij op dat dit geen toverstaf is die alles oplost. Hun systeem werkt het best wanneer de agenten een vast schema hebben (zoals een strikte volgorde van wie wanneer spreekt) en wanneer het eindantwoord duidelijk gecontroleerd kan worden (zoals een wiskundeprobleem met een specifiek getal). Ze geven toe dat voor open eind taken waar geen enkel "correct" antwoord is, of voor systemen waarbij de agenten hun rollen dynamisch ter plekke veranderen, deze methode nog in ontwikkeling is. Ze ontdekten ook dat als de coach alleen ziet wat één agent ziet (in plaats van de hele conversatie van de groep), het minder goed werkt, wat suggereert dat het hebben van een "globaal overzicht" van de chat van het team cruciaal is voor de beste prestaties.

Kortom, MASPRM is een doorbraak in het leren aan AI-teams hoe ze zichzelf in realtime kunnen corrigeren. In plaats van te wachten tot het einde om te beseffen dat ze fout zaten, hebben ze nu een coach die een slecht pad vroegtijdig kan herkennen en het team weer op het juiste spoor kan zetten, wat tijd bespaart en betere resultaten oplevert. Het suggereert dat voor complexe redeneertaken het geheim niet alleen een groter brein is, maar een betere manier om het denkproces terwijl het gebeurt te begeleiden.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →