← Nieuwste papers
🤖 machine learning

Stronger-MAS: Multi-Agent Reinforcement Learning for Collaborative LLMs

Het artikel stelt AT-GRPO voor, een nieuw multi-agent reinforcement learning-framework dat een agent- en beurt-gebaseerd gegroepeerd optimalisatiealgoritme en een flexibel trainingssysteem introduceert om de beperkingen van standaard on-policy RL in collaboratieve LLM's te overwinnen, waarbij aanzienlijke prestatiewinsten worden behaald over planning-, programmeer- en wiskundetaken.

Oorspronkelijke auteurs: Yujie Zhao, Lanxiang Hu, Yang Wang, Minmin Hou, Hao Zhang, Ke Ding, Jishen Zhao

Gepubliceerd 2026-02-02
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Yujie Zhao, Lanxiang Hu, Yang Wang, Minmin Hou, Hao Zhang, Ke Ding, Jishen Zhao

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Het Grote Idee: Een Team Leren Samenwerken

Stel je voor dat je een zeer slimme maar ietwat onhandige robot hebt (een Large Language Model, of LLM). Je wilt dat deze robot complexe puzzels oplost, code schrijft of spelletjes speelt.

Er zijn twee belangrijke manieren waarop mensen meestal proberen deze robot beter te maken:

  1. Het "Specialisten"-team (Multi-Agent Systeem): Je geeft de robot een team van vrienden. Eén vriend is de "Coder", een ander is de "Tester" en een derde is de "Planner". Zij praten met elkaar om het probleem op te lossen. Dit werkt goed omdat ze specifieke taken hebben.
  2. De "Oefening Baart Perfectie"-methode (Reinforcement Learning): Je laat de robot proberen, falen, een score krijgen en het opnieuw proberen. Na verloop van tijd leert hij van zijn fouten om een meester in de taak te worden.

Het Probleem: Tot nu toe kwamen deze twee methoden niet goed samen.

  • Als je probeert de hele groep te onderwijzen met de "Oefen"-methode, wordt de training rommelig. De "Coder" en de "Tester" praten met elkaar, dus hun prompts (instructies) veranderen constant. Standaard trainingsmethoden raken in de war omdat ze verwachten dat iedereen op exact hetzelfde moment op exact dezelfde vraag antwoordt.
  • Als je ze alleen maar laat oefenen op hun eigen taken, leren ze niet hoe ze effectief moeten samenwerken.

De Oplossing: De auteurs creëerden STRONGER-MAS (specifiek een algoritme genaamd AT-GRPO). Zie dit als een nieuwe, superintelligente coach die weet hoe hij een heel team van specialisten tegelijkertijd kan trainen.


Hoe het Werkt: De "Boom"-analogie

1. De Oude Manier (Parallel Sampling)

Stel je een coach voor die 4 verschillende studenten vraagt een wiskundeprobleem op te lossen.

  • Student A schrijft een oplossing.
  • Student B schrijft een oplossing.
  • Student C schrijft een oplossing.
  • Student D schrijft een oplossing.

De coach kijkt naar alle vier de antwoorden en zegt: "Oké, Student A heeft het beste gedaan."
De Fout: In een teamsetting is de volgende stap niet simpelweg "los het probleem opnieuw op." De volgende stap is: "Student A, hier is wat Student B schreef; verbeter nu je antwoord." De context verandert elke keer. Als je hen alleen de oorspronkelijke vraag opnieuw laat oplossen, train je hen niet om samen te werken.

2. De Nieuwe Manier (Tree-Structured Sampling)

De STRONGER-MAS coach gebruikt een Boom-aanpak.

  • Stap 1: Het team begint met een probleem.
  • Stap 2: De "Coder" probeert 4 verschillende manieren om de code te schrijven. De coach beoordeelt alle 4 direct.
  • Step 3: De coach kiest de beste van die 4 codes.
  • Stap 4: Nu ziet de "Tester" die specifieke beste code en probeert 4 verschillende manieren om deze te testen. De coach beoordeelt die 4.
  • Stap 5: De coach kiest de beste test, en de cyclus gaat door.

Waarom dit ertoe doet: Dit zorgt ervoor dat wanneer de coach de 4 pogingen van de "Coder" vergelijkt, ze allemaal reageren op de exacte zelfde situatie. Dit maakt het leren eerlijk en effectief. Het is als een coach die zegt: "Oké, iedereen, kijk naar dit specifieke concept. Hier zijn 4 manieren waarop je het kunt verbeteren. Laten we zien welke het beste werkt."


Het Debat: "Gespecialiseerd" versus "Gedeeld"

Het paper testte ook twee verschillende teamstructuren:

  1. Het "Gedeelde Brein" (Role-Sharing): Iedereen in het team gebruikt exact hetzelfde brein (hetzelfde AI-model). Ze doen alsof ze verschillende mensen zijn door verschillende instructiekaarten (prompts) te lezen.
    • Resultaat: Werkt geweldig voor eenvoudige spellen en planning.
  2. De "Gespecialiseerde Breinen" (Role-Specialized): De "Coder" heeft een brein dat specifiek is getraind voor coderen, en de "Tester" heeft een brein dat specifiek is getraind voor testen. Ze wisselen nooit van baan.
    • Resultaat: Dit was een grote winnaar voor coding en wiskunde. De "Coder" werd echt goed in het schrijven van code omdat hij alleen maar code oefende, en de "Tester" werd echt goed in het vinden van bugs.

De Kernboodschap: Het paper concludeerde dat je niet altijd een gespecialiseerd brein nodig hebt voor elke taak. Voor sommige taken (zoals eenvoudige spellen) is één slim brein dat door iedereen wordt gedeeld voldoende. Maar voor moeilijke taken (zoals het schrijven van complexe software) is het hebben van een toegewijde expert voor elke rol veel beter.


De Resultaten: Van "Oké" naar "Supermenselijk"

Het paper testte dit systeem op vier soorten taken: Games, Planning, Coding en Math.

  • Langetermijnplanning (De Grote Winst): Stel je een spel voor waarbij je 10 stappen vooruit moet plannen.

    • Voorheen: Een enkele robot die dit alleen probeerde, was slechts 14% tot 47% van de tijd correct. Hij raakte gemakkelijk de weg kwijt.
    • Nu: Met het STRONGER-MAS team haalden ze het in 96% tot 99,5% van de gevallen goed.
    • Analogie: Het is als de overgang van een verdwaalde toerist met een verkreukelde kaart naar een begeleide rondleiding waarbij iedereen precies weet waar hij heen moet.
  • Coding en Math: Het team werd ook aanzienlijk beter in het schrijven van foutvrije code en het oplossen van moeilijke wiskundeproblemen (verbeteringen van ongeveer 4% tot 18% ten opzichte van eerdere beste methoden).

Samenvatting

Het paper introduceert een nieuwe manier om AI-teams te trainen. In plaats van hen te trainen als individuen of als een verwarde groep, gebruiken ze een Tree-Structured methode die het gesprek binnen het team gefocust en eerlijk houdt. Dit stelt de AI in staat om samenwerking te leren, wat resulteert in enorme verbeteringen bij het oplossen van complexe, meerstaps-problemen zoals routeplanning, software schrijven en het oplossen van wiskundepuzzels.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →