SRPO: Setwise Relative Policy Optimization for Multi-Agent LLMs
Het artikel introduceert SRPO (Setwise Relative Policy Optimization), een nieuw reinforcement learning-framework voor multi-agent LLM's dat arbeidsverdeling en gezamenlijke co-evolutie verenigt door de minimale verzameling outputs die in een enkele toestandsverandering worden geconsumeerd als één enkele actie te behandelen, waardoor stabiele en effectieve training mogelijk wordt over diverse workflows en modelschalen.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
In de snel evoluerende wereld van kunstmatige intelligentie hebben grote taalmodellen geleerd om als agenten te fungeren, in staat om te redeneren, naar informatie te zoeken en hulpmiddelen te gebruiken om complexe problemen op te lossen. Wanneer deze modellen alleen werken, volgen ze een enkel pad van gedachten. Echter, om moeilijkere uitdagingen aan te pakken, zetten onderzoekers vaak meerdere agenten in die samenwerken, vergelijkbaar met een team van specialisten. Soms verdelen deze teams een taak zodat elk lid een specifieke rol vervult, terwijl ze op andere momenten gelijktijdig verschillende ideeën genereren om samen een oplossing te verfijnen. De centrale moeilijkheid bij het trainen van dergelijke teams is geweest om uit te vogelen hoe ze een beloning moeten krijgen. Traditionele methoden behandelen de output van elke agent vaak als een afzonderlijke gebeurtenis, zelfs wanneer meerdere agenten samenwerken om één enkel resultaat te produceren. Dit creëert een mismatch: het systeem leert van individuele puzzelstukjes in plaats van van het volledige plaatje dat ze samen vormen, wat het moeilijk maakt om teams te trainen die schakelen tussen alleen werken en gezamenlijk werken.
Een team van onderzoekers heeft deze mismatch aangepakt door een nieuwe trainingsmethode voor te stellen genaamd Setwise Relative Policy Optimization, of SRPO. In plaats van naar individuele reacties te kijken, behandelt deze benadering de gehele groep outputs die een verandering in de omgeving veroorzaken als een enkele eenheid van actie. Stel je een team ontdekkingsreizigers voor die een splitsing in de weg bereiken; of één persoon een pad kiest, of de hele groep debatteert en dan gezamenlijk een route kixt, de beslissing die hen vooruit helpt is het collectieve resultaat. De onderzoekers ontdekten dat door deze outputs te groeperen in wat zij een "actieve set" noemen, ze het systeem konden trainen om te begrijpen dat de gezamenlijke inspanning van het team de werkelijke actie is. Deze methode stelt de regels van het trainen in staat om van toepassing te zijn, of het team nu werkt in een strikte taakverdeling, waarbij één persoon één ding doet, of in een modus van gezamenlijke co-evolutie, waarbij meerdere mensen tegelijkertijd bijdragen aan een gedeeld idee.
De onderzoekers testten dit idee op twee zeer verschillende soorten taken: het oplossen van moeilijke wiskundige problemen en het uitvoeren van meerzaal-zoekopdrachten om specifieke feiten te vinden. In de wiskunde-experimenten moest het systeem kandidaat-oplossingen genereren en deze vervolgens verifiëren, een proces dat soms vereiste dat één agent oploste en een andere controleerde, en op andere tijden vereiste dat meerdere agenten tegelijkert ofwel verschillende afleidingen voorstelden. In de zoekexperimenten moest het systeem beslissen wanneer er om meer informatie gevraagd moest worden, waarbij meerdere agenten mogelijk gelijktijdig zoekopdrachten uitstuurden voordat een aggregator de resultaten combineerde. Over vier verschillende formaten van taalmodellen heen presteerde de nieuwe methode consequent beter dan bestaande benaderingen. Op de wiskundige benchmarks bereikte het systeem een gemiddelde nauwkeurigheid waarbij ongeveer 61 tot 62 procent van de gegenereerde oplossingen correct was, en het vond minstens één correct antwoord voor ongeveer 78 procent van de problemen. In de zoektaken was de verbetering nog prominenter, waarbij de nieuwe methode voor meer dan 60 procent van de queries gemiddeld correcte antwoorden vond, een aanzienlijke sprong ten opzichte van eerdere methoden.
Een essentieel onderdeel van de ontdekking was het begrijpen van hoe de bijdragen van meerdere agenten in balans te brengen. Als het systeem simpelweg de veranderingen die door elke agent zijn aangebracht bij elkaar optelt, zou een groter team een veel grotere impact lijken te hebben dan een kleiner team, simpelweg omdat er meer stemmen zijn. De onderzoekers losten dit op door de bijdrage van de groep te normaliseren, waardoor werd gewaarborgd dat een team van vijf agenten niet onrechtvaardig zwaarder werd gewogen dan een enkele agent, enkel vanwege de grootte ervan. Ze toonden ook aan dat het systeem kon leren om dynamisch tussen deze modi te schakelen. In sommige gevallen leerde het systeem dat een enkele gespecialiseerde agent de beste keuze was, terwijl het in andere gevallen een kleine groep agenten activeerde om samen te werken. Deze flexibiliteit betekende dat het trainingsproces niet opnieuw geschreven hoefde te worden voor verschillende teamstructuren; dezelfde onderliggende logica handelde beide scenario's naadloos af.
De studie bekeek ook nauwgezet de kosten van deze verbeteringen. De onderzoekers waren voorzichtig om ervoor te zorgen dat de betere resultaten niet simpelweg voortkwamen uit het feit dat de nieuwe methode meer tekst genereerde of meer rekenkracht gebruikte. Ze maten het aantal gegenereerde tokens en het aantal tool-aanroepen, en vonden dat de verbeteringen voortkwamen uit betere coördinatie in plaats uit brute kracht. Sterker nog, het trainingsproces leidde vaak tot kortere, efficiëntere reacties in de loop van de tijd. De onderzoekers merkten op dat hoewel de resultaten sterk waren, deze gebaseerd waren op specifieke benchmarks en vergelijkingen met andere gepubliceerde methoden, en dat toekomstig werk zou moeten onderzoeken hoe deze winsten standhouden in real-world, langdurige implementaties. Desalniettemin staat de kernbevinding vast: door de collectieve output van het team te definiëren als de fundamentele eenheid van actie, is het mogelijk om multi-agent systemen te trainen die stabieler, efficiënter en effectiever zijn in het oplossen van complexe problemen, ongeacht of ze alleen of samenwerken.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.