SRPO: Setwise Relative Policy Optimization for Multi-Agent LLMs
Das Paper stellt SRPO (Setwise Relative Policy Optimization) vor, ein neuartiges Reinforcement-Learning-Framework für Multi-Agenten-LLMs, das Arbeitsteilung und gemeinsame Koevolution vereint, indem es die minimale Menge an Outputs, die in einem einzelnen Zustandsübergang konsumiert werden, als eine einheitliche Aktion behandelt und dadurch ein stabiles sowie effektives Training über verschiedene Workflows und Modellskalen hinweg ermöglicht.
Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen
In der sich rasant entwickelnden Welt der künstlichen Intelligenz haben große Sprachmodelle gelernt, als Agenten zu agieren, die in der Lage sind zu schlussfolgern, nach Informationen zu suchen und Werkzeuge zu nutzen, um komplexe Probleme zu lösen. Wenn diese Modelle alleine arbeiten, folgen sie einem einzelnen Gedankenpfad. Um jedoch schwierigere Herausforderungen zu bewältigen, setzen Forscher oft mehrere Agenten ein, die zusammenarbeiten, ähnlich wie ein Team von Spezialisten. Manchmal teilen diese Teams eine Aufgabe so auf, dass jedes Mitglied eine spezifische Rolle übernimmt, während sie zu anderen Zeiten gleichzeitig mehrere verschiedene Ideen generieren, um gemeinsam eine Lösung zu verfeinern. Die zentrale Schwierigkeit beim Training solcher Teams bestand darin, herauszufinden, wie man sie belohnt. Traditionelle Methoden behandeln die Ausgabe jedes Agenten oft als ein separates Ereignis, selbst wenn mehrere Agenten zusammenarbeiten, um ein einziges Ergebnis zu erzeugen. Dies schafft ein Missverhältnis: Das System lernt aus den einzelnen Teilen des Puzzles statt aus dem Gesamtbild, das sie gemeinsam bilden, was es schwierig macht, Teams zu trainieren, die zwischen dem Arbeiten allein und dem gemeinsamen Arbeiten wechseln.
Ein Team von Forschern hat dieses Missverhältnis adressiert, indem es eine neue Trainingsmethode namens Setwise Relative Policy Optimization, oder SRPO, vorgeschlagen hat. Anstatt sich auf einzelne Antworten zu konzentrieren, betrachtet dieser Ansatz die gesamte Gruppe von Ausgaben, die eine Veränderung in der Umgebung bewirken, als eine einzige Aktionseinheit. Stellen Sie sich ein Team von Entdeckern vor, das an einer Weggabelung steht; ob eine Person einen Pfad wählt oder die ganze Gruppe debattiert und dann gemeinsam eine Route aussucht, die Entscheidung, die sie voranbringt, ist das kollektive Ergebnis. Die Forscher fanden heraus, dass sie das System durch die Gruppierung dieser Ausgaben in das, was sie ein „aktives Set“ nennen, trainieren konnten, um zu verstehen, dass die gemeinsame Anstrengung des Teams die wahre Aktion ist. Diese Methode ermöglicht es, dass dieselben Trainingsregeln gelten, egal ob das Team in einer strikten Arbeitsteilung arbeitet, bei der eine Person eine Sache erledigt, oder in einem Modus der gemeinsamen Koevolution, bei dem mehrere Personen gleichzeitig zu einer gemeinsamen Idee beitragen.
Die Forscher testeten diese Idee an zwei sehr unterschiedlichen Arten von Aufgaben: dem Lösen schwieriger mathematischer Probleme und der Durchführung von Multi-Turn-Suchen, um spezifische Fakten zu finden. In den Mathe-Experimenten musste das System Kandidatenlösungen generieren und diese dann verifizieren, ein Prozess, der manchmal erforderte, dass ein Agent löst und ein anderer prüft, und manchmal erforderte, dass mehrere Agenten gleichzeitig verschiedene Herleitungen vorschlagen. In den Such-Experimenten musste das System entscheiden, wann es nach weiteren Informationen fragen muss, wobei mehrere Agenten potenziell gleichzeitig Suchanfragen stellen, bevor ein Aggregator die Ergebnisse kombiniert. Über vier verschiedene Größen von Sprachmodellen hinweg übertraf die neue Methode bestehende Ansätze konsequent. Bei den mathematischen Benchmarks erreichte das System eine durchschnittliche Genauigkeit, bei der etwa 61 bis 62 Prozent seiner generierten Lösungen korrekt waren, und es fand mindestens eine richtige Antwort für etwa 78 Prozent der Probleme. In den Suchaufgaben war die Verbesserung noch ausgeprägter, wobei die neue Methode im Durchschnitt korrekte Antworten für über 60 Prozent der Anfragen fand, was ein signifikanter Sprung gegenüber bisherigen Methoden war.
Ein wesentlicher Teil der Entdeckung war das Verständnis, wie man die Beiträge mehrerer Agenten ausbalanciert. Wenn das System einfach die Änderungen jedes Agenten aufsummieren würde, würde ein größeres Team aufgrund der schieren Anzahl der Stimmen einen viel größeren Einfluss erscheinen lassen als ein kleineres Team. Die Forscher lösten dies durch die Normalisierung des Beitrags der Gruppe, um sicherzustellen, dass ein Team von fünf Agenten nicht unfair gegenüber einem einzelnen Agenten gewichtet wird, nur weil es größer ist. Sie zeigten auch, dass das System lernen kann, dynamisch zwischen diesen Modi zu wechseln. In einigen Fällen lernte das System, dass ein einzelner spezialisierter Agent die beste Wahl war, während es in anderen Fällen eine kleine Gruppe von Agenten aktivierte, um zusammenzuarbeiten. Diese Flexibilität bedeutete, dass der Trainingsprozess nicht für unterschiedliche Teamstrukturen umgeschrieben werden musste; dieselbe zugrunde liegende Logik handhabte beide Szenarien nahtlos.
Die Studie untersuchte auch genau die Kosten dieser Verbesserungen. Die Forscher achteten sorgfältig darauf, dass die besseren Ergebnisse nicht einfach daher kamen, dass die neue Methode mehr Text generierte oder mehr Rechenleistung verwendete. Sie maßen die Anzahl der generierten Token und die Anzahl der Tool-Aufrufe und fanden heraus, dass die Verbesserungen von besserer Koordination stammten und nicht von roher Gewalt. Tatsächlich führte der Trainingsprozess oft zu kürzeren, effizienteren Antworten im Laufe der Zeit. Die Forscher merkten an, dass die Ergebnisse zwar stark waren, aber auf spezifischen Benchmarks und Vergleichen mit anderen veröffentlichten Methoden basierten und zukünftige Arbeiten untersuchen müssten, wie sich diese Gewinne in realen, langfristigen Einsätzen behaupten. Dennoch bleibt die Kernbotschaft bestehen: Indem man den kollektiven Output des Teams als die fundamentale Einheit der Aktion definiert, ist es möglich, Multi-Agenten-Systeme zu trainieren, die stabiler, effizienter und effektiver bei der Lösung komplexer Probleme sind, unabhängig davon, ob sie alleine oder zusammen arbeiten.
Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?
Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.