SRPO: Setwise Relative Policy Optimization for Multi-Agent LLMs
Le document présente SRPO (Setwise Relative Policy Optimization), un nouveau cadre d'apprentissage par renforcement pour les LLM multi-agents qui unifie la division du travail et la coévolution conjointe en traitant l'ensemble minimal de sorties consommées lors d'une seule transition d'état comme une action unifiée, permettant ainsi un entraînement stable et efficace à travers divers flux de travail et échelles de modèles.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Dans le monde en évolution rapide de l'intelligence artificielle, les grands modèles de langage ont appris à agir comme des agents, capables de raisonner, de chercher des informations et d'utiliser des outils pour résoudre des problèmes complexes. Lorsque ces modèles travaillent seuls, ils suivent un chemin de pensée unique. Cependant, pour s'attaquer à des défis plus difficiles, les chercheurs déploient souvent plusieurs agents qui collaborent, un peu comme une équipe de spécialistes. Parfois, ces équipes divisent une tâche de sorte que chaque membre assume un rôle spécifique, tandis que d'autres fois, elles génèrent simultanément plusieurs idées différentes pour affiner ensemble une solution. La difficulté centrale de l'entraînement de telles équipes a été de déterminer comment les récompenser. Les méthodes traditionnelles traitent souvent la production de chaque agent comme un événement distinct, même lorsque plusieurs agents travaillent ensemble pour produire un seul résultat. Cela crée un décalage : le système apprend à partir de pièces individuelles du puzzle plutôt qu'à partir de l'image complète qu'elles forment ensemble, ce qui rend difficile l'entraînement d'équipes capables de passer du travail solitaire au travail conjoint.
Une équipe de chercheurs a abordé ce décalage en proposant une nouvelle méthode d'entraînement appelée Optimisation de la Politique Relative par Ensemble, ou SRPO (Setwise Relative Policy Optimization). Au lieu de regarder les réponses individuelles, cette approche traite l'ensemble des productions qui provoquent un changement dans l'environnement comme une unité d'action unique. Imaginez une équipe d'explorateurs arrivant à une fourche sur le chemin ; que l'un des membres choisisse un sentier, ou que tout le groupe débatte puis choisisse une route ensemble, la décision qui les fait avancer est le résultat collectif. Les chercheurs ont découvert qu'en regroupant ces productions dans ce qu'ils appellent un « ensemble actif », ils pouvaient entraîner le système à comprendre que l'effort conjoint de l'équipe est la véritable action. Cette méthode permet d'appliquer les mêmes règles d'entraînement, que l'équipe travaille selon une division stricte du travail, où une personne fait une chose, ou dans un mode de coévolution conjointe, où plusieurs personnes contribuent simultanément à une idée commune.
Les chercheurs ont testé cette idée sur deux types de tâches très différents : la résolution de problèmes mathématiques difficiles et la conduite de recherches à plusieurs tours pour trouver des faits spécifiques. Dans les expériences mathématiques, le système devait générer des solutions candidates puis les vérifier, un processus qui nécessitait parfois qu'un agent résolve et qu'un autre vérifie, et d'autres fois qu'un groupe de plusieurs agents propose différentes dérivations à la fois. Dans les expériences de recherche, le système devait décider quand demander plus d'informations, avec plusieurs agents pouvant émettre des requêtes de recherche simultanément avant qu'un agrégateur ne combine les résultats. À travers quatre tailles différentes de modèles de langage, la nouvelle méthode a systématiquement surpassé les approches existantes. Sur les tests de référence mathématiques, le système a atteint une précision moyenne où environ 61 à 62 pour cent de ses solutions générées étaient correctes, et il a trouvé au moins une réponse correcte pour environ 78 pour cent des problèmes. Dans les tâches de recherche, l'amélioration était encore plus prononcée, la nouvelle méthode trouvant des réponses correctes pour plus de 60 pour cent des requêtes en moyenne, un bond significatif par rapport aux méthodes précédentes.
Un élément clé de la découverte a été de comprendre comment équilibrer les contributions de plusieurs agents. Si le système se contentait d'additionner les changements effectués par chaque agent, une équipe plus nombreuse semblerait avoir un impact beaucoup plus important qu'une équipe plus petite, simplement parce qu'il y avait plus de voix. Les chercheurs ont résolu cela en normalisant la contribution du groupe, garantissant qu'une équipe de cinq agents ne soit pas injustement pondérée par rapport à un agent unique simplement en raison de sa taille. Ils ont également démontré que le système pouvait apprendre à basculer entre ces modes de manière dynamique. Dans certains cas, le système a appris qu'un agent spécialisé unique était le meilleur choix, tandis que dans d'autres, il activait un petit groupe d'agents pour travailler ensemble. Cette flexibilité signifiait que le processus d'entraînement n'avait pas besoin d'être réécrit pour différents types de structures d'équipe ; la même logique sous-jacente gérait les deux scénarios de manière fluide.
L'étude a également examiné de près le coût de ces améliorations. Les chercheurs ont veillé à ce que les meilleurs résultats ne soient pas simplement dus au fait que la nouvelle méthode génère plus de texte ou utilise plus de puissance de calcul. Ils ont mesuré le nombre de jetons (tokens) générés et le nombre d'appels d'outils, constatant que les améliorations provenaient d'une meilleure coordination plutôt que d'une force brute. En fait, le processus d'entraînement a souvent conduit à des réponses plus courtes et plus efficaces au fil du temps. Les chercheurs ont noté que, bien que les résultats soient solides, ils étaient basés sur des tests de référence spécifiques et des comparaisons avec d'autres méthodes publiées, et que les travaux futurs devront explorer comment ces gains se maintiennent dans des déploiements réels à long terme. Néanmoins, la conclusion fondamentale demeure : en définissant la production collective de l'équipe comme l'unité d'action fondamentale, il est possible d'entraîner des systèmes multi-agents qui sont plus stables, efficaces et performants pour résoudre des problèmes complexes, qu'ils travaillent seuls ou ensemble.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.