SRPO: Setwise Relative Policy Optimization for Multi-Agent LLMs
El artículo presenta SRPO (Optimización de Política Relativa por Conjuntos), un nuevo marco de aprendizaje por refuerzo para LLMs multi-agente que unifica la división del trabajo y la coevolución conjunta al tratar el conjunto mínimo de salidas consumidas en una sola transición de estado como una acción unificada, permitiendo así un entrenamiento estable y efectivo a través de diversos flujos de trabajo y escalas de modelos.
Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo
En el mundo de la inteligencia artificial, que evoluciona rápidamente, los modelos de lenguaje extensos han aprendido a actuar como agentes, capaces de razonar, buscar información y utilizar herramientas para resolver problemas complejos. Cuando estos modelos trabajan solos, siguen un único camino de pensamiento. Sin embargo, para abordar desafíos más difíciles, los investigadores suelen desplegar múltiples agentes que colaboran, de forma muy parecida a un equipo de especialistas. A veces, estos equipos dividen una tarea de modo que cada miembro se encarga de un rol específico, mientras que en otras ocasiones generan varias ideas diferentes simultáneamente para refinar una solución juntos. La dificultad central al entrenar tales equipos ha sido determinar cómo recompensarlos. Los métodos tradicionales suelen tratar la salida de cada agente como un evento separado, incluso cuando varios agentes trabajan juntos para producir un único resultado. Esto crea un desajuste: el sistema aprende de piezas individuales del rompecabezas en lugar de la imagen completa que forman juntas, lo que dificulta el entrenamiento de equipos que alternan entre trabajar solos y trabajar conjuntamente.
Un equipo de investigadores ha abordado este desajuste proponiendo un nuevo método de entrenamiento llamado Optimización de Política Relativa por Conjuntos, o SRPO (por sus siglas en inglés). En lugar de observar las respuestas individuales, este enfoque trata a todo el grupo de salidas que provocan un cambio en el entorno como una única unidad de acción. Imagine a un equipo de exploradores llegando a una bifurcación en el camino; ya sea que una persona elija un camino, o que todo el grupo debata y luego elija una ruta juntos, la decisión que los hace avanzar es el resultado colectivo. Los investigadores descubrieron que, al agrupar estas salidas en lo que llaman un "conjunto activo", podían entrenar al sistema para comprender que el esfuerzo conjunto del equipo es la verdadera acción. Este método permite que las mismas reglas de entrenamiento se apljen ya sea que el equipo esté trabajando en una estricta división del trabajo, donde una persona hace una cosa, o en un modo de coevolución conjunta, donde varias personas contribuyen a una idea compartida al mismo tiempo.
Los investigadores probaron esta idea en dos tipos de tareas muy diferentes: resolver problemas matemáticos difíciles y realizar búsquedas de varios turnos para encontrar hechos específicos. En los experimentos matemáticos, el sistema tenía que generar soluciones candidatas y luego verificarlas, un proceso que a veces requería que un agente resolviera y otro comprobara, y otras veces requería que varios agentes propusieran diferentes derivaciones a la vez. En los experimentos de búsqueda, el sistema tenía que decidir cuándo pedir más información, con múltiples agentes potencialmente emitiendo consultas de búsqueda simultáneamente antes de que un agregador combinara los resultados. A través de cuatro tamaños diferentes de modelos de lenguaje, el nuevo método superó consistentemente a los enfoques existentes. En los parámetros matemáticos, el sistema logró un promedio de precisión donde aproximadamente el 61 o 62 por ciento de sus soluciones generadas eran correctas, y encontró al menos una respuesta correcta para alrededor del 78 por ciento de los problemas. En las tareas de búsqueda, la mejora fue aún más pronunciada, con el nuevo método encontrando respuestas correctas para más del 60 por ciento de las consultas en promedio, un salto significativo respecto a los métodos anteriores.
Una parte clave del descubrimiento fue comprender cómo equilibrar las contribuciones de múltiples agentes. Si el sistema simplemente sumara los cambios realizados por cada agente, un equipo más grande parecería tener un impacto mucho mayor que uno más pequeño, simplemente porque hay más voces. Los investigadores resolvieron esto normalizando la contribución del grupo, asegurando que un equipo de cinco agentes no fuera penalizado injustamente frente a un solo agente solo por su tamaño. También demostraron que el sistema podía aprender a cambiar entre estos modos dinámicamente. En algunos casos, el sistema aprendió que un único agente especializado era la mejor opción, mientras que en otros, activaba a un pequeño grupo de agentes para trabajar juntos. Esta flexibilidad significó que el proceso de entrenamiento no necesitaba ser reescrito para diferentes estructuras de equipo; la misma lógica subyacente manejaba ambos escenarios sin problemas.
El estudio también examinó de cerca el costo de estas mejoras. Los investigadores se aseguraron de que los mejores resultados no se debieran simplemente a que el nuevo método estuviera generando más texto o utilizando más potencia de cómputo. Midieron el número de tokens generados y el número de llamadas a herramientas, encontrando que las mejoras provenían de una mejor coordinación en lugar de la fuerza bruta. De hecho, el proceso de entrenamiento a menudo condujo a respuestas más cortas y eficientes con el tiempo. Los investigadores señalaron que, si bien los resultados fueron sólidos, se basaron en parámetros específicos y comparaciones con otros métodos publicados, y que el trabajo futuro necesitará explorar cómo estos avances se mantienen en despliegues reales a largo plazo. No obstante, el hallazgo central se mantiene: al definir la salida colectiva del equipo como la unidad fundamental de acción, es posible entrenar sistemas multiagente que son más estables, eficientes y efectivos para resolver problemas complejos, independientemente de si trabajan solos o juntos.
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.