SRPO: Setwise Relative Policy Optimization for Multi-Agent LLMs
O artigo introduz o SRPO (Setwise Relative Policy Optimization), um novo framework de aprendizado por reforço para LLMs multiagentes que unifica a divisão de trabalho e a coevolução conjunta ao tratar o conjunto mínimo de saídas consumidas em uma única transição de estado como uma ação unificada, permitendo, assim, um treinamento estável e eficaz através de diversos fluxos de trabalho e escalas de modelos.
Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo
No mundo em rápida evolução da inteligência artificial, os grandes modelos de linguagem aprenderam a agir como agentes, capazes de raciocinar, buscar informações e usar ferramentas para resolver problemas complexos. Quando esses modelos trabalham sozinhos, seguem um único caminho de pensamento. No entanto, para enfrentar desafios mais difíceis, pesquisadores frequentemente implantam múltiplos agentes que colaboram, de forma muito semelhante a uma equipe de especialistas. Às vezes, essas equipes dividem uma tarefa para que cada membro lide com um papel específico, enquanto em outras ocasiões, elas geram diversas ideias diferentes simultaneamente para refinar uma solução juntas. A dificuldade central em treinar tais equipes tem sido descobrir como recompensá-las. Os métodos tradicionais costumam tratar a saída de cada agente como um evento separado, mesmo quando vários agentes estão trabalhando juntos para produzir um único resultado. Isso cria um descompasso: o sistema aprende com as peças individuais do quebra-cabeça, em vez da imagem completa que elas formam juntas, tornando difícil treinar equipes que alternam entre trabalhar sozinhas e trabalhar conjuntamente.
Uma equipe de pesquisadores abordou esse descompasso propondo um novo método de treinamento chamado Otimização de Política Relativa por Conjuntos, ou SRPO (Setwise Relative Policy Optimization). Em vez de olhar para respostas individuais, essa abordagem trata todo o grupo de saídas que causa uma mudança no ambiente como uma única unidade de ação. Imagine uma equipe de exploradores chegando a uma bifurcação no caminho; quer uma pessoa escolha um caminho, ou todo o grupo debata e então escolha uma rota juntos, a decisão que os faz avançar é o resultado coletivo. Os pesquisadores descobriram que, ao agrupar essas saídas no que chamam de "conjunto ativo", eles puderam treinar o sistema para entender que o esforço conjunto da equipe é a verdadeira ação. Este método permite que as mesmas regras de treinamento se aplm a qualquer que seja o caso, seja quando a equipe está trabalhando em uma divisão estrita de trabalho, onde uma pessoa faz uma coisa, ou em um modo de coevolução conjunta, onde várias pessoas contribuem para uma ideia compartilhada ao mesmo tempo.
Os pesquisadores testaram essa ideia em dois tipos de tarefas muito diferentes: resolver problemas matemáticos difíceis e realizar buscas de múltiplos turnos para encontrar fatos específicos. Nos experimentos matemáticos, o sistema tinha que gerar soluções candidatas e depois verificá-las, um processo que às vezes exigia que um agente resolvesse e outro verificasse, e outras vezes exigia que vários agentes propusessem diferentes derivações ao mesmo tempo. Nos experimentos de busca, o sistema tinha que decidir quando pedir mais informações, com múltiplos agentes potencialmente emitindo consultas de busca simultaneamente antes que um agregador combinasse os resultados. Através de quatro tamanhos diferentes de modelos de linguagem, o novo método superou consistentemente as abordagens existentes. Nos benchmarks matemáticos, o sistema alcançou uma precisão média onde aproximadamente 61 a 62 por cento de suas soluções geradas estavam corretas, e encontrou pelo menos uma resposta correta para cerca de 78 por cento dos problemas. Nas tarefas de busca, a melhoria foi ainda mais pronunciada, com o novo método encontrando respostas corretas para mais de 60 por cento das consultas em média, um salto significativo em relação aos métodos anteriores.
Uma parte fundamental da descoberta foi entender como equilibrar as contribuições de múltiplos agentes. Se o sistema simplesmente somasse as mudanças feitas por cada agente, uma equipe maior pareceria ter um impacto muito maior do que uma equipe menor, simplesmente porque havia mais vozes. Os pesquisadores resolveram isso normalizando a contribuição do grupo, garantindo que uma equipe de cinco agentes não fosse injustamente ponderada contra um único agente apenas devido ao seu tamanho. Eles também demonstraram que o sistema podia aprender a alternar entre esses modos dinamicamente. Em alguns casos, o sistema aprendeu que um único agente especializado era a melhor escolha, enquanto em outros, ele ativava um pequeno grupo de agentes para trabalharem juntos. Essa flexibilidade significou que o processo de treinamento não precisava ser reescrito para diferentes estruturas de equipe; a mesma lógica subjacente lidava com ambos os cenários de forma contínida.
O estudo também analisou de perto o custo dessas melhorias. Os pesquisadores foram cuidadosos para garantir que os melhores resultados não fossem simplesmente porque o novo método estava gerando mais texto ou usando mais poder computacional. Eles mediram o número de tokens gerados e o número de chamadas de ferramentas, descobrindo que as melhorias vinham de uma melhor coordenação, e não de força bruta. De fato, o processo de treinamento frequentemente levou a respostas mais curtas e eficientes ao longo do tempo. Os pesquisadores observaram que, embora os resultados fossem fortes, eles se baseavam em benchmarks específicos e comparações com outros métodos publicados, e trabalhos futuros precisariam explorar como esses ganhos se sustentam em implantações reais de longo prazo. No entanto, a descoberta central permanece: ao definir a saída coletiva da equipe como a unidade fundamental de ação, é possível treinar sistemas multiagentes que são mais estáveis, eficientes e eficazes na resolução de problemas complexos, independentemente de estarem trabalhando sozinhos ou juntos.
Afogado em artigos na sua área?
Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.