← Últimos artigos
🤖 AI

MASPRM: Multi-Agent System Process Reward Model

O artigo apresenta o MASPRM, um modelo de recompensa de processo de sistema multiagente treinado em resultados terminais para pontuar mensagens intermediárias de agentes, o qual melhora significativamente o desempenho de busca em tempo de inferência em benchmarks de raciocínio comparado a modelos existentes ao permitir uma busca de feixe e busca em árvore de Monte Carlo em nível de etapa mais eficazes.

Autores originais: Milad Yazdani, Mahdi Mostajabdaveh, Zirui Zhou, Ying Xiong

Publicado 2026-07-16
📖 7 min de leitura🧠 Leitura aprofundada

Autores originais: Milad Yazdani, Mahdi Mostajabdaveh, Zirui Zhou, Ying Xiong

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você esteja tentando resolver um quebra-cabeça realmente difícil, como um problema matemático complexo ou um enigma de lógica. No mundo da inteligência artificial, temos os "Large Language Models" (LLMs), que são como estudantes superinteligentes, mas às vezes dispersos. Se você fizer uma pergunta difícil a eles, eles podem tentar responder de uma só vez, mas frequentemente ficam travados ou cometem um erro no início e continuam seguendo pelo caminho errado. Para corrigir isso, cientistas começaram a usar "Sistemas Multi-Agente". Pense nisso não como um estudante trabalhando sozinho, mas como um grupo de estudos. Você tem um "Leitor" que lê a pergunta, um "Planejador" que cria uma estratégia, um "Resolvedor" que faz a matemática e um "Verificador" que checa o trabalho. Eles passam notas uns para os outros em uma ordem específica.

No entanto, há uma pegadinha. Se você deixar esse grupo de estudos agir sem controle, eles podem desperdiçar muito tempo e energia (poder computacional) discutindo ideias que já estão erradas. É como um grupo de amigos tentando resolver um mistério, mas eles continuam perseguindo uma pista falsa porque ninguém parou para dizer: "Espere, este detalhe não faz sentido". Para interromper esse desperdício, pesquisadores usam "algoritmos de busca" como a Busca em Árvore Monte Carlo (MCTS). Isso é como um treinador que diz: "Vamos tentar cinco caminhos diferentes para o próximo passo, ver qual deles parece mais promissor e, então, focar nesse". Mas aqui está o grande problema: como o treinador sabe qual caminho é promissor? Geralmente, o treinador só sabe se a resposta final está certa ou errada. Ele não sabe se os passos intermediários foram bons. Este artigo introduz uma nova ferramenta para ajudar o treinador a tomar decisões melhores bem no meio do jogo.

O Artigo: MASPRM

Os pesquisadores por trás deste artigo, da Universidade da Colúmbia Britânica e da Huawei, estão lidando exatamente com esse problema. Eles criaram algo chamado MASPRM (Multi-Agent System Process Reward Model). Você pode pensar no MASPRM como um "Super Treinador" ou um "Juiz de Processo" que não apenas espera pela resposta final para ver se o grupo teve sucesso. Em vez disso, ele observa a conversa do grupo de estudos enquanto ela acontece e pontua cada uma das notas que eles passam uns para os outros.

No passado, se uma equipe de IA cometesse um erro no passo 3, o sistema não saberia até o final, quando a resposta final estivesse errada. A essa altura, a IA já teria desperdiçado uma tonelada de energia explorando esse caminho ruim. O MASPRM muda o jogo. Ele analisa o "transcrito roteado" — que é apenas uma forma chique de dizer a lista ordenada de mensagens que os agentes enviaram uns aos outros. Ele pontua essas mensagens para dizer: "Ei, esta mensagem específica do Planejador foi uma ótima ideia, vamos continuar", ou "Esta mensagem do Resolvedor está nos levando a lugar nenhum, vamos cortar esse ramo imediatamente".

Como Eles Ensinaram o Treinador

Uma das partes mais legais deste artigo é como eles treinaram este Super Treinador. Normalmente, para ensinar um computador a julgar passos, você precisa de um humano que se sente lá e rotule cada passo como "bom" ou "ruim". Isso é incrivelmente caro e lento. Os autores encontraram um atalho inteligente. Eles deixaram os agentes de IA executarem milhares de simulações usando um método de busca chamado MCTS. Nessas simulações, os agentes explorariam muitos caminhos diferentes. Ao final de cada caminho, eles sabiam se a resposta estava certa (+1) ou errada (-1).

Então, eles usaram um truque matemático chamado "backpropagation" (retropropagação). Imagine uma árvore onde as folhas são os resultados finais. Se uma folha é uma "vitória", o valor dessa vitória escorre pelas ramificações, fazendo com que os passos anteriores pareçam valiosos. Se uma folha é uma "derrota", o valor escorre de volta como um valor negativo. O MASPRM aprendeu a prever esses valores apenas olhando para o histórico da conversa, sem que um único humano jamais tenha dito: "Este passo foi bom". Ele aprendeu a identificar a diferença entre uma conversa promissora e uma discussão sem saída apenas vendo quais delas eventualmente levaram à resposta correta.

O Que Eles Descobriram

A equipe testou este novo treinador em quatro benchmarks famosos: GSM8K e MATH (para problemas matemáticos) e MMLU e LOGIQA (para conhecimento geral e lógica). Eles compararam o MASPRM com outros dois métodos:

  1. Likelihood da Política (Policy Likelihood): Isso é como a IA apenas adivinhando: "Eu acho que esta próxima palavra é provável", sem qualquer compreensão real do objetivo.
  2. ORM (Outcome Reward Model): Este é o treinador da velha guarda que só verifica a resposta final, ignorando os passos intermediários.

Os resultados foram bastante claros. Quando os pesquisadores usaram o MASPRM para guiar a busca (especificamente usando MCTS e um método chamado Busca de Feixe em Nível de Passo/Step-Level Beam Search), a IA tornou-se significativamente melhor na resolução de problemas.

  • No modelo de 1,5 bilhão de parâmetros (uma IA menor e mais rápida), o MASPRM melhorou a taxa de sucesso em 2,0 a 3,0 pontos em comparação com o antigo Modelo de Recompensa de Resultado (ORM).
  • No modelo de 7 bilhões de parâmetros (uma IA maior e mais inteligente), a melhoria foi massiva, saltando de 4,1 a 14,5 pontos.
  • No teste mais difícil (GSM8K), a combinação do modelo 7B com o MASPRM atingiu um Hit@1 de 82,9%, o que significa que ela obteve a resposta correta na primeira tentativa quase 83% das vezes.

O artigo sugere que o MASPRM é especialmente bom em "busca passo a passo". Isso é quando a IA tem que tomar uma série de decisões, como escolher qual agente fala a seguir ou qual deve ser a próxima frase. Como o MASPRM pode julgar esses passos intermediários, ele evita que a IA perca tempo com ideias ruins. Também tornou as escolhas da IA mais confiáveis; a lacuna entre a "melhor" suposição e a "quinta melhor" suposição diminuiu, o que significa que a IA estava mais confiante em suas principais escolhas.

Os Limites e o Futuro

Os autores fazem questão de notar que isso não é uma varinha mágica que conserta tudo. O sistema deles funciona melhor quando os agentes têm um cronograma fixo (como uma ordem estrita de quem fala quando) e quando a resposta final pode ser claramente verificada (como um problema de matemática com um número específico). Eles admitem que, para tarefas de texto aberto onde não existe uma única resposta "correta", ou para sistemas onde os agentes mudam seus papéis dinamicamente sobre a hora, este método ainda está sendo estudado. Eles também descobriram que, se o treinador vê apenas o que um único agente vê (em vez de toda a conversa do grupo), ele não funciona tão bem, sugerindo que ter uma "visão global" do chat da equipe é crucial para o melhor desempenho.

Em resumo, o MASPRM é um avanço em ensinar equipes de IA a se autocorrigirem em tempo real. Em vez de esperar até o fim para perceber que estavam erradas, elas agora têm um treinador que pode detectar um caminho ruim cedo e guiar a equipe de volta ao trilho, economizando tempo e obtendo melhores resultados. Isso sugere que, para tarefas de raciocínio complexo, o segredo não é apenas ter um cérebro maior, mas ter uma maneira melhor de guiar o processo de pensamento enquanto ele acontece.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →