← Últimos artigos
💬 NLP

MASPO: Joint Prompt Optimization for LLM-based Multi-Agent Systems

MASPO é uma estrutura inovadora que otimiza automaticamente prompts para sistemas multiagente baseados em LLMs, empregando um mecanismo de avaliação conjunta e busca em feixe evolutiva para alinhar objetivos locais dos agentes com metas globais do sistema, superando assim métodos existentes em diversas tarefas colaborativas.

Autores originais: Zhexuan Wang, Xuebo Liu, Li Wang, Zifei Shan, Yutong Wang, Zhenxi Song, Min Zhang

Publicado 2026-05-08
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Zhexuan Wang, Xuebo Liu, Li Wang, Zifei Shan, Yutong Wang, Zhenxi Song, Min Zhang

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você tem uma equipe de robôs especialistas trabalhando juntos para resolver um quebra-cabeça muito difícil. Cada robô tem uma função específica: um lê as pistas, outro faz os cálculos, um terceiro verifica erros e um quarto escreve a resposta final.

No passado, se a equipe falhasse, era difícil saber a quem culpar. O robô de matemática era ruim em matemática? Ou o robô de leitura forneceu as pistas erradas? Este é o problema que o artigo MASPO resolve.

Veja como o MASPO funciona, explicado através de analogias simples:

1. O Problema: O "Jogo da Culpa" em uma Equipe

Geralmente, quando treinamos essas equipes de robôs, olhamos apenas para a resposta final. Se a resposta estiver errada, não sabemos qual robô errou.

  • A Analogia: Imagine uma corrida de revezamento. Se a equipe perder, você não pode apenas gritar com o último corredor. Talvez o primeiro corredor tenha deixado cair o bastão, ou o segundo corredor tenha corrido pelo caminho errado. Se você treinar apenas o último corredor para correr mais rápido, a equipe ainda perderá porque a troca do bastão está quebrada.
  • A Descoberta do Artigo: Os autores perceberam que, em um sistema multiagente, um robô pode executar sua própria função perfeitamente (sucesso local), mas ainda assim fornecer informações ao próximo robô que levam a uma falha total (falha global). Isso é chamado de "Desalinhamento Local-Global".

2. A Solução: MASPO (O Treinador da Equipe)

O MASPO é um novo framework que atua como um treinador inteligente que não apenas observa a linha de chegada, mas observa cada troca de bastão na corrida de revezamento. Ele reescreve automaticamente os "manuais de instrução" (prompts) de cada robô para fazer toda a equipe trabalhar melhor em conjunto.

Ele faz isso usando três truques principais:

A. A Planilha "À Prova de Futuro" (Avaliação Conjunta)

Em vez de apenas perguntar: "Este robô fez seu trabalho?", o MASPO pergunta: "O trabalho deste robô ajudou o próximo robô a ter sucesso?"

  • A Analogia: Imagine um chef preparando uma refeição. Um juiz padrão poderia apenas provar a sopa e dizer: "Está salgada". Mas o MASPO é como um juiz que também pergunta: "Esta sopa está salgada o suficiente para combinar bem com o pão que o próximo chef está assando?"
  • Como funciona: O MASPO atribui uma pontuação a cada robô baseada em três fatores:
    1. Eles seguiram suas próprias regras? (Validade Local)
    2. Sua saída facilitou o trabalho do próximo robô? (Potencial de Previsão)
    3. Isso ajudou a equipe a vencer o jogo final? (Alinhamento Global)

B. Aprendendo com "Quase" Desastres (Mineração de Desalinhamento)

A maioria dos sistemas aprende apenas com erros onde a resposta final estava errada. O MASPO procura um tipo específico e sorrateiro de erro: quando um robô fez seu trabalho perfeitamente, mas a equipe ainda falhou.

  • A Analogia: Imagine um motorista que segue todas as leis de trânsito perfeitamente (sucesso local), mas acidentalmente dirige para uma rua sem saída porque o mapa estava confuso (falha global). Um treinador normal diria: "Bom trabalho, motorista!" O MASPO diz: "Espere, você seguiu as regras, mas ainda nos perdemos. Vamos corrigir suas instruções para que você não dirija para ruas sem saída da próxima vez."
  • Como funciona: O sistema salva esses casos de "Sucesso Local, Falha Global" e força os robôs a estudá-los, garantindo que não repitam os mesmos erros de coordenação.

C. O Exercício de "Re-alinhamento" (Atualização do Feixe)

À medida que os robôs aprendem e mudam seu comportamento, as instruções para o próximo robô podem repentinamente ficar desatualizadas.

  • A Analogia: Imagine uma equipe de dança. Se o primeiro dançarino acelerar, o tempo do segundo dançarino agora está errado. Se vocês continuarem praticando a rotina antiga, eles continuarão pisando nos pés um do outro.
  • Como funciona: O MASPO verifica constantemente a equipe. Se o primeiro robô mudou seu estilo, o MASPO atualiza imediatamente a "pontuação" das instruções do segundo robô para que estejam praticando contra a realidade atual, e não contra uma versão antiga da equipe.

3. Os Resultados: Uma Equipe Melhor

Os autores testaram isso em 6 tipos diferentes de tarefas difíceis, incluindo matemática complexa, quebra-cabeças de lógica e escrita de código de computador.

  • O Resultado: As equipes treinadas com MASPO superaram consistentemente outros métodos. Elas melhoraram sua precisão em uma média de 2,9% em comparação com os melhores métodos existentes.
  • Por que isso importa: Isso prova que, ao ensinar os robôs a se importarem com como seu trabalho afeta seus companheiros de equipe (e não apenas sua própria tarefa), todo o sistema se torna muito mais inteligente.

Resumo

Pense no MASPO como um treinador de equipe que reescreve o manual tático em tempo real. Em vez de apenas dizer aos jogadores para "fazerem o seu melhor", ele analisa como o passe do Jogador A afeta a recepção do Jogador B, e reescreve as instruções para ambos para garantir que toda a equipe vença, e não apenas os jogadores individuais. Ele resolve o problema de "Eu fiz meu trabalho, mas ainda perdemos" garantindo que o trabalho de todos seja projetado para ajudar a equipe a vencer.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →