← Últimos artigos
💬 NLP

PROTEA: Offline Evaluation and Iterative Refinement for Multi-Agent LLM Workflows

PROTEA é uma interface unificada para refinamento offline, orientado por testes, de fluxos de trabalho de LLM multiagente que localiza gargalos por meio de pontuação baseada em grafos e avaliação retroativa, permitindo que desenvolvedores editem e validem iterativamente revisões de prompts para melhorar significativamente o desempenho do sistema.

Autores originais: Kazuki Kawamura, Satoshi Waki, Kei Tateno

Publicado 2026-05-19
📖 4 min de leitura☕ Leitura rápida

Autores originais: Kazuki Kawamura, Satoshi Waki, Kei Tateno

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você é o diretor de uma peça onde o elenco é composto inteiramente por robôs de IA. Cada robô tem uma função específica: um lê o roteiro, outro verifica os fatos, um terceiro escreve os diálogos e um quarto apresenta a performance final. É isso que os desenvolvedores chamam de "fluxo de trabalho LLM multi-agente."

Geralmente, essas equipes de robôs funcionam melhor do que um único robô tentando fazer tudo de uma vez. Mas eis o problema: se a performance final for ruim, é um pesadelo descobrir qual robô errou. Será que o verificador de fatos recebeu informações erradas? Será que o escritor mal-entendeu o tom? Ou será que o ator final apenas tropeçou?

Atualmente, os desenvolvedores precisam assistir a horas de vídeo (o "rastro") de toda a peça, tentando adivinhar onde o erro começou. É como tentar encontrar um único erro de digitação em um livro de 500 páginas relendo cada palavra novamente.

Apresentamos o PROTEA.

Pense no PROTEA como uma "sala de ensaios" inteligente e interativa com um holofote mágico. Ele ajuda os desenvolvedores a depurar e melhorar essas equipes de robôs sem precisar assistir ao filme inteiro repetidas vezes.

Veja como funciona, usando analogias simples:

1. O Holofote Mágico (Diagnóstico em Nível de Nó)

Em vez de olhar para a peça inteira, o PROTEA coloca um semáforo em cada estação de cada robô.

  • 🟢 Verde: Este robô fez seu trabalho perfeitamente.
  • 🟡 Amarelo: Este robô estava ok, mas talvez um pouco descuidado.
  • 🔴 Vermelho: Este robô errou.

Quando a resposta final está errada, o PROTEA não diz apenas "A peça falhou". Ele destaca instantaneamente o robô Vermelho e diz: "Ei, olhe aqui! Este robô passou a informação errada para o próximo robô." Isso poupa o desenvolvedor de vasculhar todo o roteiro.

2. O "Engenheiro Reverso" (Inferência Reversa)

Às vezes, os desenvolvedores só sabem qual deve ser a resposta final (por exemplo, "A peça deve terminar com uma risada feliz"), mas não têm um roteiro específico para o que os robôs do meio devem dizer.

O PROTEA usa um truque chamado Inferência Reversa. Imagine que você conhece o destino de uma viagem de carro, mas não as curvas ao longo do caminho. O PROTEA trabalha de trás para frente, a partir da "Risada Feliz", para perguntar: "Para que o robô final ria, o que o robô escritor precisou dizer? E para que o escritor dissesse isso, o que o verificador de fatos precisou fornecer?"

Ele gera um "roteiro fantasma" para as etapas intermediárias com base no objetivo final. Em seguida, compara o que os robôs realmente disseram com esse "roteiro fantasma" para encontrar os elos fracos.

3. O "Botão de Editar" (Refinamento de Prompt)

Uma vez que o PROTEA encontra o robô Vermelho, ele não apenas aponta para ele; oferece uma sugestão de correção.

  • Mostra as instruções atuais do robô (o "Prompt").
  • Sugere uma nova versão aprimorada dessas instruções.
  • Apresenta uma comparação "Antes vs. Depois", como uma ferramenta de edição de fotos mostrando a versão original e a editada lado a lado.

O desenvolvedor pode aceitar a sugestão, ajustá-la ou ignorá-la.

4. O "Replay Instantâneo" (Reexecução Automática)

A melhor parte? Assim que o desenvolvedor clica em "Salvar", o PROTEA reexecuta instantaneamente toda a peça com as novas instruções. Em seguida, mostra um gráfico das pontuações: "Veja? Antes, a pontuação era 64%. Depois da sua edição, agora é 84%!"

Isso cria um ciclo rápido: Encontrar o problema → Sugerir uma correção → Testar → Ver o resultado. Nada mais de esperar dias para ver se uma mudança funcionou.

O Que Eles Realmente Conseguiram?

O artigo testou esse sistema em dois cenários do mundo real (embora tenham mantido os nomes específicos das empresas em segredo):

  1. Inspeção de Documentos: Um sistema que verifica documentos quanto a regras estritas. O PROTEA ajudou a melhorar sua precisão de 64,3% para 83,9%.
  2. Sistema de Recomendação: Um chatbot que sugere itens (como filmes ou produtos). O PROTEA ajudou a fazer com que a recomendação correta aparecesse com mais frequência entre os 5 primeiros, melhorando uma pontuação de 0,30 para 0,38.

Eles também testaram o sistema em um grupo de seis desenvolvedores de IA experientes. Esses desenvolvedores adoraram o sistema porque ele os impediu de encarar logs intermináveis e permitiu que se concentrassem em corrigir o robô específico que estava causando o problema.

A Conclusão

O PROTEA é uma ferramenta que transforma o trabalho confuso e bagunçado de depurar uma equipe de robôs de IA em um processo limpo e visual. Ele age como um treinador com um vídeo de melhores momentos, mostrando exatamente qual jogador deixou cair a bola e fornecendo um manual de instruções para corrigi-lo, tudo em um só lugar.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →