PROTEA: Offline Evaluation and Iterative Refinement for Multi-Agent LLM Workflows
PROTEA é uma interface unificada para refinamento offline, orientado por testes, de fluxos de trabalho de LLM multiagente que localiza gargalos por meio de pontuação baseada em grafos e avaliação retroativa, permitindo que desenvolvedores editem e validem iterativamente revisões de prompts para melhorar significativamente o desempenho do sistema.
Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo
Imagine que você é o diretor de uma peça onde o elenco é composto inteiramente por robôs de IA. Cada robô tem uma função específica: um lê o roteiro, outro verifica os fatos, um terceiro escreve os diálogos e um quarto apresenta a performance final. É isso que os desenvolvedores chamam de "fluxo de trabalho LLM multi-agente."
Geralmente, essas equipes de robôs funcionam melhor do que um único robô tentando fazer tudo de uma vez. Mas eis o problema: se a performance final for ruim, é um pesadelo descobrir qual robô errou. Será que o verificador de fatos recebeu informações erradas? Será que o escritor mal-entendeu o tom? Ou será que o ator final apenas tropeçou?
Atualmente, os desenvolvedores precisam assistir a horas de vídeo (o "rastro") de toda a peça, tentando adivinhar onde o erro começou. É como tentar encontrar um único erro de digitação em um livro de 500 páginas relendo cada palavra novamente.
Apresentamos o PROTEA.
Pense no PROTEA como uma "sala de ensaios" inteligente e interativa com um holofote mágico. Ele ajuda os desenvolvedores a depurar e melhorar essas equipes de robôs sem precisar assistir ao filme inteiro repetidas vezes.
Veja como funciona, usando analogias simples:
1. O Holofote Mágico (Diagnóstico em Nível de Nó)
Em vez de olhar para a peça inteira, o PROTEA coloca um semáforo em cada estação de cada robô.
- 🟢 Verde: Este robô fez seu trabalho perfeitamente.
- 🟡 Amarelo: Este robô estava ok, mas talvez um pouco descuidado.
- 🔴 Vermelho: Este robô errou.
Quando a resposta final está errada, o PROTEA não diz apenas "A peça falhou". Ele destaca instantaneamente o robô Vermelho e diz: "Ei, olhe aqui! Este robô passou a informação errada para o próximo robô." Isso poupa o desenvolvedor de vasculhar todo o roteiro.
2. O "Engenheiro Reverso" (Inferência Reversa)
Às vezes, os desenvolvedores só sabem qual deve ser a resposta final (por exemplo, "A peça deve terminar com uma risada feliz"), mas não têm um roteiro específico para o que os robôs do meio devem dizer.
O PROTEA usa um truque chamado Inferência Reversa. Imagine que você conhece o destino de uma viagem de carro, mas não as curvas ao longo do caminho. O PROTEA trabalha de trás para frente, a partir da "Risada Feliz", para perguntar: "Para que o robô final ria, o que o robô escritor precisou dizer? E para que o escritor dissesse isso, o que o verificador de fatos precisou fornecer?"
Ele gera um "roteiro fantasma" para as etapas intermediárias com base no objetivo final. Em seguida, compara o que os robôs realmente disseram com esse "roteiro fantasma" para encontrar os elos fracos.
3. O "Botão de Editar" (Refinamento de Prompt)
Uma vez que o PROTEA encontra o robô Vermelho, ele não apenas aponta para ele; oferece uma sugestão de correção.
- Mostra as instruções atuais do robô (o "Prompt").
- Sugere uma nova versão aprimorada dessas instruções.
- Apresenta uma comparação "Antes vs. Depois", como uma ferramenta de edição de fotos mostrando a versão original e a editada lado a lado.
O desenvolvedor pode aceitar a sugestão, ajustá-la ou ignorá-la.
4. O "Replay Instantâneo" (Reexecução Automática)
A melhor parte? Assim que o desenvolvedor clica em "Salvar", o PROTEA reexecuta instantaneamente toda a peça com as novas instruções. Em seguida, mostra um gráfico das pontuações: "Veja? Antes, a pontuação era 64%. Depois da sua edição, agora é 84%!"
Isso cria um ciclo rápido: Encontrar o problema → Sugerir uma correção → Testar → Ver o resultado. Nada mais de esperar dias para ver se uma mudança funcionou.
O Que Eles Realmente Conseguiram?
O artigo testou esse sistema em dois cenários do mundo real (embora tenham mantido os nomes específicos das empresas em segredo):
- Inspeção de Documentos: Um sistema que verifica documentos quanto a regras estritas. O PROTEA ajudou a melhorar sua precisão de 64,3% para 83,9%.
- Sistema de Recomendação: Um chatbot que sugere itens (como filmes ou produtos). O PROTEA ajudou a fazer com que a recomendação correta aparecesse com mais frequência entre os 5 primeiros, melhorando uma pontuação de 0,30 para 0,38.
Eles também testaram o sistema em um grupo de seis desenvolvedores de IA experientes. Esses desenvolvedores adoraram o sistema porque ele os impediu de encarar logs intermináveis e permitiu que se concentrassem em corrigir o robô específico que estava causando o problema.
A Conclusão
O PROTEA é uma ferramenta que transforma o trabalho confuso e bagunçado de depurar uma equipe de robôs de IA em um processo limpo e visual. Ele age como um treinador com um vídeo de melhores momentos, mostrando exatamente qual jogador deixou cair a bola e fornecendo um manual de instruções para corrigi-lo, tudo em um só lugar.
Afogado em artigos na sua área?
Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.