← Últimos artigos
🤖 AI

Toward Scalable Verifiable Reward: Proxy State-Based Evaluation for Multi-turn Tool-Calling LLM Agents

Este artigo apresenta a Avaliação Baseada em Estado Proxy, um framework de simulação orientado por LLM que permite uma avaliação escalável, confiável e escalável de agentes de chamada de ferramentas em múltiplas voltas, inferindo estados proxy estruturados a partir de rastros de interação, oferecendo assim uma alternativa prática a backends determinísticos onerosos, ao mesmo tempo que suporta tanto a classificação de modelos quanto o treinamento on-policy.

Autores originais: Yun-Shiuan Chuang, Chaitanya Kulkarni, Alec Chiu, Avinash Thangali, Zijie Pan, Shivani Shekhar, Yirou Ge, Yixi Li, Uma Kona, Linsey Pang, Prakhar Mehrotra

Publicado 2026-05-14
📖 4 min de leitura☕ Leitura rápida

Autores originais: Yun-Shiuan Chuang, Chaitanya Kulkarni, Alec Chiu, Avinash Thangali, Zijie Pan, Shivani Shekhar, Yirou Ge, Yixi Li, Uma Kona, Linsey Pang, Prakhar Mehrotra

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está tentando ensinar um novo funcionário (o Agente de IA) a lidar com solicitações complexas de clientes, como encontrar o par de sapatos perfeito ou gerenciar uma conta bancária. Para fazer isso, você precisa de uma maneira de testá-los.

A Maneira Antiga: Construir uma Simulação Perfeita e Cara
Tradicionalmente, para testar esses agentes de IA, as empresas construíam uma simulação de um "mundo perfeito". Pense nisso como construir um modelo em escala real e funcional de um banco ou de uma loja, com dinheiro real, estoque real e regras estritas.

  • O Problema: Construir esse "mundo perfeito" é incrivelmente caro e lento. É como contratar uma equipe de engenheiros para construir uma cidade falsa apenas para testar um entregador. Se você quiser mudar o teste (por exemplo, "e se o cliente não tiver dinheiro?"), você terá que reescrever o código de toda a cidade falsa. O artigo observa que um desses sistemas exigiu quase 100.000 linhas de código e mais de um ano de trabalho apenas para colocar o motor em funcionamento.

A Maneira Nova: O "Estado Proxy" (O Roteiro Inteligente)
Os autores deste artigo propõem uma maneira mais inteligente e rápida chamada Avaliação Baseada em Estado Proxy. Em vez de construir uma cidade falsa, eles usam uma equipe de diretores de IA muito inteligentes para dirigir uma peça.

Veja como a analogia funciona:

  1. O Cenário (O Roteiro):
    Em vez de um banco de dados, eles escrevem um roteiro detalhado. Este roteiro diz:

    • Quem é o cliente? (por exemplo, Sarah, que adora sapatos brancos).
    • Qual é o objetivo? (por exemplo, Encontrar sapatos que ela possa pagar).
    • Como deve ser o resultado final? (por exemplo, Sarah tem 300 dólares em sua conta, mas ainda não comprou nada).
  2. Os Atores (Os Simuladores de IA):

    • O Simulador de Usuário: Uma IA faz o papel do cliente, conversando com o agente.
    • Os Simuladores de Ferramentas: Outras IAs fingem ser o banco ou a loja. Elas não têm realmente uma conta bancária; elas apenas agem como se tivessem, com base no roteiro.
    • O Rastreador de Estado (O Guardião da Memória): Esta é a parte nova mais importante. À medida que a conversa acontece, uma IA especial observa tudo e atualiza um "placar mental" (o Estado Proxy). Ela rastreia: O agente pediu dinheiro? O "banco" disse sim? Qual é o saldo agora? Ela constrói uma imagem da situação passo a passo, sem precisar de um banco de dados real.
  3. O Juiz (O Diretor):
    No final da conversa, um Juiz de IA final examina o "placar mental" e a transcrição da conversa. Ele pergunta: "O agente alcançou o objetivo definido no roteiro?"

    • Se o agente encontrou os sapatos e atualizou o saldo corretamente no "placar mental", ele passa.
    • Se o agente inventou coisas (alucinou) ou esqueceu de verificar o saldo, ele falha.

Por que isso é melhor?

  • Velocidade e Flexibilidade: Você não precisa construir um banco falso. Você apenas escreve um novo roteiro. Se quiser testar um cenário diferente, você muda o texto, não o código.
  • Confiabilidade: Os autores testaram isso fazendo com que especialistas humanos verificassem a classificação da IA. Eles concordaram com os juízes de IA em mais de 90% das vezes.
  • Treinamento: Como este sistema é rápido, ele pode gerar milhares de conversas de prática. O agente de IA pode aprender com esses ensaios (tanto quando está participando quanto quando está observando um agente melhor atuando), tornando-o muito mais inteligente rapidamente.

Os Resultados
O artigo testou este sistema com vários modelos de IA. Eles descobriram que:

  • Modelos de IA mais inteligentes (ou modelos que pensam mais antes de responder) obtiveram pontuações mais altas.
  • Treinar a IA usando este sistema a tornou significativamente melhor em resolver problemas, mesmo em cenários que ela nunca tinha visto antes.
  • O sistema foi muito bom em detectar quando a IA estava mentindo ou cometendo erros, com quase zero erros "falsos" provenientes da própria simulação.

Em Resumo
Este artigo apresenta uma maneira de testar e treinar agentes de IA usando uma "peça encenada" com atores de IA e uma IA que guarda a memória, em vez de construir uma simulação do mundo real massiva e cara. É mais rápido, mais barato e tão preciso quanto, permitindo que as empresas iteram e melhorem seus agentes de IA muito mais rapidamente.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →