← Últimos artigos
💬 NLP

Agent-Diff: Benchmarking LLM Agents on Enterprise API Tasks via Code Execution with State-Diff-Based Evaluation

O artigo apresenta o Agent-Diff, um novo framework de benchmarking que avalia agentes de LLMs em tarefas de APIs empresariais reais através de execução de código em um ambiente sandboxizado, utilizando contratos de "state-diff" para medir o sucesso com base nas alterações de estado do sistema em vez de correspondência de parâmetros.

Autores originais: Hubert M. Pysklo, Artem Zhuravel, Patrick D. Watson

Publicado 2026-03-26
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Hubert M. Pysklo, Artem Zhuravel, Patrick D. Watson

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

🚀 Agent-Diff: O "Simulador de Voo" para Robôs Inteligentes

Imagine que você tem um grupo de assistentes robóticos superinteligentes (chamados de Agentes de IA). Eles são ótimos em escrever código e conversar, mas o grande teste é: eles conseguem realmente trabalhar no mundo real? Conseguem usar o Slack para enviar mensagens, o Google Calendar para agendar reuniões ou o Box para organizar arquivos, sem que você precise segurar a mão deles?

O problema é que testar esses robôs é difícil. Se você os deixa soltos na internet real, eles podem bagunçar tudo (excluir arquivos importantes ou enviar e-mails para a pessoa errada). Se você os testa em um "mundo de mentira" (simulado), o teste pode não ser realista o suficiente.

Os autores deste paper criaram o Agent-Diff, uma maneira genial de testar esses robôs. Pense nele como um simulador de voo de alta precisão.

1. O Grande Desafio: O "Mundo de Vidro" vs. O "Mundo Real"

Antes do Agent-Diff, os testes eram assim:

  • Mundo de Vidro (Simulado): Você cria um Slack falso. É seguro, mas os robôs podem aprender truques que não funcionam no Slack de verdade.
  • Mundo Real: Você deixa o robô usar o Slack de verdade. É real, mas se o robô errar, ele apaga o histórico da empresa inteira. Ninguém quer isso.

A Solução do Agent-Diff: Eles criaram um "Espelho Perfeito".
Imagine que você tem uma cópia exata do servidor do Slack, do Google Calendar e do Box, mas que vive dentro de uma caixa de vidro isolada (um "sandbox").

  • O robô acha que está falando com o Slack de verdade.
  • Na verdade, ele está falando com uma cópia perfeita que ninguém mais vê.
  • Se o robô apagar um arquivo na cópia, o arquivo original da empresa está 100% seguro.

2. A Regra do Jogo: "O que mudou?" (State-Diff)

Como sabemos se o robô fez um bom trabalho? Antigamente, os avaliadores olhavam para o "rastro" do robô: "Ele clicou no botão X, depois no Y...". Isso é chato e falho, porque o robô poderia ter feito as coisas de um jeito diferente e ainda assim ter dado certo.

O Agent-Diff usa uma regra mais inteligente, chamada Contrato de Diferença de Estado (State-Diff).

A Analogia da Sala de Estar:
Imagine que você pede para um robô arrumar a sala de estar.

  • Método Antigo: O avaliador olha o vídeo e diz: "Ele pegou o sofá, moveu para a esquerda, depois pegou a mesa...". Se ele moveu a mesa antes do sofá, o avaliador diz: "Errado!".
  • Método Agent-Diff: O avaliador tira uma foto da sala antes e uma foto da sala depois.
    • Ele compara as duas fotos.
    • Se a foto final mostra o sofá no lugar certo, a mesa organizada e o lixo fora, o robô passou, não importa como ele chegou lá.
    • O Pulo do Gato: O avaliador também verifica se o robô não derrubou o vaso de flores (mudanças indesejadas). Se o vaso caiu, o robô reprime, mesmo que tenha arrumado o sofá.

Isso é chamado de "verificação de estado". O foco não é como o robô agiu, mas sim se o resultado final está correto.

3. O Teste: 224 Missões Diferentes

Os autores criaram 224 tarefas reais para os robôs tentarem resolver.

  • Exemplo: "Encontre todos os arquivos sobre a crise econômica de 2001 no Box, apague a cópia errada, renomeie a correta e adicione uma tag."
  • Eles testaram 9 modelos de IA diferentes (como DeepSeek, Claude, Gemini, etc.).

4. O Que Eles Descobriram?

Os resultados foram reveladores:

  • Quem é o melhor? O modelo DeepSeek-v3.2 foi o campeão, acertando 88% das tarefas. O Llama-4-Scout foi o pior, com apenas 38%.
  • O poder dos Manuais (Documentação):
    • Quando os robôs não tinham o manual de instruções da API (o "guia do usuário"), eles tinham que adivinhar e explorar, o que gerava muitos erros.
    • Quando eles tinham o manual, acertaram muito mais.
    • Curiosidade: O manual ajudou muito em tarefas novas (como uma função nova do Box chamada "Hub" que foi lançada recentemente). Isso prova que os robôs estão aprendendo na hora, e não apenas decorando o que já viram na internet.
  • O Erro Comum: Os robôs mais inteligentes não tentam a mesma coisa errada várias vezes. Eles mudam de estratégia, procuram informações e dividem o problema em partes menores. Os robôs mais fracos ficam presos em loops, repetindo o mesmo erro até o tempo acabar.

5. Por que isso importa?

O Agent-Diff é importante porque:

  1. É justo: Todos os robôs jogam no mesmo tabuleiro, com as mesmas regras e o mesmo ambiente.
  2. É seguro: Ninguém corre o risco de apagar dados reais da empresa.
  3. É preciso: Não importa se o robô foi "bonzinho" ou "rápido". O que importa é se a tarefa foi feita corretamente e sem bagunçar o resto do sistema.

Em Resumo

O paper apresenta um novo "campo de provas" para robôs de IA. Em vez de perguntar "o que você fez?", eles perguntam "o que você conseguiu?". E, graças a esse espelho perfeito e à comparação de "antes e depois", agora podemos saber exatamente quais inteligências artificiais estão prontas para trabalhar em nossas empresas e quais ainda precisam de mais treino.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →