← Últimos artigos
💻 computer science

ClawForge: Generating Executable Interactive Benchmarks for Command-Line Agents

Este artigo apresenta o ClawForge, um framework de benchmark apoiado em geradores que avalia agentes de linha de comando em fluxos de trabalho executáveis com conflitos de estado persistentes, revelando que os modelos de ponta atuais enfrentam dificuldades significativas na inspeção de estados existentes e no manuseio de artefatos preexistentes, alcançando no máximo 45,3% de precisão estrita.

Autores originais: Yuxiang Lai, Peng Xia, Haonian Ji, Kaiwen Xiong, Kaide Zeng, Jiaqi Liu, Fang Wu, Jike Zhong, Zeyu Zheng, Cihang Xie, Huaxiu Yao

Publicado 2026-05-15
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Yuxiang Lai, Peng Xia, Haonian Ji, Kaiwen Xiong, Kaide Zeng, Jiaqi Liu, Fang Wu, Jike Zhong, Zeyu Zheng, Cihang Xie, Huaxiu Yao

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

A Visão Geral: O Problema da "Mesa Bagunçada"

Imagine que você contrata um assistente robótico muito inteligente para organizar sua vida. A maioria dos testes que fazemos com esses robôs é como dar a eles uma mesa nova e vazia e dizer: "Por favor, escreva uma lista de tarefas". O robô escreve a lista e nós verificamos se as palavras estão corretas.

Mas, no mundo real, sua mesa nunca está vazia. Ela está coberta de projetos inacabados, bilhetes adesivos antigos, instruções conflitantes e arquivos desatualizados. Um teste real da inteligência de um robô não é apenas "Ele consegue escrever uma lista?", mas "Ele consegue olhar para essa mesa bagunçada, descobrir o que está quebrado, consertar as coisas antigas sem apagar as boas e terminar o trabalho?"

Este artigo apresenta o ClawForge, uma nova maneira de testar agentes de IA (robôs) que se concentra inteiramente nesse cenário de "mesa bagunçada".


O que é o ClawForge? (A "Fábrica de Cenários")

Os autores perceberam que criar esses testes de "mesa bagunçada" manualmente é muito difícil e muito lento. Se você quiser testar 100 cenários bagunçados diferentes, teria que construir manualmente 100 bagunças diferentes.

O ClawForge é uma fábrica automatizada.
Em vez de humanos escreverem cada teste, os pesquisadores construíram um sistema que gera os testes. Ele pega um modelo (como "Consertar um cronograma de lançamento quebrado") e preenche automaticamente os detalhes (diferentes cidades, diferentes datas, diferentes erros).

  • A Saída: Ele cria uma "tarefa executável" completa. Isso não é apenas uma pergunta; é uma mini-simulação com um estado inicial (a mesa bagunçada), um conjunto de regras e uma maneira de avaliar o resultado.
  • O Objetivo: Verificar se a IA consegue lidar com Conflito de Estado. Isso significa lidar com coisas que já estão lá, algumas das quais podem estar erradas, desatualizadas ou duplicadas.

Como o Teste Funciona (O "Loop do Jogo")

Pense no teste como um nível de videogame onde a IA é o jogador:

  1. A Configuração: O jogo carrega um "arquivo salvo" que já tem alguns itens no tabuleiro. Talvez haja uma tarefa chamada "Consertar o Servidor" que já esteja lá, mas marcada como "Baixa Prioridade" (o que está errado).
  2. A Instrução: A IA recebe um comando: "O conserto do servidor está errado. Conserte-o, mas não apague as outras tarefas válidas."
  3. A Ação: A IA digita comandos um por um (como um humano usando uma linha de comando).
  4. A Avaliação: Esta é a parte mais importante. O sistema não verifica se a IA digitou exatamente as mesmas palavras que um humano teria. Em vez disso, ele verifica o estado final da mesa.
    • A tarefa antiga e errada foi removida?
    • A tarefa nova e correta está lá?
    • A IA acidentalmente criou uma duplicata da tarefa?
    • Ela deixou as coisas válidas em paz?

Se a mesa final parecer perfeita, a IA passa. Se parecer bagunçada, ela falha.

Os Resultados: Os Robôs Ainda Estão Aprendendo

Os autores testaram sete dos modelos de IA mais inteligentes disponíveis (de empresas como OpenAI, Anthropic e Kimi) neste novo benchmark. Os resultados foram surpreendentes e humildes:

  • A "Pontuação Perfeita" é Rara: Mesmo o melhor modelo de IA conseguiu cerca de 45% das tarefas perfeitamente corretas. Isso significa que o benchmark é difícil e ainda não foi "resolvido".
  • O Problema do "Conserto Errado": Um tipo específico de falha foi muito comum. Quando solicitados a substituir um item errado, os modelos frequentemente ficavam presos. Eles podiam apagar o item errado, mas esquecer de adicionar o novo, ou podiam adicionar o novo, mas deixar o antigo e quebrado lá.
    • Analogia: Imagine que você é instruído a trocar um pneu furado. A IA tira o pneu furado, mas esquece de colocar o estepe. Ou, ela coloca o estepe, mas deixa o pneu furado rolando no chão.
  • O Problema do "Não Toque Nisso": Outra falha comum ocorria quando a mesa já estava quase pronta. A IA veria uma tarefa que já estava correta e, em vez de simplesmente deixá-la em paz, tentaria "consertá-la" novamente, criando uma duplicata.
    • Analogia: Você diz ao robô: "O café já está pronto." O robô diz: "Ok," e imediatamente prepara uma segunda cafeteira, criando uma bagunça.
  • Eficiência Importa: Alguns modelos levaram muitos passos demais para resolver problemas simples, enquanto outros foram rápidos, mas cometeram erros. Os melhores desempenhos foram aqueles que verificaram o estado existente primeiro antes de agir.

Os Dois Desafios Mais Difíceis

O artigo destaca dois tipos específicos de cenários de "mesa bagunçada" que confundiram quase todos os modelos:

  1. Substituição de Estado Errado: A IA precisa identificar algo que está errado e substituí-lo por algo certo, mantendo tudo o mais seguro. Esta foi a tarefa mais difícil; o melhor modelo acertou apenas 17% das vezes.
  2. Retomada de Fluxo de Trabalho Interrompido: A IA precisa entrar em uma sala onde alguém começou um projeto, terminar as peças faltantes e não refazer as partes que já foram feitas. A lacuna entre os melhores e os piores modelos aqui foi enorme (de 17% a 90%), mostrando que alguns modelos são muito melhores em "ler a sala" antes de entrar.

Por Que Isso Importa

Os autores argumentam que não podemos mais testar a IA apenas em tarefas "limpas". O trabalho real envolve lidar com história, erros e progresso parcial. O ClawForge é uma ferramenta para medir se uma IA está realmente pronta para trabalhar em um escritório real, onde as coisas raramente são perfeitas e começar do zero raramente é uma opção.

Em resumo: O ClawForge é uma academia para agentes de IA aprenderem a limpar um quarto bagunçado sem quebrar os móveis que já estão funcionando. Atualmente, mesmo os agentes de IA mais fortes ainda estão tropeçando nos próprios pés nesta academia.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →