EnterpriseClawBench: Benchmarking Agents from Real Workplace Sessions
Este artigo apresenta o EnterpriseClawBench, um benchmark derivado de sessões proprietárias de agentes empresariais do mundo real que avalia 852 tarefas reproduzíveis para demonstrar que os modelos atuais alcançam sucesso limitado (0,663) e que as avaliações futuras devem adotar um framework multidimensional reportando combinações de harness-modelo, entrega de artefato, qualidade visual, custo, tempo de execução e comportamento de transferência de habilidades, em vez de depender de uma pontuação única.
Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo
Imagine que você tem um funcionário novo e muito inteligente que consegue ler arquivos, usar ferramentas e escrever relatórios. Você quer saber se ele é realmente bom no trabalho.
A maioria dos testes anteriores para "funcionários" de IA eram como dar um teste surpresa em uma sala de aula silenciosa. Eles eram solicitados a responder perguntas ou escrever código de forma isolada. Mas o trabalho real de escritório não é um teste silencioso; é um ambiente caótico e barulhento onde você tem que ler e-mails bagunçados, abrir anexos específicos, consertar links quebrados e entregar um produto finalizado (como uma planilha ou uma apresentação) até o final do dia.
Este artigo apresenta o EnterpriseClawBench, uma nova maneira de testar agentes de IA baseada em sessões de trabalho reais e efetivas de uma empresa, em vez de testes de prática inventados.
Aqui está a divisão do que eles fizeram e descobriram, usando analogias simples:
1. A "Usina de Reciclagem" para o Trabalho Real
Os pesquisadores começaram com um arquivo massivo de milhares de sessões de trabalho reais da própria empresa. Essas sessões eram bagunçadas: continham chats privados, caminhos de arquivos quebrados e instruções vagas.
Pense neste arquivo como uma pilha de minério bruto e não refinado. O artigo descreve um "pipeline de construção" (uma usina de reciclagem) que limpa esse minério:
- O Filtro: Eles descartaram tarefas que eram curtas demais, tinham arquivos ausentes ou dependiam de links que estavam quebrados.
- O Tradutor: Eles pegaram conversas de múltiplos turnos e bagunçadas e as reescreveram em instruções claras de etapa única (como transformar uma corrente de e-mails prolixa em uma lista de "Tarefas a Fazer" clara).
- A Verificação de Segurança: Eles garantiram que cada tarefa pudesse ser executada repetidamente sem precisar de senhas secretas da empresa.
De 5.291 tentativas brutas, eles chegaram a 852 tarefas de alta qualidade e reproduzíveis. Eles também criaram uma versão "Lite" de 120 tarefas que foram verificadas manualmente por humanos para garantir que a qualidade fosse perfeita.
2. O Teste "Motorista e Carro"
Uma descoberta importante deste artigo é que você não pode simplesmente testar o modelo de IA (o "motor") no vácuo. Você tem que testar a IA + o Framework de Software (o "carro") juntos.
- A Analogia: Imagine testar um motor de Ferrari. Se você o colocar em uma caminhonete enferrujada e quebrada, ele não terá um bom desempenho. Se você o colocar em um carro esportivo elegante, ele voa.
- O Resultado: O artigo testou 32 combinações diferentes de "Motores" (como GPT-5.5, Sonnet 4.6) e "Carros" (frameworks de software como Claude Code, OpenClaw, Hermes).
- A Surpresa: Alguns motores poderosos tiveram um desempenho terrível quando combinados com o framework errado. Por exemplo, um modelo de alto nível teve sua pontuação reduzida significativamente quando usado com o framework "Hermes", porque o framework bloqueou o modelo de realizar certas ações necessárias. Isso prova que o invólucro de software importa tanto quanto o cérebro da IA.
3. O "Boletim" é Mais do que uma Única Nota
Na escola, você recebe uma nota final. Neste benchmark, os pesquisadores dizem que isso não é suficiente para o trabalho real. Eles avaliam os agentes em um boletim multidimensional:
- Eles terminaram o trabalho? (Entrega de artefato)
- Eles foram rápidos? (Tempo de execução)
- Custou muito dinheiro? (Custo)
- O arquivo é realmente utilizável? (Qualidade visual)
- Eles entenderam o contexto? (Qualidade semântica)
A Verificação da Realidade: Mesmo a melhor combinação (Codex com GPT-5.5) obteve apenas 66,3%. Isso significa que mesmo nossos agentes de IA mais inteligentes ainda estão lutando para lidar com tarefas de escritório do mundo real perfeitamente. Eles frequentemente perdem detalhes, falham em encontrar o arquivo correto ou produzem um relatório que parece bom, mas tem os números errados.
4. O Experimento de "Transferência de Habilidade"
Os pesquisadores queriam ver se uma IA poderia "aprender" uma habilidade de uma tarefa e aplicá-la a outra tarefa semelhante.
- O Experimento: Eles pegaram uma IA que havia praticado a criação de "Páginas Web Frontend" e deram a ela uma nova tarefa de página web que ela nunca tinha visto antes.
- O "Professor" vs. O "Aluno": Eles descobriram que a qualidade da "habilidade" dependia inteiramente de quem a ensinava.
- Se uma IA forte (como GPT-5.5) destilasse a habilidade, a IA estudante melhorava.
- Se uma IA mais fraca tentasse ensinar a habilidade, a IA estudante na verdade ficava pior.
- A Lição: Você não pode simplesmente assumir que uma IA "aprendeu" uma habilidade. A qualidade do ensino importa, e às vezes um mau professor estraga um bom aluno.
5. O Problema do Juiz "Humano vs. Robô"
Para avaliar essas tarefas, eles usaram juízes de IA (robôs avaliando robôs).
- Tarefas de Texto: Os juízes de IA foram muito bons em avaliar relatórios de texto, aproximando-se dos juízes humanos.
- Tarefas Visuais: Quando se tratava de avaliar planilhas, slides ou imagens, os juízes de IA foram muito pouco confiáveis. Eles frequentemente deram notas altas para resultados bagunçados que os humanos rejeitariam.
- A Conclusão: Somos bons em testar se uma IA consegue escrever uma frase, mas ainda somos ruins em testar se uma IA consegue criar um documento de negócios profissional.
Resumo
EnterpriseClawBench é um choque de realidade para a indústria de IA. Ele diz:
- Pare de testar a IA em ambientes limpos e falsos; teste-os em arquivos reais e bagunçados.
- O framework de software que você usa é tão importante quanto o próprio modelo de IA.
- Os agentes de IA atuais ainda não estão prontos para substituir totalmente os trabalhadores humanos em empregos de escritório complexos; eles ainda cometem erros demais para serem confiados com o produto final.
- Precisamos de melhores maneiras de avaliar saídas visuais, não apenas texto.
O artigo conclui que, embora a IA esteja melhorando, a lacuna entre "conversar com uma IA" e "operar um departamento de negócios de forma confiável" ainda é ampla.
Afogado em artigos na sua área?
Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.