← Últimos artigos
💻 computer science

TerminalWorld: Benchmarking Agents on Real-World Terminal Tasks

O artigo apresenta o TerminalWorld, um mecanismo de dados escalável que realiza engenharia reversa automática de 1.530 tarefas de terminal de alta fidelidade a partir de 80.870 gravações do mundo real para avaliar agentes de IA, revelando que os modelos de ponta atuais têm dificuldades com fluxos de trabalho autênticos e apresentam desempenho inferior em comparação com benchmarks existentes curados por especialistas.

Autores originais: Zhaoyang Chu, Jiarui Hu, Xingyu Jiang, Pengyu Zou, Han Li, Chao Peng, Peter O'Hearn, Earl T. Barr, Mark Harman, Federica Sarro, He Ye

Publicado 2026-05-22
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Zhaoyang Chu, Jiarui Hu, Xingyu Jiang, Pengyu Zou, Han Li, Chao Peng, Peter O'Hearn, Earl T. Barr, Mark Harman, Federica Sarro, He Ye

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está tentando ensinar um robô a usar a "linha de comando" de um computador — aquela tela preta onde programadores digitam comandos de texto em vez de clicar em ícones. Por muito tempo, a maneira como testávamos esses robôs era como dar a eles um quebra-cabeça criado por um professor rigoroso. O professor diria: "Aqui está um enigma difícil; resolva-o!" Se o robô resolvesse o enigma, pensávamos que ele era inteligente.

Mas os autores deste artigo, TERMINALWORLD, perceberam que havia um problema: A vida real não é um enigma. A vida real é bagunçada, imprevisível e cheia de ferramentas específicas que as pessoas realmente usam todos os dias. Um robô capaz de resolver um enigma ainda pode falhar quando solicitado a consertar realmente um servidor ou organizar arquivos em um escritório real.

Veja como eles corrigiram isso, explicado de forma simples:

1. A Abordagem "Mosca na Parede"

Em vez de inventar tarefas falsas, os pesquisadores foram a um site público chamado asciinema. Isso é como um canal do YouTube, mas para telas de computador. Desenvolvedores voluntariamente fazem upload de gravações de suas sessões reais de trabalho.

  • A Analogia: Imagine que você quer ensinar um estudante a cozinhar. Em vez de escrever um livro de receitas do zero (que pode ser muito perfeito ou estranho), você vai a uma cozinha, grava 80.000 horas de chefs reais cozinhando refeições reais e, em seguida, pergunta: "Ok, o que eles acabaram de fazer?"
  • O Resultado: Eles coletaram 80.870 gravações reais de desenvolvedores trabalhando.

2. O Motor "Chef Robô"

Gravações brutas são bagunçadas. Elas têm erros de digitação, tentativas falhas e longas listas de mensagens do sistema que não importam. Os pesquisadores construíram um "motor de dados" especial (um sistema de software inteligente) para limpar isso.

  • Passo 1: Entendendo o Objetivo. O motor analisa uma gravação bagunçada e pergunta a uma IA superinteligente: "O que essa pessoa estava realmente tentando alcançar?" Ele transforma um log bagunçado em uma instrução clara: "Bloqueie esses endereços IP ruins e salve a lista neste arquivo."
  • Passo 2: Construindo a Cozinha. A gravação não diz quais ferramentas o chef tinha. O motor precisa adivinhar quais softwares e arquivos eram necessários, criar uma cópia digital perfeita daquele ambiente de computador (usando algo chamado "contêiner Docker") e garantir que os comandos originais funcionariam realmente ali.
  • Passo 3: A Rede de Segurança. Como não há um professor para avaliar o trabalho, o motor cria seu próprio "teste". Ele executa a solução e verifica: "O arquivo apareceu? A lista está correta?" Se o teste falhar, ele corrige o teste até que esteja perfeito.

3. O Novo Exame "Mundo Real"

A partir dessas 80.000 gravações, eles criaram um novo banco de testes massivo chamado TERMINALWORLD.

  • Possui 1.530 tarefas validadas.
  • Abrange 18 tipos diferentes de trabalhos reais, desde configurar servidores em nuvem até corrigir erros em bancos de dados.
  • Utiliza 1.280 comandos de computador diferentes, 91% dos quais nunca foram vistos em testes anteriores.

Eles também criaram uma versão menor, superdifícil, chamada TERMINALWORLD-VERIFIED (200 tarefas) que foi verificada duas vezes por humanos para garantir que fosse 100% precisa.

4. Os Resultados Chocantes

Eles submeteram os modelos de IA mais inteligentes do mundo (como as versões mais recentes de Claude, GPT e Gemini) e seus frameworks de "agente" (o software que ajuda a IA a usar o computador) a esse novo teste.

Veja o que eles descobriram:

  • O "Paradoxo da Eficiência": Quanto mais inteligente a IA, mais ela às vezes luta. A melhor IA aprovou apenas 62,5% das tarefas. Quando falhavam, não desistiam simplesmente; continuavam tentando, desperdiçando enormes quantidades de tempo e dinheiro explorando os caminhos errados. É como um estudante que continua relendo o mesmo parágrafo confuso repetidamente em vez de pedir ajuda.
  • A Lacuna "Quebra-Cabeça vs. Realidade": Havia quase nenhuma conexão entre o desempenho de uma IA nos antigos testes de "enigma" (Terminal-Bench) e o desempenho neste novo teste de "vida real".
    • Analogia: Uma IA pode ser campeã em resolver quebra-cabeças de Sudoku (o teste antigo), mas falhar completamente em realmente dirigir um carro no trânsito (o novo teste). Os testes antigos eram simplesmente muito diferentes do trabalho real.
  • Agentes vs. Humanos: Quando a IA resolvia uma tarefa, raramente fazia isso da mesma maneira que o humano na gravação. Eles seguiam caminhos diferentes para chegar ao mesmo destino. Isso é realmente bom! Significa que a IA não está apenas copiando; está descobrindo seu próprio caminho, mesmo que esse caminho seja mais longo que o do humano.

A Conclusão

O artigo argumenta que não podemos mais confiar em testes criados por especialistas em um laboratório. Para saber se uma IA está realmente pronta para trabalhar no mundo real, devemos testá-la em fluxos de trabalho humanos reais que são bagunçados, complexos e constantemente mudantes.

TERMINALWORLD é uma ferramenta que transforma automaticamente o trabalho humano real em um teste, garantindo que, à medida que os desenvolvedores mudam a maneira como trabalham, nossos testes para IA evoluam junto com eles. É uma mudança de testar "você consegue resolver um quebra-cabeça?" para "você consegue fazer o trabalho?"

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →