← Últimos artigos
🤖 machine learning

OSWorld-Human: Benchmarking the Efficiency of Computer-Use Agents

Este artigo apresenta o OSWorld-Human, um benchmark anotado manualmente que revela que os agentes de uso de computador atuais sofrem com latência e ineficiência proibitivas, principalmente devido a chamadas excessivas do modelo para planejamento e reflexão, resultando na necessidade de realizar de 2,7 a 4,3 vezes mais etapas do que os humanos para concluir tarefas.

Autores originais: Reyna Abhyankar, Qi Qi, Yiying Zhang

Publicado 2026-05-19
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Reyna Abhyankar, Qi Qi, Yiying Zhang

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você contrata um assistente pessoal muito inteligente, mas incrivelmente lento, para realizar uma tarefa simples no seu computador, como alterar o tamanho da fonte em um documento. Você espera que isso leve 30 segundos. Em vez disso, seu assistente leva 12 minutos. Por quê?

Este artigo, OSWorld-Human, investiga exatamente esse problema. Ele examina "Agentes de Uso de Computador" (programas de IA que controlam seu mouse e teclado) e pergunta: "Por que eles são tão lentos e como podemos torná-los mais rápidos?"

Aqui está a análise de suas descobertas usando analogias simples.

1. O Problema: O Assistente "Superpensador"

Os pesquisadores descobriram que, embora esses agentes de IA estejam ficando melhores em concluir o trabalho (precisão), eles são terríveis em quão rápido o fazem (eficiência).

  • O Humano vs. O Robô: Um especialista humano pode alterar o espaçamento entre linhas em um documento em menos de 30 segundos. O agente de IA leva 12 minutos.
  • O Gargalo: O atraso não ocorre porque a IA está clicando no mouse lentamente. É porque a IA para para pensar constantemente.
    • A Analogia: Imagine que você está dirigindo até o supermercado. Um motorista humano apenas dirige. Este motorista de IA para em cada cruzamento para ligar para um consultor superinteligente pelo telefone e perguntar: "Esta é a curva certa? Devo virar à esquerda? Virei à esquerda corretamente? E a próxima curva?"
    • A Realidade: A IA liga para um "cérebro" massivo (um Modelo de Linguagem de Grande Escala) para planejar o próximo movimento, julgar se o movimento funcionou e refletir sobre o que aconteceu. Essas ligações telefônicas consomem a maior parte do tempo. Na verdade, apenas as etapas de "planejamento" e "julgamento" consomem cerca de 75% a 96% do tempo total!

2. A Investigação: Desmontando os Passos

Os pesquisadores observaram dois agentes de IA populares (Agent S2 e GTA1) tentando resolver 39 tarefas de computador diferentes. Eles analisaram cada segundo do processo.

  • O Imposto do "Pensamento": Toda vez que a IA dá um passo, ela precisa enviar uma mensagem enorme para seu cérebro. À medida que a tarefa fica mais longa, a mensagem aumenta porque precisa incluir o histórico de tudo o que foi feito antes.
    • Analogia: É como escrever uma entrada de diário. No dia 1, você escreve uma frase. No dia 50, você precisa reescrever todo o livro desde o dia 1 apenas para adicionar uma nova frase. Isso faz com que as etapas posteriores levem 3 vezes mais do que as etapas iniciais.
  • O Loop do "Caminho Errado": Às vezes, a IA sabe o que fazer (por exemplo, "Clique no botão Abrir"), mas não consegue encontrar onde clicar na tela. Ela clica no local errado, percebe que está errado e tenta novamente.
    • O Custo: Esse "ficar preso" ocorre frequentemente. Em um caso, uma IA tentou abrir uma pasta e ficou presa em um loop por 27 minutos, desperdiçando US$ 8,47 em custos de computação, apenas porque não conseguiu encontrar o local certo na tela.

3. A Solução: O "Padrão Humano" (OSWorld-Human)

Para provar o quão ineficientes são esses robôs, os pesquisadores criaram um novo benchmark chamado OSWorld-Human.

  • O que é? Eles percorreram manualmente todas as 369 tarefas e anotaram o caminho mais curto e lógico que um humano seguiria para concluí-las.
  • O Truque do "Agrupamento": Eles notaram que os humanos frequentemente fazem várias coisas de uma só vez, sem parar para pensar.
    • Analogia: Um humano vê uma caixa de texto, digita um nome e aperta "Enter" em um movimento fluido. A IA, no entanto, para após ver a caixa, liga para seu cérebro para planejar a digitação, para novamente para planejar apertar "Enter" e liga para seu cérebro novamente.
    • A Descoberta: Os pesquisadores descobriram que muitas ações poderiam ser "agrupadas". Se a IA pudesse fazer três cliques em um único "pensamento", economizaria quantidades massivas de tempo.

4. O Veredito: Os Robôs Estão Desperdiçando Passos

Os pesquisadores testaram 16 agentes de IA diferentes contra seu novo "Padrão Humano".

  • O Resultado: Mesmo os agentes de IA melhores levaram 2,7 a 4,3 vezes mais passos do que um humano precisava para concluir a mesma tarefa.
  • A Pontuação: Eles criaram uma nova pontuação chamada Pontuação de Eficiência Ponderada (WES).
    • Se uma IA conclui o trabalho, mas leva 4 vezes mais do que o necessário, sua pontuação cai drasticamente.
    • A principal IA no ranking, que parecia excelente nos testes antigos, obteve apenas 15,6% nesta nova prova de eficiência. Isso significa que ela está realizando muito trabalho desnecessário.

Resumo

O artigo conclui que os agentes de computador de IA atuais são como alunos brilhantes, mas desajeitados. Eles sabem a resposta, mas passam tanto tempo levantando a mão, esperando pelo professor e relendo suas anotações que nunca terminam a prova a tempo.

Para corrigir isso, o artigo sugere três coisas principais:

  1. Pare de superpensar: Reduza o número de vezes que a IA liga para seu "cérebro" para planejar e julgar.
  2. Agrupe ações: Permita que a IA execute múltiplos passos (como digitar e apertar Enter) em um único pensamento.
  3. Melhore na localização: Melhore a capacidade da IA de ver exatamente onde clicar para que ela não fique presa em loops.

O objetivo não é apenas tornar a IA mais inteligente, mas torná-la mais rápida e mais prática para uso no mundo real.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →