← Últimos artigos
💬 NLP

APEX-Agents

O artigo apresenta o APEX-Agents, um benchmark de código aberto com 480 tarefas de longo prazo e multiaplicação criadas por especialistas em finanças e direito para avaliar o desempenho de agentes de IA em ambientes de trabalho realistas, onde o modelo Gemini 3 Flash (Thinking=High) alcançou a pontuação mais alta de 24,0%.

Autores originais: Bertie Vidgen, Austin Mann, Abby Fennelly, John Wright Stanly, Lucas Rothman, Marco Burstein, Julien Benchek, David Ostrofsky, Anirudh Ravichandran, Debnil Sur, Neel Venugopal, Alannah Hsia, Isaac Rob
Publicado 2026-02-24
📖 4 min de leitura☕ Leitura rápida

Autores originais: Bertie Vidgen, Austin Mann, Abby Fennelly, John Wright Stanly, Lucas Rothman, Marco Burstein, Julien Benchek, David Ostrofsky, Anirudh Ravichandran, Debnil Sur, Neel Venugopal, Alannah Hsia, Isaac Robinson, Calix Huang, Olivia Varones, Daniyal Khan, Michael Haines, Austin Bridges, Jesse Boyle, Koby Twist, Zach Richards, Chirag Mahapatra, Brendan Foody, Osvald Nitski

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você é o gerente de uma grande empresa e precisa contratar uma equipe de especialistas: banqueiros, consultores e advogados. Antigamente, você teria que pagar salários altos, esperar meses para treiná-los e lidar com erros humanos.

Hoje, a inteligência artificial promete fazer esse trabalho por você. Mas será que esses "robôs" (agentes de IA) são realmente capazes de resolver problemas complexos do mundo real, ou eles só sabem responder perguntas simples?

É aqui que entra o APEX–Agents, um novo "teste de direção" criado para ver se os carros autônomos (as IAs) conseguem realmente dirigir no trânsito caótico de um escritório, e não apenas em uma pista de treino vazia.

Aqui está o resumo da história, explicado de forma simples:

1. O Que é o APEX–Agents?

Pense no APEX–Agents como um simulador de voo ultra-realista, mas para trabalho de escritório.

  • O Cenário: Em vez de tarefas bobas como "escreva um poema sobre gatos", os criadores do teste construíram 33 "mundos" virtuais. Cada mundo é como um escritório completo, cheio de e-mails, planilhas, contratos, calendários e arquivos confusos.
  • Os Desafos: Eles criaram 480 missões difíceis baseadas em trabalhos reais de banqueiros de investimento, consultores de gestão e advogados corporativos.
    • Exemplo: "Analise os dados financeiros desta empresa, compare com o mercado, faça uma previsão de lucro e envie um e-mail para o cliente com a recomendação, tudo isso sem apagar os arquivos originais."
  • O Objetivo: Ver se a IA consegue navegar por esses arquivos, usar as ferramentas certas (como Excel ou PDF) e entregar o resultado final correto, sem ajuda humana.

2. Quem Participou da Corrida?

O teste colocou 8 "pilotos" (modelos de IA) para competir. Alguns são os gigantes fechados (como o Gemini, GPT e Claude), e outros são modelos de código aberto (que qualquer um pode baixar).

O Resultado da Corrida:

  • O Vencedor (por pouco): O Gemini 3 Flash foi o primeiro a cruzar a linha de chegada, acertando 24% das tarefas.
  • O Vice: O GPT-5.2 ficou logo atrás com 23%.
  • A Realidade: Mesmo o "campeão" falhou em quase 3 de cada 4 tarefas. Isso mostra que, embora a IA seja incrível, ela ainda não é perfeita para trabalhos complexos e longos.
  • Os Menores: Os modelos de código aberto tiveram um desempenho muito pior, acertando menos de 5% das vezes. É como se eles estivessem tentando dirigir um carro de Fórmula 1 sem saber como trocar a marcha.

3. O Que Aconteceu Durante o Teste?

Os pesquisadores observaram como os robôs pensaram e agiram:

  • O Problema da "Volta Eterna": Muitos robôs ficaram presos em loops. Eles tentavam fazer a mesma coisa repetidamente (como abrir e fechar a mesma planilha) até o tempo acabar. Isso é chamado de "doom looping" (loop do fim do mundo).
  • O Gasto de Energia: O vencedor (Gemini 3 Flash) foi o mais "gastador". Ele usou quase 5 vezes mais "combustível" (tokens de processamento) do que o GPT-5.2 para fazer a mesma tarefa. Ele é eficiente em acertar, mas ineficiente em gastar recursos.
  • A Inconsistência: Se você der 8 tentativas para o robô fazer a mesma tarefa, ele consegue acertar em cerca de 40% das vezes (Pass@8). Mas se você pedir para ele acertar todas as 8 vezes seguidas, a taxa cai drasticamente. Isso significa que a IA é como um atleta que faz um ótimo jogo hoje, mas amanhã pode esquecer como jogar.

4. Por Que Isso Importa?

Até agora, os testes de IA eram como pedir para um robô "fazer uma torre de blocos". Eles funcionavam bem. Mas o mundo real é mais como "consertar um avião enquanto ele está voando".

O APEX–Agents mostra que:

  1. A IA ainda não está pronta para assumir o escritório sozinha. Ela comete erros graves, apaga arquivos importantes ou perde o rumo.
  2. O potencial é enorme. Mesmo falhando, a IA consegue fazer parte do trabalho (como rascunhar um relatório), o que já ajuda muito.
  3. Transparência: A equipe que criou o teste (Mercor) liberou tudo de graça. Eles querem que todos vejam onde a IA falha para que possamos consertá-la.

Em Resumo

O APEX–Agents é um teste de realidade para a Inteligência Artificial. Ele nos diz: "Ei, vocês estão indo bem, mas ainda não podem dirigir o carro sozinhos no trânsito de São Paulo. Precisam de mais treino, mais foco e menos distrações."

É um passo importante rumo ao futuro, onde teremos assistentes digitais superpoderosos, mas ainda não chegou o dia em que podemos simplesmente apertar um botão e esquecer o trabalho.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →