← Últimos artigos
🤖 AI

Agents' Last Exam

Este artigo apresenta o Agents' Last Exam (ALE), um benchmark vivo desenvolvido com mais de 250 especialistas da indústria para avaliar agentes de IA em tarefas do mundo real de longo horizonte e economicamente valiosas através de 13 clusters industriais, visando preencher a lacuna entre o sucesso dos benchmarks atuais e a implementação significativa relevante ao PIB.

Autores originais: Yiyou Sun, Xinyang Han, Weichen Zhang, Yuanbo Pang, Tianyu Wang, Yuhan Cao, Yixiao Huang, Chris Duroiu, Haoyun Zhang, Jeffrey Lin, Weishu Zhang, Tyler Zeng, Ying Yan, Bo Liu, Hanson Wen, Mingyang Xu
Publicado 2026-06-05
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Yiyou Sun, Xinyang Han, Weichen Zhang, Yuanbo Pang, Tianyu Wang, Yuhan Cao, Yixiao Huang, Chris Duroiu, Haoyun Zhang, Jeffrey Lin, Weishu Zhang, Tyler Zeng, Ying Yan, Bo Liu, Hanson Wen, Mingyang Xu, Xiaoyuan Liu, Zimeng Chen, Weiyan Shi, Amanda Dsouza, Vincent Sunn Chen, Patrick Bryant, Carl Boettiger, Yamini Rangan, Bradley Rothenberg, Kyle Steinfeld, Arvind Rao, Tapio Schneider, Georgios Yannakakis, Laure Zanna, Kaan Ozbay, Ida Sim, Tarek Zohdi, George Em Karniadakis, Jack Gallant, Teresa Head-gordon, Yushan Li, Wenxi Deng, Tao Sun, Huiqi Wang, Zhun Wang, Justin Xu, Chris Yuhao Liu, Yafei Cheng, Rongwang Hu, Aras Bacho, Shengcao Cao, Zengyi Qin, Yixiong Chen, Hengduan Fan, Hao Liu, Lin Zeng, Shashank Muralidhar Bharadwaj, Litian Gong, Yingxuan Yang, Maojia Song, Ruheng Wang, Zongzheng Zhang, Honglin Bao, Shuo Lu, Jianhong Tu, Zhonghua Wang, Zheng Zhang, Zijiao Chen, yanqiong Jiang, Zhendong Li, Bohan Lyu, Chang Ma, Peiran Xu, Benran Zhang, Shangding Gu, Haoyue Hua, Haoyang Li, Wanzhe Liao, Chengzhi Liu, Junbo Peng, Haoran Sun, Zechen Xu, Bo Chen, Jiayi Cheng, Yi Jiang, Keying Kuang, Yuan Li, Youbang Pan, Ziyan Rao, Alexander Schubert, Yifan Shen, Vincent Siu, Xiatao Sun, Kangqi Zhang, Xiaopan Zhang, Yuchen Zhu, Ishaan Singh Chandok, Lei Ding, Jingxuan Fan, Andrew Glover, Jiaming Hu, Yiran Hu, Wenbo Huang, Zixin Jiang, Haoran Jin, Lukas Kim, Ming Liu, Yang Liu, Alireza Rafiei, Xuhuan Shen, Kunyang Sun, Sophia Sun, Ting Sun, Eric Wang, Yixin Wang, Hanwen Xing, Sihan Xu, Yuzheng Xu, Zhongxing Xu, Zhiling Yan, Boqin Yuan, Ruiqi Zhang, Yifan Zhang, Zibo Zhao, Liana, Santanu Bosu Antu, Haoyue Bai, Carlo Bosio, Joseph Cavanagh, Patricia Cavazos-Rehg, Tianxing Chen, Xuewen Chen, Yipu Chen, Zhu Chenyu, Chen Dai, Stefano De Castro, Yunfu Deng, Kaustubh Dhole, Jiayuan Ding, Chenchen Du, Zhehang Du, Hao Fan, Run-ze Fan, Hengyu Fu, Shi Gu, Yifan Gu, Charlie Guo, Baihe Huang, Baixiang Huang, Rimika Jaiswal, Zhihan Jiang, Ran Jin, Erin Kasson, Xin Lan, Joseph Lee, Deren Lei, Chenyu Li, Daofeng Li, Haitao Li, Hongwei Li, Jingyan Li, Xiao Li, Yi Li, Yinsheng Li, Yuangang Li, Zhixu Li, Wenyu Liang, Longtai Liao, Kevin Qinghong Lin, AndyZeyi Liu, Che Liu, Jiaming Liu, Kaiyuan Liu, Xuan Liu, Pan Lu, Wenbo Lv, Yicheng Lv, Qiuyang Mang, Kyle Montgomery, Yuzhou Nie, Ruoxi Ning, Jorin Overwiening, Xu Pan, Layna Paraboschi, Core Francisco Park, Justin Purnomo, Swati Rajwal, Scott Rankin, Bixuan Ren, Yiren Rong, HaoYang Shang, Ventus Shaw, Fiona Shen, Jiawei Shen, Minqi Shi, Qiu Shi, Huaxiu Yao, Tianneng Shi, Jonah So, Vladislav Susoy, Hannah Szlyk, Haocheng Wang, Jialu Wang, Wei Wang, Xinyu Wang, Zehao Wang, Dowling Wong, Angela Wu, Dehao Wu, Fangyu Wu, Mengyuan "Millie" Wu, Yu Wu, Yuchen Wu, Yuhao Wu, Qingpo Wuwu, Weihang Xiao, Yongyi Xiong, Fan Xu, Ruiling Xu, Mingxuan Yan, Benjamin Yang, Jirong Yang, Sen Yang, Xiaoli Yang, Yushi Yang, Haoran Ye, Xiaohu Yu, Zhengming Yu, Chenlong Zhang, Chi Zhang, Hanning Zhang, Hanwen Zhang, Junge Zhang, Kunpeng Zhang, Song Zhang, Wenjin Zhang, Wenshuo Zhang, Ying Zhang, Yizhi Zhang, Brian Zhao, Qijian Zhao, Yimin Zhao, Yuhaohua Zheng, Liwei Zhou, Tianyue Zhou, Sichen Zhu, Siqi Zhu, Yan Zhu, Yishu Zhu, Jierui Zuo, Chonghao Cai, Helena Casademunt, Wenjia Chen, Benjamin Cheng, Nawen Deng, Rao Fu, Tianfu Fu, Yifan Han, Ren He, Zhenyu He, Qiao Jin, Lang Lang, Yuetai Li, Sylvia Liu, Lu Lu, Qing Lu, Subhabrata Mukherjee, Yunqi Ouyang, Yin Ren, Dawei Shi, Haoran Wu, Zhiyue Wu, Hannah Yao, Zhuoran Yi, Jenny Yu, Rhea Zhan, Hang Zhou, Blake Zhu, Junfan Zhu, Alan Yuille, Yang Liu, Russell Alan Poldrack, Jiachen Li, Zhenglu Li, Molei Tao, Jing Huang, Wenqi Shi, Costas Spanos, Lichao Sun, Chenguang Wang, Orson Xu, Zhen Dong, Hector Gomez, Aylin Caliskan, Ali Emami, Haimin Hu, Zhi Li, Lihui Liu, Murphy Niu, Yi Shao, Jianxin Sun, Mikko Tolonen, Ting Wang, Sanjiv Das, Yanjun Gao, Wenbo Guo, Erika J Schneider, Zhiyong Lu, Mark Mueller, Radha Poovendran, Somayeh Sojoudi, Dawn Song

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você treinou um robô chef por anos. Você o testou em questionários sobre receitas, pediu para ele nomear ingredientes e até o fez seguir instruções simples como "pique a cebola". Nesses testes, ele obtém pontuações perfeitas. Ele parece um gênio culinário.

Mas então, você pede para ele realmente cozinhar um jantar completo e complexo para um restaurante movimentado durante o horário de pico. De repente, o robô queima o molho, esquece o pedido ou se confunde com o fogão. Acontece que ser bom em falar sobre culinária não é o mesmo que ser bom em fazer o trabalho.

Este é exatamente o problema que o artigo "Agents' Last Exam" (ALE) está tentando resolver.

O Problema: A Armadilha do "Questionário"

Por muito tempo, pesquisadores de IA têm testado seus agentes de IA (programas de computador inteligentes) em benchmarks que são como testes de múltipla escolha. Esses testes são ótimos para medir o que uma IA sabe, mas não medem o que uma IA consegue fazer no mundo real.

Os autores argumentam que o fato de uma IA conseguir passar em um teste de matemática ou em um questionário de programação não significa que ela possa realmente administrar um negócio, projetar uma ponte ou gerenciar a escala de um hospital. A lacuna entre "passar no teste" e "gerar lucro" é enorme.

A Solução: O "Último Exame"

Para corrigir isso, a equipe criou o ALE (Agents' Last Exam). Pense nisso não como um questionário, mas como uma entrevista de emprego real e final para a IA.

Em vez de perguntar "Qual é a capital da França?" ou "Escreva um loop em Python", o ALE entrega à IA um projeto real, caótico e de vários dias, que um profissional humano realmente faria.

  • As Tarefas: O exame abrange 55 campos de trabalho diferentes (como engenharia, medicina, finanças e design de videogames).
  • A Dificuldade: As tarefas são de "longo horizonte" (long-horizon), o que significa que levam horas ou dias para serem concluídas. Elas exigem que a IA abra diferentes programas de software, clique em botamentos, escreva código, verifique arquivos e corrija seus próprios erros, exatamente como um funcionário humano.
  • A Origem: Estas não são tarefas falsas inventadas por pesquisadores. São projetos reais que mais de 250 especialistas da indústria realizaram em seus empregos. Os especialistas enviaram seus trabalhos passados, e a equipe os transformou em testes.

Como o Exame Funciona

Imagine que a IA está sentada em um computador em um escritório virtual.

  1. A Atribuição: A IA recebe uma tarefa do mundo real, como "Projetar um molde para uma peça de carro" ou "Analisar estes exames de raio-X médicos".
  2. As Ferramentas: A IA tem que usar softwares reais (como ferramentas de modelagem 3D, planilhas financeiras ou softwares de imagem médica) exatamente como um humano faria. Ela tem que clicar em menus, digitar comandos e gerenciar arquivos.
  3. A Avaliação: Esta é a parte inteligente. O exame não depende de um professor humano para olhar o resultado e dizer: "Parece bom!". Isso é muito lento e subjetivo. Em vez disso, o exame utiliza verificadores automatizados.
    • Se a tarefa era construir um modelo 3D, o computador verifica se as dimensões estão exatamente corretas.
    • Se a tarefa era escrever um relatório financeiro, o computador verifica se as contas batem corretamente.
    • Se a IA falha em um "portal" (como cometer um erro que quebraria uma máquina), ela recebe zero imediatamente, não importa o quão bonito seja o restante do trabalho.

Os Resultados: A IA Ainda Está na Escola

O artigo testou os agentes de IA mais inteligentes do mundo neste exame. Os resultados foram sóbrios:

  • O Nível "Fácil": Mesmo os melhores agentes de IA passaram em apenas cerca de 30% das tarefas consideradas de "curto prazo" (as mais fáceis).
  • O Nível "Difícil": Nas tarefas mais difíceis (o nível do "Último Exame"), a taxa de aprovação foi de 0%. A IA não conseguiu realizá-las de forma alguma.
  • A Lacuna: Uma IA que obtém 82% em um teste de programação padrão (Terminal-Bench) obtém apenas cerca de 25% neste exame do mundo real.

Os autores chamam isso de "Último Exame" porque representa o obstáculo final. Se uma IA conseguir passar nisso, significa que ela está pronta para realmente desempenhar o trabalho e substituir um trabalhador humano. No momento, o artigo diz que a IA ainda está longe de passar.

Por Que Isso Importa

O artigo não é apenas sobre criar um teste mais difícil; é sobre mudar o objetivo.

  • Objetivo Atual: Fazer a IA pontuar 100% em questionários.
  • Novo Objetivo: Fazer a IA pontuar 100% em trabalhos reais que geram valor econômico (PIB).

Os autores acreditam que, ao focar nessas tarefas reais e verificáveis, pararemos de construir IAs que são apenas boas em falar e começaremos a construir IAs que são boas em trabalhar. Até que a IA consiga passar neste "Último Exame", ela não está pronta para a força de trabalho real.

Analogia de Resumo

Pense nos atuais benchmarks de IA como testes teóricos de direção. Você pode memorizar todas as regras de trânsito e obter uma pontuação perfeita. Mas o ALE é o exame prático de direção, onde você tem que realmente dirigir um carro através de um tráfego pesado, fazer baliza e navegar por uma zona de construção sem bater em nada.

O artigo diz: "Nossos motoristas de IA são ótimos no teste teórico, mas ainda estão batendo no teste prático. Vamos parar de celebrar as pontuações teóricas e começar a ensiná-los a dirigir."

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →