← Últimos artículos
🤖 AI

Agents' Last Exam

Este artículo presenta Agents' Last Exam (ALE), un benchmark vivo desarrollado con más de 250 expertos de la industria para evaluar agentes de IA en tareas del mundo real de largo alcance y económicamente valiosas a través de 13 clústeres industriales, con el objetivo de cerrar la brecha entre el éxito actual de los benchmarks y un despliegue significativo relevante para el PIB.

Autores originales: Yiyou Sun, Xinyang Han, Weichen Zhang, Yuanbo Pang, Tianyu Wang, Yuhan Cao, Yixiao Huang, Chris Duroiu, Haoyun Zhang, Jeffrey Lin, Weishu Zhang, Tyler Zeng, Ying Yan, Bo Liu, Hanson Wen, Mingyang Xu
Publicado 2026-06-05
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Yiyou Sun, Xinyang Han, Weichen Zhang, Yuanbo Pang, Tianyu Wang, Yuhan Cao, Yixiao Huang, Chris Duroiu, Haoyun Zhang, Jeffrey Lin, Weishu Zhang, Tyler Zeng, Ying Yan, Bo Liu, Hanson Wen, Mingyang Xu, Xiaoyuan Liu, Zimeng Chen, Weiyan Shi, Amanda Dsouza, Vincent Sunn Chen, Patrick Bryant, Carl Boettiger, Yamini Rangan, Bradley Rothenberg, Kyle Steinfeld, Arvind Rao, Tapio Schneider, Georgios Yannakakis, Laure Zanna, Kaan Ozbay, Ida Sim, Tarek Zohdi, George Em Karniadakis, Jack Gallant, Teresa Head-gordon, Yushan Li, Wenxi Deng, Tao Sun, Huiqi Wang, Zhun Wang, Justin Xu, Chris Yuhao Liu, Yafei Cheng, Rongwang Hu, Aras Bacho, Shengcao Cao, Zengyi Qin, Yixiong Chen, Hengduan Fan, Hao Liu, Lin Zeng, Shashank Muralidhar Bharadwaj, Litian Gong, Yingxuan Yang, Maojia Song, Ruheng Wang, Zongzheng Zhang, Honglin Bao, Shuo Lu, Jianhong Tu, Zhonghua Wang, Zheng Zhang, Zijiao Chen, yanqiong Jiang, Zhendong Li, Bohan Lyu, Chang Ma, Peiran Xu, Benran Zhang, Shangding Gu, Haoyue Hua, Haoyang Li, Wanzhe Liao, Chengzhi Liu, Junbo Peng, Haoran Sun, Zechen Xu, Bo Chen, Jiayi Cheng, Yi Jiang, Keying Kuang, Yuan Li, Youbang Pan, Ziyan Rao, Alexander Schubert, Yifan Shen, Vincent Siu, Xiatao Sun, Kangqi Zhang, Xiaopan Zhang, Yuchen Zhu, Ishaan Singh Chandok, Lei Ding, Jingxuan Fan, Andrew Glover, Jiaming Hu, Yiran Hu, Wenbo Huang, Zixin Jiang, Haoran Jin, Lukas Kim, Ming Liu, Yang Liu, Alireza Rafiei, Xuhuan Shen, Kunyang Sun, Sophia Sun, Ting Sun, Eric Wang, Yixin Wang, Hanwen Xing, Sihan Xu, Yuzheng Xu, Zhongxing Xu, Zhiling Yan, Boqin Yuan, Ruiqi Zhang, Yifan Zhang, Zibo Zhao, Liana, Santanu Bosu Antu, Haoyue Bai, Carlo Bosio, Joseph Cavanagh, Patricia Cavazos-Rehg, Tianxing Chen, Xuewen Chen, Yipu Chen, Zhu Chenyu, Chen Dai, Stefano De Castro, Yunfu Deng, Kaustubh Dhole, Jiayuan Ding, Chenchen Du, Zhehang Du, Hao Fan, Run-ze Fan, Hengyu Fu, Shi Gu, Yifan Gu, Charlie Guo, Baihe Huang, Baixiang Huang, Rimika Jaiswal, Zhihan Jiang, Ran Jin, Erin Kasson, Xin Lan, Joseph Lee, Deren Lei, Chenyu Li, Daofeng Li, Haitao Li, Hongwei Li, Jingyan Li, Xiao Li, Yi Li, Yinsheng Li, Yuangang Li, Zhixu Li, Wenyu Liang, Longtai Liao, Kevin Qinghong Lin, AndyZeyi Liu, Che Liu, Jiaming Liu, Kaiyuan Liu, Xuan Liu, Pan Lu, Wenbo Lv, Yicheng Lv, Qiuyang Mang, Kyle Montgomery, Yuzhou Nie, Ruoxi Ning, Jorin Overwiening, Xu Pan, Layna Paraboschi, Core Francisco Park, Justin Purnomo, Swati Rajwal, Scott Rankin, Bixuan Ren, Yiren Rong, HaoYang Shang, Ventus Shaw, Fiona Shen, Jiawei Shen, Minqi Shi, Qiu Shi, Huaxiu Yao, Tianneng Shi, Jonah So, Vladislav Susoy, Hannah Szlyk, Haocheng Wang, Jialu Wang, Wei Wang, Xinyu Wang, Zehao Wang, Dowling Wong, Angela Wu, Dehao Wu, Fangyu Wu, Mengyuan "Millie" Wu, Yu Wu, Yuchen Wu, Yuhao Wu, Qingpo Wuwu, Weihang Xiao, Yongyi Xiong, Fan Xu, Ruiling Xu, Mingxuan Yan, Benjamin Yang, Jirong Yang, Sen Yang, Xiaoli Yang, Yushi Yang, Haoran Ye, Xiaohu Yu, Zhengming Yu, Chenlong Zhang, Chi Zhang, Hanning Zhang, Hanwen Zhang, Junge Zhang, Kunpeng Zhang, Song Zhang, Wenjin Zhang, Wenshuo Zhang, Ying Zhang, Yizhi Zhang, Brian Zhao, Qijian Zhao, Yimin Zhao, Yuhaohua Zheng, Liwei Zhou, Tianyue Zhou, Sichen Zhu, Siqi Zhu, Yan Zhu, Yishu Zhu, Jierui Zuo, Chonghao Cai, Helena Casademunt, Wenjia Chen, Benjamin Cheng, Nawen Deng, Rao Fu, Tianfu Fu, Yifan Han, Ren He, Zhenyu He, Qiao Jin, Lang Lang, Yuetai Li, Sylvia Liu, Lu Lu, Qing Lu, Subhabrata Mukherjee, Yunqi Ouyang, Yin Ren, Dawei Shi, Haoran Wu, Zhiyue Wu, Hannah Yao, Zhuoran Yi, Jenny Yu, Rhea Zhan, Hang Zhou, Blake Zhu, Junfan Zhu, Alan Yuille, Yang Liu, Russell Alan Poldrack, Jiachen Li, Zhenglu Li, Molei Tao, Jing Huang, Wenqi Shi, Costas Spanos, Lichao Sun, Chenguang Wang, Orson Xu, Zhen Dong, Hector Gomez, Aylin Caliskan, Ali Emami, Haimin Hu, Zhi Li, Lihui Liu, Murphy Niu, Yi Shao, Jianxin Sun, Mikko Tolonen, Ting Wang, Sanjiv Das, Yanjun Gao, Wenbo Guo, Erika J Schneider, Zhiyong Lu, Mark Mueller, Radha Poovendran, Somayeh Sojoudi, Dawn Song

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que has estado entrenando a un robot chef durante años. Lo has puesto a prueba con cuestionarios sobre recetas, le has pedido que nombre ingredientes e incluso le has hecho seguir instrucciones sencillas como "pica la cebolla". En estas pruebas, el robot obtiene puntuaciones perfectas. Parece un genio culinario.

Pero luego, le pides que realmente cocine una cena completa y compleja para un restaurante concurrido durante una hora punta. De repente, el robot quema la salsa, olvida el orden o se confunde con la estufa. Resulta que ser bueno hablando de cocina no es lo mismo que ser bueno haciendo el trabajo.

Este es exactamente el problema que el artículo "Agents' Last Exam" (ALE) intenta resolver.

El Problema: La Trampa del "Cuestionario"

Durante mucho tiempo, los investigadores de IA han estado probando a sus agentes de IA (programas informáticos inteligentes) en evaluaciones que son como exámenes de opción múltiple. Estas pruebas son excelentes para medir lo que una IA sabe, pero no miden lo que una IA puede hacer en el mundo real.

Los autores argumentan que el hecho de que una IA pueda aprobar un examen de matemáticas o un cuestionario de programación no significa que realmente pueda dirigir una empresa, diseñar un puente o gestionar la agenda de un hospital. La brecha entre "aprobar el examen" y "generar dinero" es enorme.

La Solución: El "Último Examen"

Para solucionar esto, el equipo creó ALE (Agents' Last Exam). Piensa en esto no como un cuestionario, sino como una entrevista de trabajo real en el mundo real para la IA.

En lugar de preguntar "¿Cuál es la capital de Francia?" o "Escribe un bucle en Python", ALE le entrega a la IA un proyecto real, caótico y de varios días, que un profesional humano realizaría de verdad.

  • Las Tareas: El examen cubre 55 campos laborales diferentes (como ingeniería, medicina, finanzas y diseño de videojuegos).
  • La Dificultad: Las tareas son de "largo alcance" (long-horizon), lo que significa que requieren horas o días para completarse. Requieren que la IA abra diferentes programas de software, haga clic en botones, escriba código, revise archivos y corrija sus propios errores, tal como lo haría un empleado humano.
  • La Fuente: Estas no son tareas ficticias inventadas por investigadores. Son proyectos reales que más de 250 expertos de la industria realizaron en sus trabajos. Los expertos enviaron su trabajo pasado y el equipo los convirtió en pruebas.

Cómo funciona el examen

Imagina que la IA está sentada frente a una computadora en una oficina virtual.

  1. La Asignación: La IA recibe una tarea del mundo real, como "Diseñar un molde para una pieza de coche" o "Analizar estas radiografías médicas".
  2. Las Herramientas: La IA tiene que usar software real (como herramientas de modelado 3D, hojas de cálculo financieras o software de imágenes médicas) tal como lo haría un humano. Tiene que hacer clic en menús, escribir comandos y gestionar archivos.
  3. La Calificación: Esta es la parte ingeniosa. El examen no depende de que un profesor humano observe el resultado y diga: "¡Se ve bien!". Eso es demasiado lento y subjetivo. En su lugar, el examen utiliza verificadores automatizados.
    • Si la tarea era construir un modelo 3D, la computadora verifica si las dimensiones son exactamente correctas.
    • Si la tarea era escribir un informe financiero, la computadora verifica si las cifras cuadran correctamente.
    • Si la IA falla en un "control" (como cometer un error que rompería una máquina), recibe un cero inmediatamente, sin importar lo bien que luzca el resto del trabajo.

Los Resultados: La IA todavía está en la escuela

El artículo probó a los agentes de IA más inteligentes del mundo en este examen. Los resultados son aleccionadores:

  • El Nivel "Fácil": Incluso los mejores agentes de IA solo aprobaron alrededor del 30% de las tareas que se consideran de "corto plazo" (las más fáciles).
  • El Nivel "Difícil": En las tareas más difíciles (el nivel del "Último Examen"), la tasa de aprobación fue del 0%. La IA no pudo hacerlas en absoluto.
  • La Brecha: Una IA que obtiene un 82% en un examen de programación estándar (Terminal-Bench) solo obtiene alrededor de un 25% en este examen del mundo real.

Los autores llaman a esto el "Último Examen" porque representa el obstos final. Si una IA puede pasar esto, significa que está lista para realizar realmente el trabajo y reemplazar a un trabajador humano. Por ahora, el artículo dice que la IA está todavía lejos de aprobar.

Por qué es importante

El artículo no trata solo de crear un examen más difícil; trata de cambiar el objetivo.

  • Objetivo Actual: Hacer que la IA obtenga un 100% en los cuestionarios.
  • Nuevo Objetivo: Hacer que la IA obtenga un 100% en trabajos reales que generen valor económico (PIB).

Los autores creen que al enfocarse en estas tareas reales y verificables, dejaremos de construir IA que solo es buena hablando y empezaremos a construir IA que es buena trabajando. Hasta que la IA pueda pasar este "Último Examen", no está lista para la fuerza laboral real.

Analogía de Resumen

Piensa en las evaluaciones actuales de la IA como exámenes teóricos de conducción. Puedes memorizar todas las reglas de la carretera y obtener una puntuación perfecta. Pero ALE es el examen de conducir donde tienes que conducir un coche a través de un tráfico pesado, estacionar en paralelo y navegar por una zona de obras sin chocar con nada.

El artículo dice: "Nuestros conductores de IA son excelentes en el examen teórico, pero todavía están chocando en el examen de conducción real. Dejemos de celebrar las puntuaciones teóricas y empecemos a enseñarles cómo conducir".

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →