← 最新论文
🤖 AI

Agents' Last Exam

本文介绍了智能体最后考试(Agents' Last Exam, ALE),这是一个由 250 多位行业专家共同开发的动态基准测试,旨在通过 13 个行业集群,评估 AI 智能体在长周期、具有经济价值的真实世界任务中的表现,从而弥合当前基准测试的成功与具有实际 GDP 意义的部署之间的差距。

原作者: Yiyou Sun, Xinyang Han, Weichen Zhang, Yuanbo Pang, Tianyu Wang, Yuhan Cao, Yixiao Huang, Chris Duroiu, Haoyun Zhang, Jeffrey Lin, Weishu Zhang, Tyler Zeng, Ying Yan, Bo Liu, Hanson Wen, Mingyang Xu
发布于 2026-06-05
📖 1 分钟阅读☕ 轻松阅读

原作者: Yiyou Sun, Xinyang Han, Weichen Zhang, Yuanbo Pang, Tianyu Wang, Yuhan Cao, Yixiao Huang, Chris Duroiu, Haoyun Zhang, Jeffrey Lin, Weishu Zhang, Tyler Zeng, Ying Yan, Bo Liu, Hanson Wen, Mingyang Xu, Xiaoyuan Liu, Zimeng Chen, Weiyan Shi, Amanda Dsouza, Vincent Sunn Chen, Patrick Bryant, Carl Boettiger, Yamini Rangan, Bradley Rothenberg, Kyle Steinfeld, Arvind Rao, Tapio Schneider, Georgios Yannakakis, Laure Zanna, Kaan Ozbay, Ida Sim, Tarek Zohdi, George Em Karniadakis, Jack Gallant, Teresa Head-gordon, Yushan Li, Wenxi Deng, Tao Sun, Huiqi Wang, Zhun Wang, Justin Xu, Chris Yuhao Liu, Yafei Cheng, Rongwang Hu, Aras Bacho, Shengcao Cao, Zengyi Qin, Yixiong Chen, Hengduan Fan, Hao Liu, Lin Zeng, Shashank Muralidhar Bharadwaj, Litian Gong, Yingxuan Yang, Maojia Song, Ruheng Wang, Zongzheng Zhang, Honglin Bao, Shuo Lu, Jianhong Tu, Zhonghua Wang, Zheng Zhang, Zijiao Chen, yanqiong Jiang, Zhendong Li, Bohan Lyu, Chang Ma, Peiran Xu, Benran Zhang, Shangding Gu, Haoyue Hua, Haoyang Li, Wanzhe Liao, Chengzhi Liu, Junbo Peng, Haoran Sun, Zechen Xu, Bo Chen, Jiayi Cheng, Yi Jiang, Keying Kuang, Yuan Li, Youbang Pan, Ziyan Rao, Alexander Schubert, Yifan Shen, Vincent Siu, Xiatao Sun, Kangqi Zhang, Xiaopan Zhang, Yuchen Zhu, Ishaan Singh Chandok, Lei Ding, Jingxuan Fan, Andrew Glover, Jiaming Hu, Yiran Hu, Wenbo Huang, Zixin Jiang, Haoran Jin, Lukas Kim, Ming Liu, Yang Liu, Alireza Rafiei, Xuhuan Shen, Kunyang Sun, Sophia Sun, Ting Sun, Eric Wang, Yixin Wang, Hanwen Xing, Sihan Xu, Yuzheng Xu, Zhongxing Xu, Zhiling Yan, Boqin Yuan, Ruiqi Zhang, Yifan Zhang, Zibo Zhao, Liana, Santanu Bosu Antu, Haoyue Bai, Carlo Bosio, Joseph Cavanagh, Patricia Cavazos-Rehg, Tianxing Chen, Xuewen Chen, Yipu Chen, Zhu Chenyu, Chen Dai, Stefano De Castro, Yunfu Deng, Kaustubh Dhole, Jiayuan Ding, Chenchen Du, Zhehang Du, Hao Fan, Run-ze Fan, Hengyu Fu, Shi Gu, Yifan Gu, Charlie Guo, Baihe Huang, Baixiang Huang, Rimika Jaiswal, Zhihan Jiang, Ran Jin, Erin Kasson, Xin Lan, Joseph Lee, Deren Lei, Chenyu Li, Daofeng Li, Haitao Li, Hongwei Li, Jingyan Li, Xiao Li, Yi Li, Yinsheng Li, Yuangang Li, Zhixu Li, Wenyu Liang, Longtai Liao, Kevin Qinghong Lin, AndyZeyi Liu, Che Liu, Jiaming Liu, Kaiyuan Liu, Xuan Liu, Pan Lu, Wenbo Lv, Yicheng Lv, Qiuyang Mang, Kyle Montgomery, Yuzhou Nie, Ruoxi Ning, Jorin Overwiening, Xu Pan, Layna Paraboschi, Core Francisco Park, Justin Purnomo, Swati Rajwal, Scott Rankin, Bixuan Ren, Yiren Rong, HaoYang Shang, Ventus Shaw, Fiona Shen, Jiawei Shen, Minqi Shi, Qiu Shi, Huaxiu Yao, Tianneng Shi, Jonah So, Vladislav Susoy, Hannah Szlyk, Haocheng Wang, Jialu Wang, Wei Wang, Xinyu Wang, Zehao Wang, Dowling Wong, Angela Wu, Dehao Wu, Fangyu Wu, Mengyuan "Millie" Wu, Yu Wu, Yuchen Wu, Yuhao Wu, Qingpo Wuwu, Weihang Xiao, Yongyi Xiong, Fan Xu, Ruiling Xu, Mingxuan Yan, Benjamin Yang, Jirong Yang, Sen Yang, Xiaoli Yang, Yushi Yang, Haoran Ye, Xiaohu Yu, Zhengming Yu, Chenlong Zhang, Chi Zhang, Hanning Zhang, Hanwen Zhang, Junge Zhang, Kunpeng Zhang, Song Zhang, Wenjin Zhang, Wenshuo Zhang, Ying Zhang, Yizhi Zhang, Brian Zhao, Qijian Zhao, Yimin Zhao, Yuhaohua Zheng, Liwei Zhou, Tianyue Zhou, Sichen Zhu, Siqi Zhu, Yan Zhu, Yishu Zhu, Jierui Zuo, Chonghao Cai, Helena Casademunt, Wenjia Chen, Benjamin Cheng, Nawen Deng, Rao Fu, Tianfu Fu, Yifan Han, Ren He, Zhenyu He, Qiao Jin, Lang Lang, Yuetai Li, Sylvia Liu, Lu Lu, Qing Lu, Subhabrata Mukherjee, Yunqi Ouyang, Yin Ren, Dawei Shi, Haoran Wu, Zhiyue Wu, Hannah Yao, Zhuoran Yi, Jenny Yu, Rhea Zhan, Hang Zhou, Blake Zhu, Junfan Zhu, Alan Yuille, Yang Liu, Russell Alan Poldrack, Jiachen Li, Zhenglu Li, Molei Tao, Jing Huang, Wenqi Shi, Costas Spanos, Lichao Sun, Chenguang Wang, Orson Xu, Zhen Dong, Hector Gomez, Aylin Caliskan, Ali Emami, Haimin Hu, Zhi Li, Lihui Liu, Murphy Niu, Yi Shao, Jianxin Sun, Mikko Tolonen, Ting Wang, Sanjiv Das, Yanjun Gao, Wenbo Guo, Erika J Schneider, Zhiyong Lu, Mark Mueller, Radha Poovendran, Somayeh Sojoudi, Dawn Song

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你已经训练了一位机器人厨师多年。你通过关于食谱的测验来测试它,让它命名食材,甚至让它执行简单的指令,比如“切洋葱”。在这些测试中,它的得分总是满分。它看起来像个烹饪天才。

但随后,你要求它在繁忙的餐厅高峰时段,实际烹饪一顿复杂且完整的晚餐。突然间,机器人烧焦了酱汁,忘记了订单顺序,或者在面对炉灶时感到困惑。事实证明,擅长“谈论”烹饪并不等于擅长“执行”烹饪工作。

这正是论文 《智能体最后的考试》(Agents' Last Exam, ALE) 试图解决的问题。

问题所在:“测验”陷阱

长期以来,AI 研究人员一直在使用类似于多项选择题的基准测试来测试他们的 AI 智能体(聪明的计算机程序)。这些测试擅长衡量 AI “知道”什么,但无法衡量 AI 在现实世界中能“做”什么。

作者认为,仅仅因为一个 AI 能通过数学测试或编程测验,并不意味着它真的能经营一家公司、设计一座桥梁或管理医院的排班表。在“通过测试”与“创造价值”之间存在着巨大的鸿沟。

解决方案:“最后的考试”

为了解决这个问题,团队创建了 ALE(智能体最后的考试)。不要把它看作是一场测验,而要把它看作是为 AI 准备的一场真实的、实战化的入职面试

ALE 不再询问“法国的首都是哪里?”或“写一个 Python 循环”,而是给 AI 一个真实的、混乱的、需要持续数天的项目。

  • 任务内容: 这场考试涵盖了 55 个不同的职业领域(如工程、医学、金融和游戏设计)。
  • 难度系数: 这些任务是“长程(long-horizon)”的,这意味着它们需要数小时甚至数天才能完成。它们要求 AI 打开不同的软件程序、点击按钮、编写代码、检查文件并修正自己的错误,就像人类员工一样。
  • 来源: 这些并非研究人员凭空捏造的虚假任务。它们是 250 多名行业专家在实际工作中完成的真实项目。专家们提交了他们过去的工作成果,团队随后将这些成果转化成了测试题目。

考试是如何运作的

想象一下,AI 正坐在虚拟办公室的电脑前。

  1. 任务分配: AI 会得到一个真实的现实任务,例如“为一个汽车零件设计模具”或“分析这些医学 X 光片”。
  2. 工具使用: AI 必须像人类一样使用真实的软件(如 3D 建模工具、财务电子表格或医学影像软件)。它必须点击菜单、输入命令并管理文件。
  3. 评分机制: 这是最巧妙的部分。考试并不依赖于人类老师观察结果并说“看起来不错!”,因为那样太慢且具有主观性。相反,考试使用了自动化检查器
    • 如果任务是构建一个 3D 模型,计算机将检查其尺寸是否完全准确。
    • 如果任务是编写一份财务报告,计算机将检查各项数字是否计算正确。
    • 如果 AI 在某个“关卡”失败(例如犯了一个会导致机器损坏的错误),无论剩下的工作看起来多么精美,它都会立即被判定为零分。

测试结果:AI 仍处于“在校阶段”

论文在这次考试中测试了世界上最聪明的 AI 智能体。结果令人警醒:

  • “简单”层级: 即使是最优秀的 AI 智能体,在被视为“近期可实现”的较易任务中,也仅能通过约 30% 的任务。
  • “困难”层级: 在最困难的任务(即“最后考试”层级)中,通过率为 0%。AI 完全无法完成这些任务。
  • 差距: 一个在标准编程测试(Terminal-Bench)中获得 82% 分数的 AI,在这个现实世界的考试中仅能获得约 25% 的分数。

作者称之为“最后的考试”,是因为它代表了最后的门槛。如果一个 AI 能通过这项考试,就意味着它已经准备好从事实际工作并取代人类员工。目前,论文指出,AI 距离通过考试还很遥远。

为什么这很重要

这篇论文不仅仅是关于制定一个更难的测试,更是关于改变目标。

  • 当前目标: 让 AI 在测验中获得 100% 的分数。
  • 新目标: 让 AI 在能够创造经济价值(GDP)的真实工作中获得 100% 的分数。

作者相信,通过专注于这些真实的、可验证的任务,我们将不再仅仅构建擅长“交谈”的 AI,而是开始构建擅长“工作”的 AI。在 AI 能够通过这场“最后的考试”之前,它还没有准备好进入现实劳动力市场。

总结类比

可以将目前的 AI 基准测试视为驾驶理论考试。你可以背诵所有的交通规则并获得满分。但 ALE路考,你必须在拥挤的交通中驾驶汽车、进行侧方停车,并在不撞击任何物体的情况下穿越施工区域。

论文指出:“我们的 AI 司机在理论考试中表现出色,但在实际路考中却依然频繁‘翻车’。让我们停止庆祝理论成绩,开始教它们如何开车。”

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →