Agents' Last Exam
本文介绍了智能体最后考试(Agents' Last Exam, ALE),这是一个由 250 多位行业专家共同开发的动态基准测试,旨在通过 13 个行业集群,评估 AI 智能体在长周期、具有经济价值的真实世界任务中的表现,从而弥合当前基准测试的成功与具有实际 GDP 意义的部署之间的差距。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你已经训练了一位机器人厨师多年。你通过关于食谱的测验来测试它,让它命名食材,甚至让它执行简单的指令,比如“切洋葱”。在这些测试中,它的得分总是满分。它看起来像个烹饪天才。
但随后,你要求它在繁忙的餐厅高峰时段,实际烹饪一顿复杂且完整的晚餐。突然间,机器人烧焦了酱汁,忘记了订单顺序,或者在面对炉灶时感到困惑。事实证明,擅长“谈论”烹饪并不等于擅长“执行”烹饪工作。
这正是论文 《智能体最后的考试》(Agents' Last Exam, ALE) 试图解决的问题。
问题所在:“测验”陷阱
长期以来,AI 研究人员一直在使用类似于多项选择题的基准测试来测试他们的 AI 智能体(聪明的计算机程序)。这些测试擅长衡量 AI “知道”什么,但无法衡量 AI 在现实世界中能“做”什么。
作者认为,仅仅因为一个 AI 能通过数学测试或编程测验,并不意味着它真的能经营一家公司、设计一座桥梁或管理医院的排班表。在“通过测试”与“创造价值”之间存在着巨大的鸿沟。
解决方案:“最后的考试”
为了解决这个问题,团队创建了 ALE(智能体最后的考试)。不要把它看作是一场测验,而要把它看作是为 AI 准备的一场真实的、实战化的入职面试。
ALE 不再询问“法国的首都是哪里?”或“写一个 Python 循环”,而是给 AI 一个真实的、混乱的、需要持续数天的项目。
- 任务内容: 这场考试涵盖了 55 个不同的职业领域(如工程、医学、金融和游戏设计)。
- 难度系数: 这些任务是“长程(long-horizon)”的,这意味着它们需要数小时甚至数天才能完成。它们要求 AI 打开不同的软件程序、点击按钮、编写代码、检查文件并修正自己的错误,就像人类员工一样。
- 来源: 这些并非研究人员凭空捏造的虚假任务。它们是 250 多名行业专家在实际工作中完成的真实项目。专家们提交了他们过去的工作成果,团队随后将这些成果转化成了测试题目。
考试是如何运作的
想象一下,AI 正坐在虚拟办公室的电脑前。
- 任务分配: AI 会得到一个真实的现实任务,例如“为一个汽车零件设计模具”或“分析这些医学 X 光片”。
- 工具使用: AI 必须像人类一样使用真实的软件(如 3D 建模工具、财务电子表格或医学影像软件)。它必须点击菜单、输入命令并管理文件。
- 评分机制: 这是最巧妙的部分。考试并不依赖于人类老师观察结果并说“看起来不错!”,因为那样太慢且具有主观性。相反,考试使用了自动化检查器。
- 如果任务是构建一个 3D 模型,计算机将检查其尺寸是否完全准确。
- 如果任务是编写一份财务报告,计算机将检查各项数字是否计算正确。
- 如果 AI 在某个“关卡”失败(例如犯了一个会导致机器损坏的错误),无论剩下的工作看起来多么精美,它都会立即被判定为零分。
测试结果:AI 仍处于“在校阶段”
论文在这次考试中测试了世界上最聪明的 AI 智能体。结果令人警醒:
- “简单”层级: 即使是最优秀的 AI 智能体,在被视为“近期可实现”的较易任务中,也仅能通过约 30% 的任务。
- “困难”层级: 在最困难的任务(即“最后考试”层级)中,通过率为 0%。AI 完全无法完成这些任务。
- 差距: 一个在标准编程测试(Terminal-Bench)中获得 82% 分数的 AI,在这个现实世界的考试中仅能获得约 25% 的分数。
作者称之为“最后的考试”,是因为它代表了最后的门槛。如果一个 AI 能通过这项考试,就意味着它已经准备好从事实际工作并取代人类员工。目前,论文指出,AI 距离通过考试还很遥远。
为什么这很重要
这篇论文不仅仅是关于制定一个更难的测试,更是关于改变目标。
- 当前目标: 让 AI 在测验中获得 100% 的分数。
- 新目标: 让 AI 在能够创造经济价值(GDP)的真实工作中获得 100% 的分数。
作者相信,通过专注于这些真实的、可验证的任务,我们将不再仅仅构建擅长“交谈”的 AI,而是开始构建擅长“工作”的 AI。在 AI 能够通过这场“最后的考试”之前,它还没有准备好进入现实劳动力市场。
总结类比
可以将目前的 AI 基准测试视为驾驶理论考试。你可以背诵所有的交通规则并获得满分。但 ALE 是路考,你必须在拥挤的交通中驾驶汽车、进行侧方停车,并在不撞击任何物体的情况下穿越施工区域。
论文指出:“我们的 AI 司机在理论考试中表现出色,但在实际路考中却依然频繁‘翻车’。让我们停止庆祝理论成绩,开始教它们如何开车。”
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。