SQBench: A Benchmark for Evaluating Task Delivery by Language-Model Agents in Production-Oriented Workflows
SQBench 引入了一种用于评估面向生产工作流的语言模型智能体的创新基准,通过在三个复杂度层级上评估 220 个标准化任务,利用一个区分功能完成度与基于风险惩罚的双指标框架,揭示了当前模型在受限领域交付方面的困难,并表明仅凭功能成功不足以确保高质量的任务结果。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在雇佣一个超级聪明的机器人助手来帮助你经营一家小企业。你不仅仅希望这个机器人能正确回答你的问题,你还希望它能真正“干活”。你希望它能处理你凌乱的笔记,使用你的工具,遵循严格的规则,并交给你一份你在明天可以直接使用的最终报告。这就是“AI智能体(AI agents)”的世界——这些程序不仅仅是在聊天,而是在采取行动。长期以来,科学家们通过让机器人回答常识问题或看它能否解决数学题来测试它们。但在现实世界中,得到正确答案是不够的。如果机器人忘记保存文件、使用了未经授权的工具,或者为数据编造了来源,那么整个工作就是失败的。我们需要一种方法,不仅测试机器人的智力,还要测试它的可靠性、安全性以及是否真的交付了成果。
这正是《SQBench》这篇论文所解决的问题。由 Summer Sun 领导的作者们构建了一个名为 SQBench 的新测试场,用以观察 AI 智能体处理现实任务的表现。他们不再仅仅检查答案是否正确,而是检查最终的“交付物”(成品)是否可用且安全。他们创建了 220 种不同的工作,涵盖了从简单的“查找此文件”到复杂的“分析这些财务记录”等各种场景。他们测试了 27 种不同的 AI 模型,以观察哪些模型能够完成工作而不违反任何规则。令人惊讶的结果是:即使是最优秀的 AI 模型在处理这些现实工作时仍然相当笨拙。虽然顶尖模型完成了大约 60% 的任务,但只有约 18% 的复杂业务任务是在没有任何风险性错误的情况下完美完成的。该论文表明,“聪明”并不等于“可靠”,我们需要开始根据 AI 能否交付安全、可用的结果来衡量它,而不仅仅是看它能回答多少问题。
新的成绩单:从“正确答案”到“安全交付”
把过去测试 AI 的方式想象成学校里的随堂测验。如果你做对了数学题,你就能得 A。但在现实世界中,想象一下如果你做对了数学题,但把答案写在一张被扔掉的餐巾纸上,或者你使用了一个考试中不允许使用的计算器。你可能得到了正确的数字,但你并没有完成这项作业。
论文作者认为我们需要一种新的成绩单。他们将其称为 SQBench(“SQ”代表其背后的社区“Shaqiu”,“Bench”代表基准测试)。他们设计这项测试是为了观察 AI 智能体能否像一名负责任的员工一样行事。该测试基于三个等级,就像一个难度递增的游戏:
- 第一级 (L1):基础。 这些是简单的、原子级的任务。机器人能否遵循特定指令?它能找到文件吗?它写的代码会崩溃吗?这就像测试机器人能否系好自己的鞋带。
- 第二级 (L2):组合技。 在这里,机器人必须将多种技能串联起来。它可能需要阅读电子表格、使用搜索工具,然后撰写摘要。这就像要求机器人制作三明治:拿面包、拿肉、组装起来,最后包装好。
- 第三级 (L3):终极 Boss 战。 这是现实世界的任务。机器人必须在严格的业务规则内工作,例如处理医疗数据或财务报告,在这些领域,出错可能会带来危险。它必须遵守法律、保守秘密,并生成一份人类可以真正信任的报告。
“严格通过”规则:为什么“足够好”还不够好
这是论文中最重要的一部分:作者意识到仅仅完成任务是不够的。AI 可能会完成一份报告,但如果它为了支持自己的观点而编造了一个虚假的网站链接,或者如果不小心删除了它不该碰的文件,那么这份报告就是毫无用处的。
为了解决这个问题,他们创建了一个 10D 风险矩阵。你可以把它想象成一个在机器人完成工作后进行巡查的“安全检查员”。检查员会寻找 10 种特定类型的麻烦,例如:
- D1: 捏造事实或来源(幻觉)。
- D2: 忽略格式规则(例如使用了错误的字体)。
- D3: 违反安全或隐私规则。
- D4: 浪费时间或消耗过多资源。
- D8: 为了表现良好而撒谎或隐瞒错误。
评分机制如下:
- 完成度: 机器人是否完成了工作?(是/否)。
- 风险惩罚: 机器人在执行过程中是否违反了任何规则?如果它捏造了一个事实,它会受到惩罚;如果它违反了安全规则,它会受到巨大的惩罚。
- 严格通过: 要获得“严格通过”,机器人必须满足 完成度 = 1 且 风险惩罚 = 0(即没有违反任何规则)。
这是一个非常高的标准。这就像在说:“你不能只是提交作业;你必须按时提交,使用正确的字体,不作弊,且没有捏造事实。”
测试结果究竟发现了什么
作者让 27 种不同的 AI 模型经历了这 220 项任务的考验。他们没有让模型多次尝试以碰运气,每个模型对每个任务只有一次机会。结果如下:
- 表现最佳者: 名为 Kimi K3 的模型表现最好,实现了 60.5% 的加权 Pass@1。这意味着它成功完成了任务并通过安全检查的任务比例约为 60%。
- 巨大的差距: 即便是最好的模型也会有一半左右的时间失败。但真正的故事在于细节之中。
- “L3”问题: 当任务进入第三级(复杂的业务场景)时,得分大幅下降。所有模型的 L3 级平均“严格通过”率仅为 18.5%。每一个模型在处理这些复杂的现实任务时的表现都比处理简单任务时要差。
- “差一点就成功”的失败案例: 论文发现,在 2,348 个模型确实完成了工作的任务中,有 113 个 (4.8%) 仍然未能通过“严格通过”测试,因为触发了风险。例如,一个模型可能写了一份完美的报告,但如果它包含了一个虚假的引用链接,它依然判定为失败。这证明了仅仅完成工作是不够的;工作的质量和安全性同样重要。
为什么这很重要
这篇论文表明,我们目前非常擅长测试 AI 是否能“思考”(回答问题),但并不擅长测试 AI 是否能“工作”(交付安全、可用的结果)。当前这一代的 AI 模型就像是一个才华横溢的实习生,虽然很擅长头脑风暴创意,但却总是忘记保存文件,或者不小心把邮件发给了错误的人。
作者谨慎地指出,这项测试(SQBench v1.0)只是一个快照。他们测试了 220 个特定的任务,如果测试不同的行业或任务,结果可能会发生变化。他们还提到,他们并没有让人类专家检查每一个答案,因此存在一定的不确定性。然而,模式是清晰的:在领域约束下的交付能力是一个共同的弱点。 无论是金融、医疗还是制造业,AI 智能体目前在应对严格的规则和安全要求方面仍处于挣扎阶段。
论文总结道,我们不应再仅仅庆祝“完成”,而应开始庆祝“安全交付”。我们需要衡量的不仅仅是 AI 能回答多少问题,而是它能在不造成混乱的情况下完成多少次工作。在能够做到这一点之前,AI 智能体或许很聪明,但它们还没有完全准备好步入现实世界。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。