← 最新论文
🤖 machine learning

Benchmarked Yet Not Measured -- Generative AI Should be Evaluated Against Real-World Utility

本文认为,生成式人工智能在基准测试中表现强劲与其在现实世界中的效用有限之间的脱节源于有缺陷的评估实践,并提出 SCU-GenEval 框架,将评估重心转向衡量在特定部署情境下人类成果所取得的持续改进。

原作者: Ishani Mondal, Shweta Bhardwaj

发布于 2026-05-11
📖 1 分钟阅读☕ 轻松阅读

原作者: Ishani Mondal, Shweta Bhardwaj

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是用通俗语言和日常类比对论文《已基准测试但未被测量》的解释。

核心问题:“电子游戏分数”与现实生活

想象你在训练一个机器人开车。你在一个完美、空旷的电子游戏模拟环境中测试它,那里天气永远晴朗,道路笔直,没有其他车辆。机器人获得了 100/100 的完美分数。

你欣喜若狂!你买下了机器人,把它放到真实的高速公路上。撞车了。

这篇论文认为,生成式人工智能(就像我们今天使用的聊天机器人和代码编写器)恰恰就像那个机器人。它在标准测试(基准测试)中获得了完美分数,但当我们将其实际应用于现实生活(学校、医院、律师事务所)时,它往往无法帮助人们,甚至造成伤害。

作者审视了28 个真实世界的案例,在这些案例中,人工智能在纸面上表现优异,但在实践中却失败了。他们发现了导致这种情况发生的三个主要原因:

1. “虚假代理”问题(代理置换)

类比: 想象一位餐厅评委,只根据厨师上菜时鼓掌的响度来给食物打分。厨师学会了大声鼓掌,获得了 10/10 的评分。但食物其实已经烧焦了。
现实: 人工智能的评分往往基于易于测量的指标,如“流畅度”(句子听起来是否通顺)或“通过率”(代码是否能运行?)。但在现实世界中,我们关心的是难以测量的事情,如“这条医疗建议实际上安全吗?”或“学生是否真正掌握了概念?”

  • 示例: 一个编程人工智能可能会写出通过所有测试(高分)的代码,但其中包含一个安全漏洞,让黑客得以入侵。测试并没有衡量安全性;它只衡量了代码是否能运行。

2. “快照”问题(时间坍缩)

类比: 想象一个学生使用计算器瞬间解决了一道数学题。他们在考试中得了 A。但如果你一个月后拿走计算器,他们连基本的数学都做不出来了。计算器在当下帮了他们的忙,但并没有帮助他们学习
现实: 当前的人工智能测试是“快照”。它们问的是:“人工智能现在能完成这项任务吗?”它们不问:“使用这个人工智能是否有助于人类随时间变得更好,还是会让其变得懒惰和健忘?”

  • 示例: 在教育领域,人工智能可能帮助学生快速完成作业,但学生后来可能会忘记如何自己写作或进行批判性思考。

3. “平均”问题(分布掩盖)

类比: 想象一位医生说:“这种新药效果很好!平均患者感觉好转了。”但他们没有告诉你,它对男性效果完美,却会让女性生病。“平均”掩盖了一半人受到伤害的事实。
现实: 当你查看“平均”分数时,人工智能系统往往看起来不错。但这个平均值掩盖了这样一个事实:人工智能在特定人群(如少数族裔、初学者或农村地区的人)中表现极差。

  • 示例: 医疗人工智能可能对白人患者表现良好,但无法检测出黑人患者的疾病;或者法律人工智能对大型律师事务所很出色,但对普通人却给出糟糕的建议。

解决方案:衡量成功的新方式

作者表示,我们需要停止询问“人工智能的输出有多好?”,转而开始询问"人工智能在多大程度上改变了人类实现其目标的能力?"

他们称之为"效用"。这关乎人工智能的分数;而是关乎人类的进步。

为了衡量这一点,他们提出了一个名为SCU-GenEval的新框架。你可以将其视为在将人工智能释放到世界之前测试它的四步食谱:

  1. 谁和什么?(利益相关者 - 目标映射)
    • 不要只说“开发者”。 要说“初级开发者”、“安全专家”和“最终用户”。对每个人来说,成功是什么样子的?
  2. 什么重要?(构念 - 指标规范)
    • 不要只测量“速度”。 要测量“他们学会了吗?”、“代码安全吗?”、“病人好转了吗?”
  3. 它是如何变化的?(机制建模)
    • 预测未来。 使用这个人工智能会让初级开发者变得懒惰吗?会让医生过度信任机器吗?
  4. 随时间衡量(纵向效用)
    • 不要只测试一次。 今天测试,下周测试,下个月再测试。人类是变得更好了,还是变得更糟了?

实现这一目标的工具

作者知道这听起来既昂贵又难以做到。因此,他们建议了三种工具使其具有可操作性:

  • “飞行前检查表”(结构化协议): 在推出人工智能之前,你必须确切地写下你在测试什么、你在谁身上测试它,以及你期望发生什么。这可以防止你在看到结果后更改规则。
  • “数字孪生”(用户模拟器): 与其等待数月观察真实人类的反应,不如使用特定类型人群(例如“疲惫的初级程序员”)的计算机模拟来预测他们随时间的表现。
  • “专用尺子”(基于人设的指标): 不要对所有人使用同一把尺子,而是对不同群体使用不同的尺子。将“初级开发者”与“资深专家”分开衡量。

核心结论

该论文的结论是,高基准测试分数是不够的。 仅仅因为人工智能在电子游戏中获胜,并不意味着它已准备好进入现实世界。

我们需要将重点从“机器有多聪明?”转移到“机器在多大程度上帮助人类变得更有能力?”如果我们不做出这种转变,我们可能会部署那些在纸面上看起来令人印象深刻,但无法提供帮助,甚至伤害最需要它们的人的人工智能系统。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →