← 最新论文
🤖 AI

Towards Evaluation Engineering: An Empirical Study of ML Evaluation Harnesses in the Wild

本文对 57 个机器学习评估框架进行了实证研究,指出规范阶段是操作挑战的主要来源,按根本原因对 16,560 个问题进行了分类,揭示未实现的功能、文档缺失和输入验证不足占问题总数的 60% 以上,并为将评估工程确立为一门独立的软件工程学科奠定了基础。

原作者: Zhimin Zhao, Zehao Wang, Abdul Ali Bangash, Bram Adams, Ahmed E. Hassan

发布于 2026-05-26
📖 1 分钟阅读☕ 轻松阅读

原作者: Zhimin Zhao, Zehao Wang, Abdul Ali Bangash, Bram Adams, Ahmed E. Hassan

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你是一位厨师,试图评判一道新食谱。你拥有食材(数据)、食谱卡片(模型)以及一套定义何为“好菜”的规则(指标)。但在你能品尝食物之前,你需要一个厨房来烹饪,一个计时器来追踪烹饪过程,以及一张记分卡来记录结果。

在人工智能(AI)的世界里,这个“厨房”被称为评估工具链(Evaluation Harness)。它是实际运行测试、加载数据、计算分数并告知你 AI 模型表现是否良好的软件工具。

这篇论文就像是对 57 个不同的"AI 厨房”进行的一次大规模检查,以观察它们如何运作、在何处崩溃,以及人们为何对它们感到沮丧。研究人员将这一新领域称为**“评估工程”**。

以下是他们研究发现的分解,使用了简单的类比:

1. 五阶段厨房工作流

研究人员发现,每个 AI 评估厨房都要经历五个特定阶段,就像一条生产线:

  • 配置(设置厨房): 准备好炉灶、锅具和食材。这包括安装软件和登录账户。
  • 规范(编写食谱): 决定具体要烹饪什么以及使用哪些食材。这是你加载 AI 模型和测试数据的地方。
  • 执行(烹饪食物): 实际运行 AI 模型以生成答案。
  • 评估(品尝与打分): 将答案与正确答案进行比对并计算分数。
  • 报告(呈上菜单): 以图表或报告的形式展示最终结果。

大惊喜: 大多数这些厨房在“烹饪”(执行)方面表现出色,但在“呈上”(报告)方面却糟糕透顶。很少有厨房配备自动警报,能在今天的食物味道不如昨天时提醒你。

2. 问题出在哪里(根本原因)

该团队查看了用户提交的超过 16,000 条投诉(称为“问题”)。他们发现,问题通常不是因为数学错误,也不是因为代码以戏剧性的方式崩溃。相反,问题大多是官僚主义和缺失组件造成的。

这就像试图组装一套乐高积木,但说明书缺失了,或者盒子上写着“包含一块红色积木”,但你只得到了一块蓝色的。

厨房失败的三大原因是:

  1. 功能缺失(24%): 工具承诺了某项功能(例如处理特定类型的数据),但开发人员从未真正构建该部分。这就像一辆有方向盘但没有发动机的汽车。
  2. 糟糕的说明(20%): 工具可以运行,但手册缺失、过时或令人困惑。用户无法弄清楚如何使用它。
  3. 缺乏安全检查(17%): 工具不检查食材是否新鲜。如果你喂给它错误的数据,它不会停止;它只是烹饪垃圾并给你一个垃圾分数。

3. 不同类型的厨房

研究人员将这 57 个厨房分为四种“原型”(类型),每种类型都有其特定的头痛问题:

  • 标准化测试厨房(40%): 这些是大型、著名的厨房,使用标准化考试(如 AI 的 SAT)来测试多种模型。
    • 它们最大的头痛: 依赖项断裂。 它们依赖外部食材(数据集),这些食材会毫无预警地发生变化或消失。如果供应商改变了包装,整个厨房就会停止工作。
  • 专用工具(21%): 这些是微小的工具,只做一件事且做得完美(例如检查机器人是否能行走)。
    • 它们最大的头痛: 糟糕的说明。 因为它们太简单了,开发人员忘记了编写清晰的设置说明。
  • 定制探针(21%): 这些测试特定技能(如编程或数学)。
    • 它们最大的头痛: 数学错误。 由于它们发明了自己的评分公式,它们经常算错数学,导致静默错误,即分数看起来正确但实际上是错误的。
  • 全服务餐厅(17%): 这些是高端、一站式平台,包办一切。
    • 它们最大的头痛: 合同不匹配。 因为它们连接了如此多的不同部分(如远程判断器和本地模型),这些部分往往无法使用同一种语言交流,导致沟通中断。

4. “沉默杀手”

这篇论文发现的最危险的问题是静默评分错误

想象一位评委品尝汤并给出五星评级。评委很自信,分数已打印,大家都很开心。但实际上评委忘了加盐,汤的味道糟透了。工具没有崩溃;它只是给出了一个错误的分数。

论文发现,许多工具计算分数不正确(算法错误)或未能检查数据是否合理(验证缺口),而且由于系统中没有内置的“第二意见”,直到很久以后才有人注意到。

5. 这对未来的意义

该论文得出结论,我们需要将这些工具不仅仅视为“脚本”,而是视为严肃的工程产品。

  • 开发人员需要停止假设数学是完美的,并开始构建“安全网”(例如在打印分数之前检查分数是否合理)。
  • 用户需要停止盲目信任分数。仅仅因为工具说“准确率 95%"并不意味着它是真的;你需要复核工作。
  • 研究人员需要发明新的方法来测试这些工具,因为测试软件的传统方法在“测试”本身是一个可能会产生幻觉的 AI 时是行不通的。

简而言之: 我们建造了令人惊叹的机器来测试其他机器,但这些负责测试的机器往往缺少说明、逻辑存在漏洞,并且缺乏在困惑时告知我们的能力。修复这些“厨房”与培养更优秀的“厨师”(AI 模型)同样重要。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →