← 最新论文
🤖 AI

SPHERE: An Evaluation Card for Human-AI Systems

本文介绍了 SPHERE,这是一个旨在标准化并提高人类-人工智能系统评估的透明度与严谨性的五维评估卡,并通过对 39 个系统的审查以及针对更好评估实践的三项建议对其进行了论证。

原作者: Qianou Ma, Dora Zhao, Xinran Zhao, Chenglei Si, Chenyang Yang, Ryan Louie, Ehud Reiter, Diyi Yang, Tongshuang Wu

发布于 2026-06-30
📖 1 分钟阅读☕ 轻松阅读

原作者: Qianou Ma, Dora Zhao, Xinran Zhao, Chenglei Si, Chenyang Yang, Ryan Louie, Ehud Reiter, Diyi Yang, Tongshuang Wu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你刚刚打造出了一个全新的、高科技的机器人助手。你迫不及待地想展示它,但在让它进入现实世界之前,你需要知道:它真的好用吗?它安全吗?人们喜欢使用它吗?

在人工智能领域(特别是那些能够像人类一样聊天和写作的新型“大语言模型”),研究人员开发这些助手的速度甚至超过了他们制定妥善测试方法的速度。这就像是仅仅通过观察鞋子来评判一名马拉松选手,或者在从未在公路上驾驶过的情况下测试汽车引擎。

这篇论文介绍了一个名为 SPHERE 的工具来解决这个混乱局面。把 SPHERE 想象成一个通用的**“成绩单”或“清单”**,供任何构建或测试人机系统的人使用。SPHERE 不仅仅是让你去猜测该测试什么,它通过五个简单的问题,确保评估过程是彻底、公平且诚实的。

以下是 SPHEE 卡片提出的问题,并用日常类比进行了解释:

1. 我们到底在测试什么?(“什么/对象”)

  • 类比: 如果你在测试一辆车,你是在仅仅检查引擎(AI 模型),还是在检查包括方向盘、座椅和仪表盘在内的整辆车(整个系统)?
  • 论文观点: 研究人员通常只在实验室里测试“大脑”(AI 模型)。但人们交互的是整辆“车”。SPHERE 提醒我们要测试整个体验,而不仅仅是代码。它还询问:我们想要证明什么? 我们是在测试它是否高效(效率)、是否能正确完成任务(有效性),还是在使用过程中是否有趣(满意度)?

2. 我们是如何进行测试的?(“如何/方法”)

  • 类比: 你是在封闭赛道、天气完美的条件下测试汽车(内在测试),还是在雨天和坑洼不平的早高峰车流中驾驶它(外在测试)?你是使用秒表来计算秒数(定量研究),还是通过访谈司机感受他们的体验(定性研究)?
  • 论文观点: 论文发现,许多研究人员只在“完美实验室”(封闭赛道)中进行测试。SPHERE 鼓励在混乱的“真实世界”中进行测试,并同时使用数字(秒表)和故事(访谈)来获取全貌。

3. 谁在进行测试?(“谁/参与者”)

  • 类比: 如果你正在为外科医生打造一种工具,你是用外科医生来测试,还是用路上的陌生人来测试?如果你用一个机器人来给另一个机器人打分,那个机器人是否存在偏见?
  • 论文观点: 论文强调了一个问题:许多研究使用“众包人员”(随机的互联网用户)或其他的 AI 机器人来测试原本面向医生或教师等专家的系统。SPHERE 要求研究人员确保进行测试的人(或机器人)确实代表了未来的实际使用者。

4. 我们在何时进行测试?(“何时/时间”)

  • 类比: 你是玩了 5 分钟一款新游戏后就说“它很棒!”,还是让人们玩上一个月,看看他们之后是否会感到厌倦或沮丧?
  • 论文观点: 大多数测试都是“短期”爆发式的(比如 15 分钟的实验室环节)。这忽略了“新颖效应”(人们仅仅因为东西是新的就觉得好用)。SPHERE 鼓励进行“长期”测试,以观察人们在几天、几周或几个月内实际是如何使用该工具的。

5. 我们如何知道测试是有效的?(“验证/效度”)

  • 类比: 如果你参加一场数学考试,你如何知道老师评分是否公平?他们是否使用了统一的评分标准?他们是否检查了自己的作业?
  • 论文观点: 这是“元评估”(对评估的评估)。它询问:我们的测试本身是否可靠? 我们是否检查了不同的人是否会得到相同的结果?我们是否确保没有误导测试者?论文发现,许多研究人员完全跳过了这一步。

他们发现了什么?

作者使用这张 SPHERE 卡片对 39 篇近期关于人机系统的研究论文进行了评分。他们发现:

  • 自然语言处理(NLP)研究人员(计算机科学家)倾向于侧重于“引擎”(模型)和短期的自动化测试。
  • 人机交互(HCI)研究人员(人类与计算机交互专家)则更侧重于“驾驶员”(用户)和现实世界的使用情况。
  • 差距: 两者都没有做到完美。许多研究错过了“真实世界”的测试,使用了错误的人群进行测试,或者没有检查他们自己的测试是否可靠。

三大建议

基于他们的“成绩单”,作者提出了三个改进方向:

  1. 在真实世界中测试: 不要只在实验室里测试。让人们在实际的工作或日常生活中使用该系统。
  2. 使用多重维度: 不要只使用一种类型的测试。将数字(定量)与故事(定性)结合起来,以交叉核对你的结果。
  3. 对自己进行的评分进行评分: 严格检查你的测试方法,确保在发布结果之前,你的测试是公平且准确的。

简而言之: SPHERE 是一个旨在防止研究人员构建那些“看起来很华丽”、在实验室表现出色但在现实生活中却会失败的 AI 系统的工具。它提供了一种结构化的方式来记录系统是如何被测试的,使科学研究更加透明、可复现且值得信赖。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →