← 最新论文
🤖 AI

Principles and Guidelines for Randomized Controlled Trials in AI Evaluation

本文通过借鉴 Shadish 等人提出的四效度模型和 TOP 指南,将其转化为五项原则和 33 项操作指南,从而为规范人工智能评估中的随机对照试验奠定了基础性框架,这些原则与指南将人类表现、因果推断和透明度置于优先地位,以应对人机交互研究中特有的挑战。

原作者: Christopher Kelly, Angelica Chowdhury, Alexandra Campili, Bimpe Ayoola, Devin Barbour, Thomas Chen Dawson, Ze Shen Chin, Rokas Gipiškis

发布于 2026-05-06
📖 1 分钟阅读☕ 轻松阅读

原作者: Christopher Kelly, Angelica Chowdhury, Alexandra Campili, Bimpe Ayoola, Devin Barbour, Thomas Chen Dawson, Ze Shen Chin, Rokas Gipiškis

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你试图弄清楚一款全新的、超级智能的计算器究竟是否真的能帮助人们更好地解决数学问题,还是仅仅让人们感觉自己做得更好。

长期以来,测试人工智能的科学家们就像没有食谱却亲自品尝汤品的厨师。他们可能会说:“这汤尝起来很棒!”但他们没告诉你用了什么食材、加了多少盐,或者他们是否蒙着眼睛品尝。有时,“汤”(即人工智能)在品尝过程中口味会发生变化,或者品尝者全是专业厨师而非普通食客。

这篇论文是一份全新的、严格的人工智能测试食谱。它说:“停止猜测。让我们进行一场 Proper 的科学实验,看看人工智能是否真的能帮助人类。”

以下是他们“食谱”的简明分解,使用了一些日常类比:

1. 核心理念:“人类提升”测试

当今大多数人工智能测试就像汽车碰撞测试,只是把车撞向墙壁,看看车损坏了多少。这篇论文指出,我们需要测试驾驶员,而不仅仅是车。

  • 旧方法:“看,人工智能写了这段代码!”
  • 新方法:“我们让一半人使用人工智能,另一半人不用。使用人工智能的人是否真的比不使用的人写出了更好的代码、学得更快或犯了更少的错误?”

2. 游戏的五项规则(原则)

作者借鉴了医学和心理学的规则,并为人工智能增加了一条新规则。将这些原则想象成支撑桥梁的五根支柱。如果其中一根薄弱,桥梁(研究)就会坍塌。

  • 规则 1:我们测量的是正确的东西吗?(构念效度)

    • 类比:想象你想测试一双新跑鞋是否让你跑得更快。如果你测量的是“鞋子 squeak 的声音有多大”,那你测量的就不是速度。
    • 论文观点:不要只计算人工智能帮助某人写了多少字(这很容易造假)。要衡量思维质量是否真正得到了提升。
  • 规则 2:人工智能是否真的导致了变化?(内部效度)

    • 类比:如果你给一群人一种新维生素,他们变得更健康了,那是维生素的作用吗?还是因为他们也开始吃沙拉并睡得更久?
    • 论文观点:你必须确保两组之间唯一的区别就是人工智能。如果“人工智能组”还获得了更好的指导或更棒的电脑,你就不能将成功归功於人工智能。此外,你必须阻止“无人工智能组”偷偷瞥见人工智能。
  • 规则 3:这对所有人都有效吗?(外部效度)

    • 类比:如果一种药物在实验室里的 20 岁男性身上有效,那它在医院的 70 岁女性身上也有效吗?
    • 论文观点:不要只在计算机专家或大学生身上测试人工智能。如果你这样做,你就不能声称它对所有人都有效。你需要明确说明:“这对这些人有效,在这种情况下有效。”
  • 规则 4:数据是真实的吗?(统计结论效度)

    • 类比:如果你抛硬币 3 次每次都正面朝上,你可能会觉得这枚硬币有魔力。但如果你抛 1000 次,那可能只是运气。
    • 论文观点:不要对可能只是运气的微小改进感到兴奋。作者表示,我们需要对数学极其严格(使用更严格的"p 值”0.005,而不是通常的 0.05),因为人工智能的声明关乎重大利益。我们需要知道人工智能让事情好了多少,而不仅仅是事情是否变得“更好”。
  • 规则 5:展示你的工作!(透明度、可重复性和可验证性)

    • 类比:如果一位魔术师说“我变出了一只兔子”,却不让你看帽子或兔子,你不会相信他。
    • 论文观点:人工智能变化很快。如果你不确切记录你使用了哪个版本的人工智能、输入了什么提示词,并分享你的数据,没人能在日后检查你的工作。该论文建立了一个 4 级“信任阶梯”:
      1. 披露:“我们告诉了你我们做了什么。”
      2. 共享:“我们给了你数据和代码。”
      3. 验证:“一位独立人员检查了代码确实可以运行。”
      4. 可重复性:“另一支团队用新的人尝试了,并得到了相同的结果。”

3. 33 步检查清单

这篇论文不仅给出了规则,还为研究人员提供了一份33 步检查清单

  • 示例:“在开始之前,确切写下你要测试的内容,这样你就无法在半途中更改规则。”
  • 示例:“确保‘无人工智能组’的人没有偷偷在自己的手机上使用人工智能。”
  • 示例:“检查人工智能是让工作变得更快但更差,还是更慢但更好。”

4. 为什么我们需要这个?

目前,世界上充满了令人困惑的人工智能研究。有些说人工智能很神奇;另一些说它毫无用处。作者表示,这是因为每个人都在按不同的规则行事。

  • 问题:如果我们无法信任这些研究,我们可能会部署危险的人工智能,或者忽略有用的人工智能。
  • 解决方案:这篇论文是一份“标准操作程序”。它是构建信任桥梁的蓝图。它帮助研究人员规划研究,帮助审查员检查研究是否良好,并帮助政府基于真实事实而非猜测制定法律。

总结

将这篇论文视为人工智能实验的FDA(美国食品药品监督管理局)。正如你不会在没有严格、双盲临床试验的情况下服用新药一样,如果没有这些严格、标准化的测试,我们也不应相信关于人工智能帮助人类的声明。这是关于从“我们认为人工智能很酷”转向“我们有证据证明人工智能帮助这些人更好地完成了这项任务"。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →