← 最新论文
💻 computer science

Evaluating Prediction-based Interventions with Human Decision Makers In Mind

本文将人类在预测系统辅助下的各种决策模型形式化,旨在展示认知偏差和主体间依赖如何违反标准实验假设,从而损害自动化决策系统评估中因果效应估计的准确性。

原作者: Inioluwa Deborah Raji, Lydia Liu

发布于 2026-02-05
📖 1 分钟阅读☕ 轻松阅读

原作者: Inioluwa Deborah Raji, Lydia Liu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图弄清楚一个新的“智能助手”(比如 GPS 或拼写检查器)是否真的能帮助人类做出更好的决策。你想进行一项测试,看看这个助手是否改变了结果。

这篇论文认为,大多数目前的测试都存在缺陷,因为它们把人类决策者视为一种每次反应都完全相同的机器人。而实际上,人类是复杂、感性且受测试设置方式影响的。

以下是使用日常类比对该论文主要观点的拆解:

1. 问题所在:“机器人”假设

论文的主张: 大多数实验假设,如果你向一个人展示一个预测(例如风险评分),他们的反应是一种固定的性格特征。他们认为:“法官 A 总是忽略电脑,而法‌ها B 总是听从。”
类比: 想象你在测试一种新型咖啡。你假设如果给 A 一个人一杯咖啡,无论如何他都会喝下去。但实际上,如果 A 感到疲倦,他可能会喝;但如果他已经饱了,他可能会忽略它。他们的反应取决于语境,而不仅仅是他们的性格。

作者指出,当我们测试这些用于刑事司法或医疗保健领域的“智能助手”时,我们经常忘记人类的反应会随着实验设计而改变。

2. 人类被测试“欺骗”的三种方式

论文提出,人类对算法的倾听程度会根据实验人员控制的三个特定因素而变化。可以将这些视为人类进入的三种不同“情绪”:

  • 情绪 1:“熟悉度”效应(处理暴露)

    • 定义: 如果人类经常看到算法的建议,他们会开始信任并遵循它。如果他们只是偶尔看到,他们可能会忽略它或感到困惑。
    • 类比: 想象一个新安装的红绿灯。如果你每天都看到它,你最终会自动停下或行驶。如果你一个月才看到一次,你可能会忘记看它,或者认为它坏了。红绿灯的频率改变了你的驾驶方式,而不仅仅是红绿灯本身。
    • 论文的观点: 如果实验只是随机地在 50% 的案例中展示该工具,人类可能无法习惯它,从而导致结果微弱。如果他们 100% 的时间都能看到它,他们可能会更加依赖它,从而显示出更强的效果。
  • 情绪 2:“不堪重负”效应(容量限制)

    • 定义: 如果算法频繁大喊“危险!”(预测高风险),人类会对警告感到厌烦,甚至开始忽略那些真实的警告。
    • 类比: 想象一个烟雾报警器,每当你烤面包时就会响。久而久之,你会完全不再理会它,即使真的发生了火灾。如果算法预测“高风险”过于频繁,法官就会停止倾听。
    • 论文的观点: 如果实验设置的算法非常“谨慎”(频繁预测风险),人类可能会对此失去兴趣,从而使该工具看起来毫无用处。
  • 情绪 3:“狼来了”效应(低信任度)

    • 定义: 如果人类看到算法犯错,他们就会停止信任。
    • 类比: 如果你的 GPS 告诉你向左转,但你知道那里有一堵墙,那么你就会不再信任这个 GPS。如果算法经常出错,人类就会不再遵循它的建议。
    • 论文的观点: 如果实验使用的模型准确性不高,人类就会忽略它,使得这项干预措施看起来无效。

3. 重大错误:“溢出”问题

论文的主张: 在标准科学中,我们假设 A 发生的事情不会影响 B。这被称为“稳定单位处理值假设”(SUTVA)。
类比: 想象你在测试一种新的减肥药。你假设 A 服用药物并不会改变 B 对药物的反应。
现实情况: 在这篇论文中,“药”就是算法。因为人类(法官)是为许多不同的案件做决策的同一个人,所以发生在“案例 #1”上的情况会改变他们对待“案例 #2”的方式。

  • 如果他们连续看到算法对了 10 次,他们在案例 #11 中就会信任它。
  • 如果他们看到算法错了 10 次,他们在案例 #11 中就会忽略它。

这意味着决策是相互关联的。论文证明,由于这些决策是相互关联的,用于计算“这个工具是否有帮助”的标准数学方法是失效的。它经常低估或高估了工具的实际帮助程度。

4. 解决方案:改变我们的测试方式

作者使用来自一项法院研究(法官使用风险评分)的真实数据进行了模拟。他们表明,如果你改变分配案例的方式:

  • 场景 A: 给法官 1 提供 50% 的案例算法,同时给法官 2 提供 50% 的案例算法。
  • 场景 B: 给法官 1 提供 100% 的案例算法,而给法官 2 提供 0% 的案例算法。

尽管总案例数量相同,但结果却大不相同

  • 在“熟悉度”模型中,场景 B(一直展示它)使该工具看起来更有效。
  • 在“不堪重负”模型中,场景 B 使该工具看起来效果更差,因为法官对警告感到厌烦。

总结

这篇论文是对科学家和政策制定者的一个警告:你不能用测试机器人的方式来测试人类-AI 团队。

如果你想知道一个 AI 工具是否真的能帮助法官、医生或教师,你必须精心设计你的实验。你必须考虑到人类会习惯工具、会对警告感到厌烦,以及如果工具出错会失去信任。如果你忽略了这些人类的特性,你的测试结果将会是错误的,你可能会误以为一个有用的工具毫无用处(或反之亦然)。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →