Bounding the Causal Impact of ML-assisted Decision-Making via Counterfactual Correctness
本文提出了一种局部识别方法,该方法利用先前的随机对照试验数据以及关于反事实正确性和子群信任度的单调性假设,来构建更新后的机器学习模型对因果影响的边界,从而解决了为每一次模型迭代都进行重复试验的不可行性问题。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
水晶球与水晶球测试者
想象一下你是一名医生、法官或老师。你拥有一个强大的新工具:一个能够预测未来的人工智能(AI)。它可能会猜测病人是否患有疾病,被告是否会再次犯罪,或者学生是否会挂科。但棘手的地方在于:仅仅因为 AI 擅长“猜测”未来,并不意味着它擅长将未来“改变”得更好。也许 AI 猜对了,但医生因此惊慌失措,进行了不必要的治疗。又或者 AI 猜错了,导致法官关押了一名无辜的人。
为了弄清楚这些 AI 工具是否真的对人类有益,科学家通常会进行“随机对照试验”(RCT)。把这想象成一次味觉测试。你将人群分为两半:一半人接受 AI 的建议,另一半人则根据自己的判断做决定。然后,你观察谁最终获得了更好的结果。但这里有一个陷阱。AI 模型会不断更新,就像手机上的软件一样。如果你更新了模型使其变得更聪明,你不能每次都运行一次全新的、昂贵的味觉测试。因此,科学家们面临着一个难题:我们拥有旧版 AI 的结果,我们也知道新版 AI 的猜测更准确,但我们如何知道新版 AI 是否真的能拯救生命或改善司法公正,而不需要重新进行一次全新的实验呢?这篇论文正是针对这一问题,提供了一种利用现有数据来评估新 AI 影响的方法,而无需从头开始。
“如果……会怎样”的侦探工作
在这项研究中,研究人员扮演着侦探的角色,试图利用过去犯罪现场留下的线索来破解谜团。他们关注的是一种能帮助人类做出高风险决策的特定 AI 类型。其核心思想是使用“反事实”(counterfactuals)——这是一个形容“如果……会怎样”场景的高级词汇。他们问道:“如果我们对那些曾经参与旧实验的人使用了这个新的、更聪明的 AI,结果会发生什么变化?”
作者提出了一种巧妙的新方法,为答案绘制了一道“安全网”。他们并没有给出一个关于新 AI 表现的单一且冒险的猜测,而是计算出一个范围——一个下限和一个上限。这就像预测天气。与其说“下午 2:00 一定会下雨”,不如说“下午 1:30 到 2:30 之间会下雨”。目标是让这个时间窗口尽可能地小且精确。
秘密成分:正确性至关重要
他们方法中的魔力来自于他们在侦探手册中添加的两条新规则。
规则 1:“正确猜测”奖励
想象一名正在参加考试的学生。如果 AI 说“答案是 A”,学生遵循了该建议,并且事实证明 A 确实是正确答案,那么这名学生就得到了好成绩。研究人员假设,如果新的 AI 做出了一个正确的预测,那么其产生的结果至少会比旧的、准确度较低的 AI 做出的错误预测要好。这就像是在说:“如果你走对了路,你不会比走错路时处境更糟。”这被称为“反事实正确性”(counterfactual correctness)。
规则 2:信任最聪明的向导
第二条规则关乎信任。如果一个新的 AI 比旧的更准确,人们(如医生或法官)就会更加信任它。如果 AI 说“走”,且它通常是对的,人们就会走;如果 AI 说“停”,且它通常是对的,人们就会停。研究人员假设,当 AI 是正确的时候,更高的准确度会导致更好的结果。但当 AI 出错时,更高的准确度(以及随之而来的信任)实际上可能导致更差的结果,因为人们会盲目跟随错误的建议。
“分支路径”地图
为了将这些规则付诸实践,作者为实验中的每一个人创建了一张带有不同“分支”的地图。对于每一个人,他们都会检查:
- 新 AI 的预测是否与旧的一致? 如果一致,他们会观察性能的变化情况。
- 新 AI 的预测是否正确? 如果新 AI 猜中了正确答案(由于我们拥有过去数据的“真实标签”,我们知道这一点),他们就会使用“正确猜测”规则来收紧他们的估算。
- 预测是否是中性的? 有时 AI 会说:“我不知道,由你决定。”在这种情况下,假设结果与没有 AI 在场时是一样的。
通过组合这些分支,他们可以计算出新 AI 影响力的一个更“紧凑”的范围。在他们的模拟中,这种新方法产生的范围比以往的方法要窄得多。例如,在一次测试中,旧方法给出的范围是在 0.43 到 0.76 之间(差距为 0.33)。新方法将范围缩小到了 0.43 和 0.76?等等,看数据,新方法给出的宽度是 0.331,而旧方法是 0.704(在第一个实验中)。在另一个案例中,新方法将范围压缩到了 0.121 的宽度,而旧方法仍停留在 0.362。
模拟:虚拟法庭
为了测试他们的想法,作者不仅仅是在纸上做数学题;他们构建了一个虚拟法庭。他们使用了来自一项研究的真实数据,在该研究中,法官会被给予被告的风险评分。他们模拟了一个引入新 AI 模型的情景。
他们创建了一个“地面真值”(ground truth)——一份关于如果被释放,谁实际上会未能出庭的秘密名单。这在现实生活中通常是未知的,但在模拟中,他们可以看到这一点。然后他们运行了数据:
- 实验 1 & 2: 他们测试了更加激进(标记更多人)的新警报系统。旧方法给出了非常宽泛且无用的范围。使用“正确性”规则的新方法则给出了更紧凑、更有参考价值的界限。
- 实验 3 & 4: 他们测试了如果没有之前的试验,只有历史数据时会发生什么。同样,新方法提供了更紧凑的界限,尤其是当新 AI 比较保守(标记较少的人)时。
- 实验 5: 他们尝试通过隐藏部分“真实”答案来破坏自己的方法(模拟数据缺失)。即便如此,界限虽然变宽了一些(从 0.140 变为 0.204),但仍然包含了真实答案,这表明该方法是稳健的。
判决
本文并不声称已经永久解决了 AI 评估的问题。它承认,如果“正确性”假设是错误的(例如,如果医生忽略了正确的 AI 预测),该方法可能会失效。它还指出,如果许多人的“真实”结果缺失,界限会变得更松散。
然而,模拟表明,通过使用“正确比错误更好”这一简单的理念,我们可以更清晰地了解新 AI 的表现。这就像是从一个模糊的广角镜头升级到了一个清晰的变焦镜头。我们仍然无法完美地预见未来,但我们可以比以前更精准地观察未来。作者展示了通过利用“我们在事后往往知道正确答案”这一事实,我们可以在无需进行无数次新实验的情况下,对 AI 工具未来的影响做出更聪明的预测。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。