Beyond the Training Distribution: Evaluating Predictions Under Distribution Shift and Selection Bias
本文提出了一种基于影响函数的双重机器学习程序,旨在应对协变量偏移与选择性标记共同带来的挑战,以准确估计黑盒预测模型的目标风险,并在电子健康记录实验中展示了优于现有方法的性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你是一位在特定厨房(源域)中花费多年时间完善一道汤品配方的厨师。你非常清楚自己在那里做出的汤是什么味道,因为你品尝过每一碗。现在,你正计划在另一座城市开设一家新餐厅(目标域)。
这个问题包含两个层面:
- 食材不同: 新城市的蔬菜和香料品牌不同。即使你的配方(模型)保持不变,当地食材的“风味特征”也是不同的。这被称为协变量偏移(Covariate Shift)。
- 品尝者存在偏差: 在你的旧厨房里,只有当主厨决定将汤端给贵宾(VIP)时,你才会去品尝。如果这碗汤是给普通顾客享用的,你永远不会去品尝它。因此,你关于“汤的味道有多好”的记录是基于 VIP 的,而不是整个菜单。这被称为选择性标签(Selective Labels)。
现在,你想预测在新城市这道汤的味道如何。但你不能仅仅参考旧有的 VIP 品尝记录(因为食材变了),你也无法直接查看新城市的菜单(因为你还没有品尝过那里的汤)。
这篇论文提出了一种全新的、巧妙的方法,旨在你在开门营业之前,就能预判汤品的质量。
两个大问题
作者解释说,目前大多数方法尝试一次只解决其中一个问题:
- 方法 A 试图调整不同的食材,但假设你的旧品尝记录是完美的(忽略了 VIP 偏差)。
- 方法 B 试图修复 VIP 偏差,但假设新城市使用的食材与旧厨房完全相同(忽略了食材偏移)。
当这两个问题同时发生时,这些方法会给出错误的答案。它们可能会告诉你汤会很美味,但实际上,由于新食材的影响以及你错过了品尝“普通顾客”那一类碗的过程,汤可能变得太咸或太淡。
解决方案:“双重检查”配方
作者创建了一种名为**双重机器学习(Double Machine Learning, DML)**的新方法。你可以把它看作是一个“双重检查”系统,能够同时解决这两个问题。
以下是他们“配方”的工作原理,使用一个简单的类比:
“如果……会怎样”的模拟(干扰函数):
首先,该方法使用计算机来模拟两件事:- 在旧厨房里,一碗汤被品尝的可能性有多大?(这解决了 VIP 偏差)。
- 新食材与旧食材相比如何?(这解决了食材偏移)。
“残差”修正:
该方法不仅仅是计算旧品尝记录的平均值,它还会观察其中的“错误”。它会问:“对于我们确实品尝过的那些碗,我们的预测偏离了多少?”然后,它会根据品尝的可能性以及食材差异的大小,对这些误差进行调整。“未标记”的人群:
对于新城市,该方法会观察那些没有进行品尝测试的人(即未标记数据)。它利用“如果……会怎样”的模拟,根据从旧厨房学到的模式,来推测这些人的感受。最终混合:
该方法将旧厨房中“修正后的误差”与新城市中“推测出的意见”结合起来。通过这种方式,它可以抵消误差。如果计算机对 VIP 偏差的猜测有误,食材偏移的修正功能就会帮助修复它,反之亦然。这使得最终的预测非常稳定且准确。
为什么这很重要(结果)
作者使用真实的医疗数据(具体来自 eICU 数据库)测试了这种方法。
- 设置: 他们拿了一个在一家医院(源医院)训练的医疗预测模型,并尝试将其应用于其他三家医院(目标医院)进行预测,这些医院具有不同的患者人口统计特征(年龄、种族等不同)以及不同的特定医疗测试执行规则(选择性标签)。
- 发现: 他们的这种新“双重检查”方法比旧方法要准确得多。
- 旧方法经常认为模型会表现良好,但由于忽略了偏差或偏移,它们实际上错了。
- 新方法能正确识别模型何时会遇到困难,从而提供更真实的风险评估。
底线
这篇论文不仅仅是在说“要小心”,它还提供了一个数学工具(一个特定的公式),允许医生、数据科学家或任何使用 AI 的人能够说:“我知道我的模型是在 A 组数据上训练的,但我现在将其部署在 B 组数据上,而且我只有部分数据。以下是预测其实际表现的最准确方式。”
这就像拥有一个能同时修正环境变化和观测不完整问题的“水晶球”,确保你不会给新客户端上一碗难喝的汤。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。