← 最新论文
📊 statistics

Learning Who to Treat When Treatment is Missing

本文通过在随机缺失(MAR)和完全随机缺失(MCCAR)假设下,扩展针对平均处理效应和条件处理效应的高效估计量,解决了政策学习中处理数据缺失的挑战,证明了基于 MAR 的估计量既是有效的且更具效率,并通过实验表明,正确指定缺失机制对于实现接近 Oracle 的性能至关重要。

原作者: Johnna Sundberg, Rayid Ghani, Eli Ben-Michael, Edward Kennedy

发布于 2026-07-17
📖 1 分钟阅读☕ 轻松阅读

原作者: Johnna Sundberg, Rayid Ghani, Eli Ben-Michael, Edward Kennedy

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你是某艘飞船的船长,由于燃料有限,你的任务是尽可能拯救更多的星球。你有一张显示哪些星球处于危险之中的地图,但问题在于,你的一些传感器出现了故障。有时,传感器会告诉你某个星球处于危险之中;而另一些时候,它只是显示空白。你需要决定去访问哪些星球,以获得最多的“拯救”积分。这就是**策略学习(policy learning)**的世界,它是计算机科学的一个分支,其中的算法旨在帮助人类在资源匮乏时做出最佳决策。为了实现这一目标,计算机需要了解“处理效应(treatment effect)”——基本上就是,如果你去访问一个星球,与如果你忽略它相比,那个星球的情况会变好多少。但如果你的数据很混乱,该怎么办?如果传感器不仅仅是随机失效,而是当星球已经处于非常糟糕或非常好的状态时,失效得更加频繁,那又该如何是好?如果你忽略了那些传感器损坏的星球,你可能会错过那些最需要帮助的星球,从而导致任务失败。这篇论文解决了一个棘手的问题:当关于谁接受了“处理”的数据不完整或缺失时,如何做出明智的决策。

这篇论文的作者们——来自卡内基梅隆大学的研究人员——正在应对一个非常具体的头痛问题:当你不知道一个人是否接受了某种治疗(比如药物或社会项目),因为记录缺失时,你该怎么办?在许多现实世界的情况下,如医疗保健或社会服务,数据并不完美。有时,记录会丢失,或者人们会忘记填写表格。论文研究了这种数据缺失可能发生的两种主要方式。第一种就像一台完全随机漏掉照片的破损照相机;第二种则更为隐蔽:照相机专门在场景混乱或主体正在进行某些特定行为时漏掉照片。

研究人员发现,“隐蔽型”的缺失实际上是更常见且更危险的情景。他们从数学上证明,如果你只是简单地丢弃那些处理信息缺失的数据(一种常见的习惯,称为“完全病例分析”),你就会浪费掉宝贵的信息。相反,他们开发了一种新方法,该方法就像一名侦探,利用那些数据完整的案例中所提供的线索,来推测那些数据缺失的人可能发生了什么。他们证明了他们的方法(该方法假设缺失情况取决于我们“能看到”的东西,比如一个人的年龄或收入)不仅更安全,而且更高效。这就像拥有一种超能力,能够利用你所拥有的每一件信息,而不是仅仅因为拼图上的图案模糊了,就把一半的拼图碎片扔进垃圾桶。

通过一系列计算机模拟和对真实世界数据集(如投票记录和学校考试成绩)的测试,团队展示了他们的方法是如何运作的。当缺失数据确实是随机的时候,他们的方法表现得和旧方法一样好。但当缺失数据与结果相关(即那种“隐蔽型”)时,旧方法失效了,给出了有偏差且错误的结果,而他们的新方法则保持了准确性。他们甚至展示了随着数据的增加,他们的方法会变得越来越好、越来越精确,最终达到“近乎完美”的性能水平。底线是,对于任何试图在资源有限的情况下决定帮助谁的人来说,忽略缺失数据是一个坏主意。通过使用他们的新工具,政策制定者即使在记录不完善的情况下,也能做出更明智、更公平的选择。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →