Identifying Structural Biases from Causal Mechanism Shifts
本文介绍了 StruBI 算法,该算法利用不同环境间因果机制偏移的依赖性来识别并区分隐性混杂偏差与选择偏差,从而克服了传统因果发现方法对严格独立同分布(i.i.d.)以及无未观测变量假设的依赖限制。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下你是一名试图弄清楚一台复杂机器如何运作的侦探。你拥有一本手册(数据),你想知道哪些部件会导致其他部件运动。通常,侦探会假设两件事:
- 一切都是可观测的: 你能看到机器中的每一个齿轮和弹簧。
- 机器是稳定的: 每次你观察它时,它都在完全相同的条件下运行。
但在现实世界中,这些假设往往是错误的。有时存在你看不见的隐藏齿轮(隐藏混杂因素/hidden confounders),或者有时机器只有在你决定观察时才运行(选择偏差/selection bias)。如果你不考虑这些因素,你可能会误以为两个齿轮之间有关联,而实际上它们并没有,或者会漏掉一个损坏的零件。
这篇论文介绍了一种新的侦探工具,叫做 STRUBI(结构性偏差识别/Structural Bias Identification),它通过观察机器在不同环境(例如不同的日子、不同的设置或不同的实验)下的表现,来帮助你发现这些隐藏的问题。
以下是它的工作原理,使用简单的类比:
核心思想:“涟漪效应”
想象你有一排多米诺骨牌。
- 正常情况(无偏差): 如果你推倒一个多米诺骨牌,只有与它直接相连的骨牌才会倒下。如果你在另一个房间改变了其中一个特定多米诺骨牌的规则,只有那个骨牌的行为会发生变化,其他的保持不变。
- 隐藏混杂因素(“幽灵之手”): 想象一只无形的手(一个隐藏变量)同时推着两个多米诺骨牌。如果你改变了这只无形手的工作方式,这两个多米诺骨牌会同时改变它们的行为,即使它们并没有接触。它们同步移动是因为那个幽灵。
- 选择偏差(“保镖”): 想象一个在夜店门口的保镖,他只允许高个子进入。如果保镖改变了身高要求,这不仅会改变进入的人,还会改变已经在里面的人的平均身高,甚至会改变正在外面排队等待进入的人们的行为。这个“保镖”的变化会向上游蔓延,影响到队伍中连接的所有人。
STRUBI 策略
作者意识到,当机器在不同的语境下运行时,这两个问题(幽灵之手 vs 保镖)会在数据中留下不同的“指纹”。
- 第一步:观察变化。 他们观察当环境改变时,每个变量的“规则”是如何变化的。它们是单独改变,还是同时改变?
- 第二步:检查连接。 他们使用一种数学技巧(互信息/Mutual Information)来查看变量是否在“一起跳舞”。如果两个变量在不同的语境下同时改变行为,它们很可能被一个隐藏的原因联系在一起。
- 第三步:“上游”测试。 这是神奇的一步。
- 如果一起发生变化的变量只是一个随机组,那么它很可能是一个隐藏混杂因素(幽灵之手)。
- 如果一起发生变化的变量包含了所有的祖先(因果链中的父母、祖父母和曾祖父母),那么它很可能是选择偏差(保镖)。选择偏差很特殊,因为它会将整个家族树都拉入扭曲之中。
算法:STRUBI
该论文提出了一种名为 STRUBI 的算法来自动执行这项侦探工作。
- 它获取来自许多不同语境的数据。
- 它检查哪些变量会一起改变其行为。
- 它查看这些变量的“家族树”(因果图)。
- 如果变化的变量组是“祖先封闭的”(意味着它包含了链条中所有位于其上游的人),它就会将其标记为选择偏差。
- 如果该组仅仅是一个随机簇,它就会将其标记为隐藏混杂。
它有效吗?
作者在以下方面测试了 STRUBI:
- 虚构数据: 他们构建了计算机模拟,在其中他们确切知道哪里出了问题。STRUBI 在寻找损坏部件并识别错误类型方面比其他现有方法表现得更好。
- 真实数据: 他们使用了一个关于人类免疫细胞中蛋白质如何相互传递信号的著名数据集。在这种现实场景中,STRUBI 正确识别了哪些蛋白质受到隐藏因素的影响,以及哪些蛋白质受到数据收集方式的影响而产生偏差。
总结
该论文声称,通过观察当环境改变时系统的不同部分是如何变化的,我们可以从数学上证明数据是被隐藏原因所干扰,还是被我们观察数据的方式所扭曲。STRUBI 工具是一种更准确的新方法,可以帮助我们清理因果模型,这样我们就不会对世界运作的方式得出错误的结论。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。