← 最新论文
📊 statistics

CDFM: Towards a General-Purpose Causal Discovery Foundation Model

本文介绍了因果发现基础模型(CDFM),这是一个统一的、通用的框架,它利用基于原理的变分方法并在大规模合成因果模型上进行预训练,以实现零样本结构推理,从而克服了传统针对特定数据集的因果发现算法的扩展性限制。

原作者: Jie Qiao, Ruichu Cai, Zijian Li, Weilin Chen, Pengfei Hua, Boyan Xu, Zhengming Chen, Zhifeng Hao, Peng Cui

发布于 2026-07-14
📖 1 分钟阅读☕ 轻松阅读

原作者: Jie Qiao, Ruichu Cai, Zijian Li, Weilin Chen, Pengfei Hua, Boyan Xu, Zhengming Chen, Zhifeng Hao, Peng Cui

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你是一名正在试图破解谜题的侦探:谁导致了什么? 你面前有一堆线索(数据),展示了不同的事物是如何共同发生的,但你并没有一个讲述故事的目击者。几十年来,侦探们不得不为每一个案件挑选一个特定的“规则手册”。有的规则手册说:“假设一切都是直线!”另一个说:“假设噪声是怪异且凹凸不平的!”如果你为错误的案件选错了规则手册,你的解决方案就会变成垃圾。

这篇论文介绍了一种新型侦探:CDFM(因果发现基础模型)。CDFM 不再是挑选规则手册,它更像是一个超级聪明的学徒,在接触任何真实的案件之前,就已经读遍了宇宙中所有可能的规则手册。

旧方法 vs. 新方法

旧方法(“测试驱动”的挣扎):
想象你有一个乱七八糟的房间(你的数据)。旧方法会说:“这个混乱是由龙卷风引起的吗?让我们检查一下风是否是非高斯的!它是由于猫引起的吗?让我们检查一下噪声是否是加性的!”你必须运行十几项不同的测试,猜测哪一个才符合,如果你猜错了,就得从头开始。这既缓慢又支离破碎,而且当房间变得过于混乱或诡异时,它就会失效。

新方法 (CDFM):
CDFM 跳过了猜测游戏。它观察这个乱七八糟的房间并说:“我在训练中见过数百万个像这样的房间。”它不需要你告诉它数据是线性的还是非线性的。它只需观察模式并绘制出谁导致了什么的地图。它是一个“零样本(zero-shot)”侦探,这意味着它可以解决一种全新的类型的谜题,而无需事先进行重新训练。

它是如何学习这么多知识的?(“合成游乐场”)

你可能会问:“计算机怎么能知道关于因果关系的一切呢?”作者并没有喂给它现实世界的数据(现实数据往往很混乱且经常有缺失答案)。相反,他们构建了一个巨大的、无限的电子游戏

在这个游戏中,他们生成了 15 个不同家族的虚构世界。有些世界遵循直线规则,有些遵循狂野的曲线规则,有些存在隐藏的“幽灵”变量在幕后操纵,还有些存在数据缺失的情况。他们还创建了 10 种不同规模的世界,从只有 10 个变量的小型谜题到拥有 100 个变量的庞大系统。他们也改变了线索的数量,从 500 个观测值增加到 4,000 个。

CDFM 在这个电子游戏中玩了很久,学习识别不同原因留下的“足迹”。它学会了如果某种模式看起来像某种特定类型的噪声,那它可能是一种原因;如果看起来像另一种,那就是另一种原因。

魔法技巧:“变分推理”

这里是聪明之处。论文认为你不能仅仅靠猜测答案,你必须在数学上证明你的猜测是唯一符合条件的。作者使用了一种叫做**变分推理(variational inference)**的数学技巧。

你可以这样理解:CDFM 不仅仅是说“我认为 A 导致了 B”。它会说:“我要想象 A 导致 B 的每一种可能方式,权衡所有这些方式,并选择最符合数据逻辑的那一个。”它将世界的“规则”视为隐藏变量,在弄清楚结构的同时也试图弄清楚这些规则。这确保了如果数学证明某个方向是不可能的,CDFM 就不会去猜测。

它真的奏效了吗?(证据)

作者不仅是口头说说。他们通过三种方式对 CDFM 进行了测试:

  1. 合成挑战赛: 他们将 CDFM 投入到 15 种它在最终测试阶段从未见过的不同类型的虚构世界中。

    • 结果: CDFM 赢了。在 4,000 个样本的测试中,它的 AUROC 得分为 0.888(一个衡量准确度的指标,1.0 为完美)。排名第二的方法 TabCausal 仅得到 0.786。即使谜题变得巨大(100 个变量),CDFM 依然保持强劲,AUROC 高于 0.87,而其他方法则崩溃了。
    • 启示: 这表明 CDFM 可以处理广泛的、类似于现实世界的复杂情况,而不需要特定的规则手册。
  2. 现实世界测试: 他们尝试将其应用于真实数据,例如一个名为 Causal Chamber 的物理系统(其中光隧道和传感器创造了真实的物理现象)以及 Tübingen 基准测试(现实世界中的配对,如“身高导致体重”)。

    • 结果: 在 Causal Chamber Task A1 中,CDFM 的 AUROC 为 0.952,击败了紧随其后的 TabCausal(0.930)。在 Tübingen 基准测试中,它的准确率为 67.1%,超过了之前的最高水平 63.8%
    • 启示: 在电子游戏中学习到的技能确实可以迁移到现实生活中。
  3. “诚实度”检查: 作者想确保 CDFM 不仅仅是在盲目猜测。他们在数学上无法得知答案的情况(例如当两个事物完全对称时)下对其进行了测试。

    • 结果: 当数学上表示“无法分辨”时,CDFM 的准确率降至 0.5(这仅仅是像抛硬币一样的随机猜测)。当数学上表示“是可以分辨的”时,它的准确率飙升至 1.0
    • 启示: 这表明 CDFM 尊重逻辑定律。它知道什么时候自己不应该知道答案。

它不能做什么(规则)

论文非常明确地说明了 CDFM 不是什么。

  • 不是一个可以消除对假设需求的神奇魔棒。论文明确指出,你必须拥有一些因果假设;CDFM 只是学习了一个更广泛的光谱,而不是单一的一个。
  • 并非在所有方面都完美。在某些非常具体、简单的案例中(例如一个完美的线性世界配合非高斯噪声),像 DirectLiNGAM 这样较旧的专门化工具仍然可能表现得略好。CDFM 是一个“通才”,而不是针对某个微小领域的“专家”。
  • 在现实世界数据上的结果是基于特定基准(Causal Chamber, Tübingen)进行衡量的。论文并未声称它已经解决了宇宙中每一个问题的因果发现,而只是说明它在极广的范围内表现出色。

额外奖励:缺失部分的补全

作为训练的副作用,CDFM 在填补缺失的拼图碎片方面也变得非常擅长。如果你给它一个有漏洞的数据集,它可以猜出缺失的数字是什么。在测试中,它击败了标准的 MeanKNN 插补法,在连续数据上实现了 0.452 的平均绝对误差 (MAE),在离散数据上实现了 0.717

核心结论

这篇论文暗示了一个重大的转变:我们不再需要为每一种新类型的数据构建一个新的、专门化的工具,而是可以构建一个巨大的、预训练的大脑,它理解因果关系的语言。它并不是解决了世界上所有的谜团,但它是迈向这样一个侦探的一大步——这个侦探可以走进任何房间,观察线索,然后说:“我见过这种场景。这就是地图。”

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →