← 最新论文
🤖 machine learning

Joint Causal Structure and Cluster Discovery Using Variational Inference

本文提出了一种新颖的变分推理框架,该框架能够同时推断隐变量聚类及其因果结构,解决了现有方法需要预定义分组的局限性,并证明了其在合成数据集和真实世界数据集上的有效性。

原作者: Avni Rajpal, Anubhav Kumar, Rishabh Karnad, Mohammad Emtiyaz Khan, P. K. Srijith

发布于 2026-08-25
📖 1 分钟阅读☕ 轻松阅读

原作者: Avni Rajpal, Anubhav Kumar, Rishabh Karnad, Mohammad Emtiyaz Khan, P. K. Srijith

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在广袤的数据科学领域,研究人员经常寻找连接不同信息片段的隐藏线索。想象一个挤满了交谈者的房间:有些对话发生在个人之间,而另一些则发生在紧密的群体内部。几十年来,科学家们一直致力于开发工具来绘制谁在与谁交谈的图谱,将每个人都视为一个独立的个体。这种被称为因果发现(causal discovery)的方法有助于我们理解一件事如何导致另一件事,从而超越简单的观察,揭示世界的真实运作机制。然而,在许多复杂系统中,从大脑中神经元的放电到全球天气的变化模式,最重要的交互并非发生在孤立的个体之间,而是发生在作为单一整体行动的整个群体之间。直到现在,科学家们在研究这些群体如何相互影响之前,必须先猜测这些群体的边界在哪里,这一局限性往往掩盖了大局。

来自印度海德拉巴拉曼贾尔理工学院和东京理化学研究所(RIKEN)AI项目的研究团队开发了一种新方法来解决这个难题。他们创建了一个系统,该系统可以同时确定如何将变量分组,并绘制出这些组之间的因果连接,且无需预先告知分组情况。他们的这种方法并非强行将数据塞入预定义的框框中,而是让数据揭示其自身的自然聚类以及在它们之间流动的无形影响线。通过使用一种称为变分推理(variational inference)的技术——这种技术允许计算机从不确定性中学习,而非仅仅寻求单一的固定答案——研究人员构建了一个模型,将分组和连接都视为等待被揭开的隐藏秘密。

研究人员在计算机生成的数据和包括蛋白质结构及气候模式在内的真实世界数据集上测试了他们的方法。在这些测试中,他们将这种新方法与现有的、假设分组已知的或依赖于更简单、缺乏灵活性的猜测方法进行了对比。结果显示,该方法在重建真实的底层结构方面表现显著优于现有方法。例如,在分析蛋白质数据集时,他们的模型正确地识别出数据形成了两个相互独立、没有因果联系的组,而旧方法则错误地在不存在连接的地方画出了连线。同样,在气候数据中,这种新方法成功揭示了其他方法未能捕捉到的不同天气变量之间的非线性关系,准确地绘制了聚类及其连接的边缘。

这项工作的强大之处在于其处理不确定性的能力。该系统并非提供一张单一、僵化的地图,而是学习一个概率分布,这意味着它可以表达其对每个连接和每个分组的信心程度。这对于医学或气候科学等高风险领域至关重要,因为了解我们知识的局限性与事实本身同样重要。研究人员发现,当允许组内和边缘之间存在复杂的依赖关系,而非假设一切都是独立时,他们的方法效果最好。在气候数据的案例中,一个考虑了这些复杂关系的改进版模型实现了近乎完美的准确度,这表明驱动数据的现实机制确实是高度非线性且复杂的。

这项研究并未声称已经解决了因果发现中的所有问题,也并未声称能完美适用于所有可能的数据集。研究人员承认,目前的工作局限于特定类型的数据,并且将该方法扩展到处理极大规模、高维数据集仍是未来的挑战。然而,通过证明同时学习群体和因果结构是可能的,他们为理解复杂系统开辟了一条新路径。他们的工作表明,通过让数据自我表达,并拥抱现实世界观测中固有的不确定性,我们可以通过逐个聚类的解析,构建出一个更清晰、更准确的世界运作图景。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →