Bayesian Empirical Bayes: Simultaneous Inference from Probabilistic Symmetries
本文介绍了贝叶斯经验贝叶斯(BEB),这是一个用于同时推断的广义框架,它通过利用概率对称性和遍历分解来扩展经典方法,以处理诸如阵列、协变量和空间过程等复杂结构,并由可扩展的变分算法和神经网络算法提供支持。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在统计学领域,研究人员经常面临数据过多而背景信息过少的难题。想象一位科学家试图了解单个患者的健康状况,但他手头的只有一份嘈杂且模糊的测量数据。如果他孤立地观察这位患者,结论可能会出错。但如果他观察成千上万名类似的患者,规律就会显现出来。这就是“经验贝叶斯”(empirical Bayes)的核心——这种方法允许研究人员通过学习一组人的集体经验,来对个体做出更好的推测。它的工作原理是假设组内的每个人都遵循一个共同的潜在规则,即“先验”(prior),这个规则可以通过研究整个群体来发现。一旦找到了这条规则,它就会起到引导作用,帮助清理集合中每个人的噪声数据。
几十年来,这一强大的技术一直依赖于一个严格的假设:即被研究的人或物都是独立且相同的,就像一袋混合的大理石,每颗大理石变成红色或蓝色的概率与其他大理石一样。这个假设让数学计算得以成立,但在现实世界中却经常失效。现代数据很少如此简单。人体内的基因排列在复杂的网络中,空气质量传感器分布在城市的特定地理位置,大脑连接则形成了复杂的地图。在这些情况下,“大理石”并不是独立的;它们排列成行和列,或者分布在空间和时间中,以结构化的方式相互影响。当旧的独立性规则应用于这些复杂结构时,结果往往不尽如人意,导致噪声无法被清理,模式也被掩盖了。
来自哥伦比亚大学和丹麦技术大学的一个研究小组现在开发了一种将这种逻辑应用于结构化数据的新方法。他们称其方法为“贝叶斯经验贝叶斯”(Bayesian Empirical Bayes)。他们不再强迫复杂的数据进入一个简单的、独立项的框架中,而是提出了一个不同的问题:这些数据拥有什么样的对称性?在日常用语中,对称性是指一种在不改变本质属性的情况下重新排列数据的方式。例如,如果你交换医学研究中两名患者的名字,疾病的整体模式可能保持不变。如果你将一张空气质量图向东移动一个街区,总体的趋势可能依然相同。研究人员意识到,这些对称性正是关键所在。他们证明了对于几乎任何类型的结构化数据——无论是基因活动的网格、大脑连接的地图,还是天气变化的序列——都存在一种基于这些对称性来描述其内在规律的数学方法。
该团队构建了一种利用这些对称性来寻找隐藏规则的新方法。他们不将未知的规则视为一个固定的数值,而是一个可以从数据本身学习的灵活形状。通过假设数据遵循特定的对称性(例如,在不改变数据所讲述的故事的前提下,可以交换矩阵的行和列),他们可以推导出一种新型统计模型。该模型能够估算出噪声背后的真实隐藏值。为了在海量数据集上实现这一目标,他们将该理论与人工智能领域的现代工具相结合,利用神经网络来学习这些隐藏规则的复杂形状,并使用变分推断(variational inference)来快速解决繁重的计算任务。
为了测试他们的想法,研究人员将其应用于几个现实世界的挑战。他们首先从一个简单的任务开始:清理一张带有噪声的手写数字图像。当他们将图像视为独立的像素列表时,结果还算不错。但当他们将其视为具有行和列对称性的网格时,图像变得清晰得多,展现出的数字准确度也高得多。随后,他们转向了更复杂的生物数据,观察乳腺癌患者的基因表达。在这里,新方法成功地将真实的生物信号从背景噪声中分离出来,表现优于沿用多年的现有标准技术。他们还将该方法应用于人类大脑图谱(其中不同区域之间的连接形成了一个对称网络),以及纽约市的空气质量数据(其中测量值随时间和特定位置变化)。在每种情况下,新方法都能通过利用数据的结构来增强信息的可靠性,利用邻里关系来填补空白并平滑误差。
实验结果在模拟和现实测试中表现一致。在已知真实答案的计算机实验中,尤其是在数据噪声非常大的情况下,该方法比旧方法显著降低了误差。在纽约市空气质量研究中,该方法能够填补缺失周的数据并平滑异常波动,从而提供更清晰的污染扩散图景。它甚至识别出了独特的模式,显示出曼哈顿的空气质量表现与皇后区的不同,而这种细微差别是更简单的方法所无法捕捉到的。研究人员发现,数据的结构越复杂,他们基于对称性的方法就越有价值。
这项工作并不声称解决了所有的统计问题,也不意味着旧方法毫无用处。相反,它提供了一种原则性的方法,用以将“从群体中学习”的力量扩展到现代科学那杂乱且具有结构性的现实中。通过承认数据通常自带对称性,研究人员为科学家们提供了一个全新的工具包,帮助他们在基因图谱、大脑网络和环境传感器中发现隐藏的真相。该方法表明,当我们不再试图将数据强行塞入简单的、独立的模具,而是尊重世界的自然对称性时,我们就能更清晰地看到其中的信号。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。