← 最新论文
📊 statistics

DAIF: A Data-Driven Intermediate Fusion Framework for Multimodal Supervised Learning via Approximate Message Passing

本文提出了 DAIF,一种数据驱动的中间融合框架,该框架利用随机矩阵理论和近似消息传递,从估计的模态间依赖关系中动态学习模态特定的融合结构,从而在多模态监督学习任务中,相比于现有最先进的方法提升了预测性能。

原作者: Sagnik Nandy, Samriddha Lahiry, Pragya Sur, Subhabrata Sen

发布于 2026-08-05
📖 1 分钟阅读☕ 轻松阅读

原作者: Sagnik Nandy, Samriddha Lahiry, Pragya Sur, Subhabrata Sen

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你是一名正在试图破解谜团的侦探,但你面对的不仅仅是一个证人,而是一整间充满证人的房间。有些证人目光敏锐,能完美记住每一个细节;而另一些证人则记忆模糊,只能回忆起大致的感觉。有些证人讲述的故事完全一致,而另一些人谈论的则是截然不同的事情。在数据科学的世界里,这种“证人室”被称为多模态学习(multimodal learning)。科学家们会同时收集关于同一个对象的不同类型信息——比如一个人的 DNA、蛋白质水平以及他的病史。其目标是将这些线索结合起来,从而做出比任何单一线索都更精准的预测。

然而,这里有一个棘手的问题:你该如何决定让哪些证人一起说话?如果你强迫所有人步调一致地发言(这被称为“早期融合”策略),那么那些嘈rit、混乱的证人可能会淹没那些聪明的证人。但如果你让每个人各自大声讲述自己的故事,只在最后才尝试整合答案(这被称为“后期融合”),你可能会错过那些聪明的证人之间微妙的联系,而他们其实是在讲述同一个故事。长期以来,科学家们不得不凭直觉来猜测最佳的混合方式,通常是基于一种感觉而非数据本身。这篇论文介绍了一种聪明的新方法,让数据本身来决定完美的混合比例。

这项研究背后的研究人员 Sagnik Nandy 及其团队构建了一个名为 DAIF(数据自适应中间融合)的框架。把 DAIF 想象成一位超级聪明的派对主持人,他不会只是简单地让大家坐在一张大桌子旁,也不会让大家各待各的房间。相反,主持人会倾听对话,弄清楚哪些人群实际上是在讨论同一个话题,然后温柔地引导这些特定的群体分享他们的故事。

以下是它的运作方式:

  1. 倾听阶段: DAIF 查看所有不同类型的数据(即“模态”),并使用一种称为**中心核对齐(Centered Kernel Alignment, CKA)**的特殊数学工具来衡量它们之间的相互依赖程度。这就像是在检查两个人是在低声耳语同一个秘密,还是在谈论完全不同的事情。
  2. 分组阶段: 基于这些测量结果,DAIF 会自动进行数据聚类。如果 RNA 数据和蛋白质数据紧密相关,它就会把它们归为一组。如果 DNA 数据完全独立,它就会将其单独保留在自己的组中。这个过程不需要研究人员告诉计算机应该创建哪些组;计算机通过数字自行搞定。
  3. 清理阶段: 一旦分组完成,DAIF 会使用一种称为**近似消息传递(Approximate Message Passing, AMP)**的技术。想象这是一个“传声筒”游戏,信号随着每一轮变得越来越清晰。算法从每个组中提取带有噪声的数据,并对其进行“去噪”,通过借鉴相关线索的力量来填补空白。这就像如果一个证人忘记了一个细节,但同组的另一个证人记得,那么这个小组就可以共同重建完整的真相。
  4. 预测阶段: 最后,这些经过清理、更具代表性的摘要将被用于预测结果,无论是患者能否从疾病中康复,还是某种特定蛋白质的行为如何。

作者通过两种主要方式测试了这个想法。首先,他们在成千上万次已知“标准答案”的计算机模拟中运行了测试。在这些测试中,DAIF 始终优于其他流行的方法。当数据杂乱且信号微弱时,DAIF 在寻找隐藏模式方面的准确度比那些未使用这种智能聚类方法的法高出约 10 倍。它在预测结果方面也优于那些强行将所有数据合并或将其完全分离的方法。

接着,他们利用两个大规模生物数据集将 DAIF 带入了现实世界。在第一个案例中,他们使用了一个名为 TEA-seq 的数据集,其中包含 8,213 个细胞的信息,包括 36,601 个基因66,828 个染色质峰以及 48 种蛋白质。他们试图预测特定蛋白质标记物(CD45RA)的水平。结果令人瞩目:取决于细胞的类型,结合数据的最佳方式会发生变化。对于某些细胞,将所有东西混合在一起效果最好;而对于另一些细胞,保持分离则更好。DAIF 自动识别了这一点,并实现了 2.6867 的预测误差(RMSE),击败了包括 MOFA+ 和 JAFAR 在内的其他顶尖方法。

在第二个现实世界测试中,他们研究了 TCGA-BRCA 数据集,该数据集涉及 769 名乳腺癌患者,追踪他们的 RNA、DNA 甲基化和拷贝数变异以预测生存率。在这里,DAIF 再次展示了它的灵活性。虽然标准方法可能会强行采用单一策略,但 DAIF 发现对于训练数据,一种中间方法效果最好;尽管它注意到在最终测试集上,“全合一”的方法表现略好,这可能是因为数据集较小。即便如此,DAIV 的预测也比那些容易出现过拟合(即过度记忆训练数据而导致在面对新患者时失效)的深度学习模型更加可靠。

论文反对旧有的做法,即科学家仅仅选择一种融合策略(早期、后期或中间融合)并始终如一地沿用,而不顾及数据的实际情况。作者指出,这种“一刀切”的方法可能是低效的,有时会混合无关数据并淹没有效信号。他们还证明了,虽然现有的某些方法试图从数据中学习,但它们往往依赖于僵化的假设,或者要求数据必须达到完美的平衡,而这在混乱的现实世界中并不存在。

简而言之,DAIF 提出,解决谜团的最佳方式不是强迫所有人达成一致,也不是让每个人独自呐喊。而是要仔细倾听,弄清楚谁实际上在同一个团队里,并让这些团队开展协作,从而讲述一个最清晰的故事。作者对这些发现充满信心,因为他们通过严密的数学证明支持了这一点,证明了其方法的效果几乎等同于预先知道完美分组的情况,此外还通过广泛的模拟和现实世界测试证明了其能够战胜竞争对手。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →