Efficient Canonical Correlation Analysis with Sparsity
本文介绍了 ECCAR,这是一种快速且具有可证明一致性的稀疏典型相关分析算法,它将问题表述为高维降秩回归,以克服计算速度与统计严谨性之间的权衡,从而实现对大规模多模态数据的可扩展且具解释性的分析。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在现代科学领域,研究人员经常被同时以两种不同形式涌入的数据所淹没。想象一位研究疾病的生物学家,他收集了患者细胞内成千上万个基因的测量数据,同时又收集了这些基因所产生的蛋白质的成千上万个测量数据。其目标是找到将这两组庞大列表联系在一起的隐藏线索。科学家使用一种经典的统计工具,称为典型相关分析(canonical correlation analysis)来完成这项工作。它就像一束搜索灯,试图寻找那些步调一致的特定基因组合与特定蛋白质组合。当测量值较少时,这个工具效果很好。但在大数据时代,变量的数量往往远超患者或样本的数量,传统的搜索灯会闪烁并失效。它开始发现仅仅是随机噪声产生的模式,从而将研究人员引向错误的道路,并产生在应用于新数据时无法被信任的结果。
为了解决这个问题,一个统计学家团队开发了一种新方法,为这些高维谜题提供了一个更快、更锐利且更可靠的搜索灯。他们将这种方法称为 ECCAR。该方法并没有试图将数据强行塞入一个僵化的形状,而是将问题重新定义为对稀疏或简化连接的搜索。在现实世界中,很少会出现每一个基因都影响每一个蛋白质的情况;通常,只有一小部分特定的变量驱动着这种关系。新方法将这一现实融入其设计之中,自动忽略绝大多数无关的数据点,只专注于少数关键点。这使得算法能够穿透噪声,在不被海量信息困扰的情况下找到真实的信号。
研究人员通过各种合成场景和真实世界的生物数据集,将这一新工具与现有方法进行了测试。在一次涉及一千个变量的模拟实验中,新方法在几秒钟内就完成了任务,而最先进的竞争理论则需要数小时甚至数天才能完成,并且经常无法得出结果。当应用于酒精使用障碍患者的真实数据时,该方法以比以往技术更高的准确度成功区分了患者与健康对照组。它识别出了一组与该病症紧密相关的特定基因和 DNA 标记,这与数十年前的科学文献发现相吻合。在另一项使用自闭症患者脑成像数据的测试中,该方法精准定位了患者与对照组相比进行通信方式不同的特定大脑网络,揭示了其他方法未能发现或被过多噪声掩盖的模式。
这种方法的威力延伸到了生物学之外。团队还将它应用于大型语言模型(即生成类人文本的人工智能系统)的内部运作机制。通过将 AI 的内部词汇表示视为一个数据集,而将文本的实际主题视为另一个数据集,该方法成功绘制出了哪些单词和概念在驱动模型的行为。它揭示了 AI 的数学处理过程与文本的人类含义之间清晰且可解释的联系,而这在以前是难以理清的。在这些多样化的应用中,该方法证明了自己不仅更快,而且更可靠,始终避免了陷入寻找虚假模式的陷阱。
研究人员证明,即使在数据不遵循完美、平滑分布的情况下(这是混乱的现实场景中的常见现象),他们的工具依然有效。在一次细胞分化的研究中,数据非常复杂且变量高度相关,旧方法难以找到明显的模式,往往产生几乎完全相同且因此毫无用处的结论。然而,新方法成功分离了细胞发育的不同阶段,并识别出了负责这一过程的特定遗传调节因子。它找到了已知控制这一过程的精确基因,证实了其从海量数据中恢复真实生物信号的能力。
这项工作的特别意义在于,它并不强迫人们在速度与准确性之间做出选择。多年来,科学家们必须在一种快速但由于简化假设可能导致误差的方法,与一种严谨但计算量巨大以至于无法处理大规模数据集的方法之间做出选择。这种新方法消除了这种权衡。它提供了一个数学上的证明保证,即它所发现的模式是真实的而非仅仅是随机机会,同时保持足够快的速度,能在几分钟而非几天内于标准计算机上运行。通过使这些复杂关系的识别既高效又可靠,该方法为科学家探索不同类型数据之间的复杂联系提供了一种新途径,其应用范围涵盖了从分子水平到人工智能功能的各个领域。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。