← 最新论文
🤖 machine learning

gp2Scale: A Class of Compactly Supported Non-Stationary Kernels and Distributed Computing for Exact Gaussian Processes on 10 Million Data Points

本文介绍了 gp2Scale,这是一种通过利用紧支撑非平稳核来诱导协方差矩阵的自然稀疏性,从而在无需引入点或其他近似方法的同时保留模型设计全灵活性的方法论,使得对超过 1000 万个数据点进行精确的高斯过程推理成为可能。

原作者: Marcus M. Noack, Mark D. Risser, Hengrui Luo, Vardaan Tekriwal, Ronald J. Pandolfi

发布于 2026-07-27
📖 1 分钟阅读☕ 轻松阅读

原作者: Marcus M. Noack, Mark D. Risser, Hengrui Luo, Vardaan Tekriwal, Ronald J. Pandolfi

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图预测天气、房价或机器人的路径,但你拥有海量的数据——数百万个数据点。在数据科学的世界里,有一种强大的工具叫做高斯过程 (Gaussian Process, GP)。你可以把高斯过程想象成一张超级聪明、极具灵活性的橡胶片。当你在这张片子上特定的数据点(比如温度读数或房价)上进行按压时,这张片子会发生拉伸和弯曲,从而完美地拟合这些点。因为它是一种“概率性”工具,它不仅仅是猜一个数字,而是围绕数据绘制出一团可能的形状,不仅告诉你答案是什么,还告诉你它对这个答案有多确定。这种“不确定性”对于做出重大决策的科学家来说至关重要,比如设计一种新药或预测气候变化。

然而,这里有一个问题。长期以来,这个“橡胶片”工具一直运行得非常缓慢且极其耗费内存。如果你只有几千个数据点,它表现得很好;但如果你试图让它覆盖数百万个点,数学计算就会爆炸。这就像是在尝试计算一个拥有 1000 万人口的城市中每一个人之间的联系一样;计算机由于内存不足而崩溃。为了解决这个问题,大多数科学家被迫使用“近似法”——基本上,他们使用的是一个更廉价、精度较低的橡胶片版本,通过忽略一些精细的细节来节省时间。但这同时也意味着失去了这个工具最特别的地方:它能够实现完美精确且高度定制化的能力。

这就是一项新研究的切入点,该研究提出了一种方法,让原始的、完美的橡胶片能够在海量数据集上运行而不会导致系统崩溃。研究人员(由 Marcus M. Noel 及其同事领导)引入了一种名为 gp2Scale 的方法。他们的核心思想是,问题不在于数据本身,而在于我们用来拉伸橡胶片的“规则”。传统的规则假设每一个点都与其它所有点相连,从而创造了一个密集且沉重的数学网络。团队意识到,如果我们将规则改为“非平稳的”(意味着规则可以根据所处位置而变化)并且是“紧支撑的”(意味着通过一种数据驱动的方式来优化连接结构),这个庞大的网络就会突然变成一个稀疏且轻量级的骨架。

通过使用这些新的、灵活的规则,研究人员能够在一个包含 1000 万个数据点的集合上运行一个精确的高斯过程。他们并没有通过走捷径或使用近似法来“作弊”;他们只是让数学变得足够聪明,意识到绝大多数的连接是不需要被计算的。他们将此方法应用于从一维波浪线到覆盖整个美国的三维温度图等各种场景。结果表明,虽然他们的方法比“近似法”需要更多的计算能力,但它提供了更好的准确性,并保留了针对特定问题进行高度定制的能力。这就像是从素描升级到了高清照片:处理时间更长,但细节是真实的,你不再需要去猜测阴影里的内容。

核心问题:“密集”的网络

要理解为什么这很重要,请想象你正在绘制一个小镇的友谊网络。如果每个人都认识每个人,你就必须在每一对人之间画一条线。如果这个小镇有 100 人,这还在可控范围内;但如果这个小镇有 1000 万人,且每个人都与其他人相连,你就必须画出 100 万亿条线。这正是传统高斯过程的做法:它们假设每个数据点都与其它所有点相连,从而产生一个过于沉重的数值“密集”矩阵。

多年来,解决方案一直是说:“好吧,让我们假定有些人彼此并不认识,”或者“让我们挑选一些具有代表性的人来代表整个群体。”这些就是近似方法(如 SVGP、Vecchia 或 SKI),论文将其作为对比对象。这些方法运行很快,但它们就像是通过一层雾气浓重的窗户看照片;你能得到大致的概念,但你会丢失锐利的边缘和精细的细节。更糟糕的是,它们通常会迫使你使用特定的、僵化的规则(核函数),这些规则可能并不适合你的特定问题。

gp2Scale 的解决方案:“智能掩模”

本文的作者认为,“密集”的网络是由错误的规则造成的幻觉。他们提出了一类新的核函数 (Kernels)(定义橡胶片如何拉伸的数学规则)。他们的秘诀在于一种“非平稳、紧支撑”的核函数。

让我们用一个类比:想象你正在绘制一幅巨大的壁画。

  • 旧方法: 你假设每一次笔触都会影响墙上的其他所有部分。为了画完整个画面,你必须针对每一平方英寸与其他每一平方英寸进行调色。这根本不可能实现。
  • 近似方法: 你决定只画几个关键点,然后猜测其余部分。这很快,但画作看起来很模糊。
  • gp2Scale 方法: 你意识到通过一种智能的方式,我们可以优化连接的模式,使网络变得稀疏,但这种稀疏性是基于数据本身的特征来驱动的,从而能够保留特定点集之间的远场相关性。这使得原本庞大的连接网络瞬间变得轻量化,同时又不会丢失关键的信息。

论文引入了几种这类“掩模”,包括 Wendland 核函数(充当基于距离的截断)和 Bump-function 核函数(充当连接的开关)。这些掩模允许计算机忽略绝大部分不必要的计算,将一个原本需要耗费永恒时间的问题,转化为一个可以通过数千台计算机分担工作的任务。

实验:从波浪线到 1000 万个点

团队不仅做了数学推导,还通过现实世界的场景测试了其有效性。

  1. 一维波浪线: 他们从一个简单的复杂波形开始。他们发现,“近似”方法会抹平锐利的波纹细节,使曲线看起来过于圆润。然而,gp2Scale 完美地保留了锐利的边缘,几乎完全匹配了“地面真值 (Ground Truth)”。
  2. 美国地形图: 他们利用 20,000 个点绘制了美国地形的高度图。由于地形变化剧烈(山脉 vs 平原),数据具有“非平稳性”。标准方法难以应对,但 gp2Scale 能够根据地形调整其规则,生成了最精确且误差最低的地图。
  3. 加州房价: 他们尝试在 8 维空间中预测房价。在这里,数据是稀疏的(难以寻找模式)。尽管在处理这种高维、稀疏的数据时具有挑战性,但 gp2 scale 依然表现出色,其性能优于传统的 Vecchia 近似法。这展示了该方法在处理复杂空间结构时的强大能力。
  4. MNIST 数字: 他们将一个著名的图像识别任务(识别手写数字)转化为了回归问题。gp2Scale 轻松处理了 28x28 像素的网格,而其他方法要么失败,要么需要过多的参数调整。
  5. 1000 万点挑战: 最后的终极测试。他们提取了来自全美的 1000 万个温度读数。为了完成这项工作,他们使用了 1,024 块 A100 GPU(一套庞大的超级计算机配置)。他们运行了大约 100 次迭代。结果如何?他们以微弱优势击败了最强的竞争对手(Vecchia),证明了“精确”的高斯过程确实可以扩展到数百万个点。他们指出,从头开始进行一次完整的运行大约需要一周时间,这与目前训练大型 AI 模型的时间相当。

结论:精确性 vs 速度

论文做出了一个明确的区分:gp2Scale 并不是试图成为最快的方法。如果你计算资源有限,只需要一个快速、且“足够好”的答案,那么旧的近似方法仍然是你的最佳选择。

然而,在准确性和灵活性不可妥协的情况下,gp2Scale 改变了游戏规则。如果你是一名正在模拟气候变化的科学家、正在设计新材料的科学家,或者正在运行一个一旦判断失误就可能带来危险的自主实验,你承担不起“雾气重重”的近似带来的风险。你需要的是高清视图。

作者总结道,通过使用这些新的、灵活的核函数,我们终于可以在大规模数据集上运行“精确”版本的高斯过程。我们不必在定制化模型的能力或不确定性估计的精度之间做权衡。唯一的代价仅仅是,你需要更多的计算能力来实现它。但正如论文所暗示的,随着功能强大的超级计算机和 GPU 的兴起,这种权衡正逐渐变成我们完全可以承受的成本。

简而言之,gp2Scale 证明了精确高斯过程的“不可能”数学其实并非真的不可能;它只是需要一种更聪明的方式来观察数据。通过意识到并非每个点都需要与每一个点进行通信,他们将一个 1000 万点的“怪兽”变成了一个可以处理的、高度精确的未来科学工具。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →