← 最新论文
🤖 machine learning

Bernstein-Schur Kernels: Random Features by Sketched Modulation and Radial Randomization

本文引入了 Bernstein-Schur 核,这是一类由有限特征分量与完全单调平移不变分量乘积构成的非平稳核,并提出了一种新颖的随机特征构造方法,该方法结合了用于有限调制部分的草图化技术(sketching)与用于平移不变部分的径向随机化技术,从而实现了算子范数界限仅依赖于内在维度而非环境维度的无偏近似。

原作者: Taha Bouhsine

发布于 2026-06-11
📖 1 分钟阅读☕ 轻松阅读

原作者: Taha Bouhsine

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图构建一个超级智能的计算机程序,使其能够识别数据中的模式。为了实现这一目标,该程序使用了一种被称为“核函数”(kernel)的数学工具。你可以将核函数想象成一个相似度计算器:它观察两份数据,并告诉你它们有多少共同之处。

长期以来,这些计算器要么是:

  1. 基于距离的: “这两个点之间有多远?”(就像测量两个城市之间的直线距离)。
  2. 基于角度的: “这两个点指向的方向有多一致?”(就像检查两个箭头是否指向同一个方向)。

大多数现代人工智能技巧在处理这两类计算器时表现都很出色。但本文的作者发现了一种特殊的相似度计算器,它以一种非常特定且复杂的方式,将距离方向结合在了一起。他们称之为 “偏置 Ξ\Xi-核函数”(Biased Ξ\Xi-kernel)

问题所在:“不守规矩”的计算器

这个新出的计算器有点像个叛逆者。它不符合那些让 AI 运行快速的标准规则。

  • 如果你尝试使用标准的“距离”技巧,它会失效。
  • 如果你尝试使用标准的“方向”技巧,它也会失效。

通常,当一个计算器如此“不守规矩”时,使用它的唯一方法就是写下一张巨大的、难以处理的电子表格,记录每一次比较。如果你有一百万个数据点,这张表格的大小将超过地球的存储容量。

解决方案:“双层夹心”技巧

由 Taha Bouhsine 领导的作者们发现了一个聪明的办法,可以将这个不守规矩的计算器分解为两个更简单、更易处理的部分。他们意识到,这个计算器实际上只是两个东西相乘的结果:

  1. “对齐”部分(The Alignment Piece): 检查数据点是否指向相同的方向(这是一个多项式)。
  2. “邻近”部分(The Proximity Piece): 检查点与点之间有多接近(这是一个径向核函数)。

他们将这种方法称为 Bernstein–Schur 方法。你可以把它想象成制作一个复杂的三明治。与其试图一次性吞下整个三明治,不如将面包(对齐)与馅料(邻近)分开,分别处理它们,然后再把它们组合在一起。

如何实现快速化:“草图”与“采样器”

为了让它足够快以投入实际应用,他们使用了两个神奇的工具:

  1. 采样器(用于处理“邻近”部分): 对于“有多近”的部分,他们使用了名为**随机傅里叶特征(Random Fourier Features)**的技术。想象一下,你想知道一个城市的平均气温。你不需要测量每一条街道,而是随机选取几个点进行测量,然后取其平均值。这能让你在不做全部工作的情况下,得到一个非常准确的估算。他们对计算器的距离部分应用了这一技术。

  2. 草图(用于处理“对齐”部分): 对于“方向”部分,数学运算通常需要巨大的内存(具体来说,内存占用随特征数量的平方增长,这非常缓慢)。为了解决这个问题,他们使用了 TensorSketch。想象你有一幅巨大且细节丰富的画作,但你的空间只能容纳一个小草图。与其绘制每一个笔触,不如使用一种特殊的算法将画作压缩成一个小草图,同时仍保留主要的轮廓和色彩。这使得他们能够大幅度缩减内存占用。

通过将这两者结合,他们创造了一种名为 RAYΞ\Xi-核函数的随机近似)的新方法。

这为什么重要(研究结果)

论文证明,这种新方法与那种缓慢、庞大的电子表格法效果一样好,但它更快,且占用的内存更少。

  • 它能在他人失败的地方奏效: 他们在并非处于完美球体(如球体)上的数据上进行了测试。在这些“非球体”数据上,旧的方法(如 Nyström 方法)会随着数据变得复杂而性能下降。而 RAY 依然保持强劲且准确。
  • 它是“流式”的: 由于它不需要存储巨大的电子表格,它可以随着数据的到来,逐一处理数据。这对于 AI 中的注意力机制(Attention mechanisms)(现代聊天机器人背后的技术)至关重要,因为这类系统需要在不耗尽内存的情况下处理长序列的单词。
  • “耦合”效应: 论文表明,这种特定的计算器在需要同时兼顾方向和距离的任务中具有独特优势。如果任务只关心其中之一,简单的计算器就足够了;但对于这种需要两者兼顾的复杂任务,这种新方法才是赢家。

总结

作者们将一个过于复杂且缓慢的数学工具进行了拆解,将其转化为两个更简单的部分,并对每一部分应用了不同的“压缩”技巧。其结果是一种快速、内存高效的方法,可以利用一种强大的新型相似度计算器,这种计算器能够处理以往方法难以应对的复杂现实世界数据。他们通过使用这种方法来加速 AI 注意力机制,并在以前无法处理的大规模数据集上训练模型,从而证明了其有效性。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →