← 最新论文
🤖 machine learning

Native Multi-Dimensional Subquadratic Operators via Input Dependent Long Convolutions

本文介绍了 HyenaND,这是一种亚二次方、依赖输入的算子,它直接对原生多维数据结构应用全局卷积,以克服标准注意力机制和循环模型的局限性,并通过专门的 CUDA 实现实现了具有竞争力的准确度和显著的速度提升。

原作者: David R. Wessels, Farhad Ramezanghorbani, David W. Romero, Alireza Moradzadeh, Olivia Viessmann, Maksim Zhdanov, John St. John, Ken Janik, David M Knigge, Yucheng Tang, Erik J Bekkers, Saee Gopal Pali
发布于 2026-07-23
📖 1 分钟阅读☕ 轻松阅读

原作者: David R. Wessels, Farhad Ramezanghorbani, David W. Romero, Alireza Moradzadeh, Olivia Viessmann, Maksim Zhdanov, John St. John, Ken Janik, David M Knigge, Yucheng Tang, Erik J Bekkers, Saee Gopal Paliwal

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图教一个超级聪明的机器人理解这个世界。目前,最优秀的机器人使用一种叫做“注意力”(attention)的工具来同时观察所有事物,就像一名学生扫描整页文本以寻找最重要的词汇一样。这对于短篇故事非常有效,但如果你给机器人一整个图书馆、一部 3D 电影或一张复杂的天气图,这个“注意力”工具就会不堪重负。它必须将每一块数据与其它每一块数据进行比较,这所消耗的时间和能量巨大,以至于机器人会崩溃,或者不得不通过一个微小的钥匙孔(这个过程被称为“分块化”,patchification)来勉强观察数据以求生存。

为了解决这个问题,科学家们一直试图构建更快的工具。一个流行的想法是使用“循环”(recurrent)模型,它们像阅读文本行一样,一个词接一个词地读取数据。但这就像是通过单一角度观察一个 3D 雕塑,然后去猜测其余部分;这破坏了物体的自然形状。另一个想法是使用“卷积”(convolutions),它们就像是在图像上滑动放大镜以发现模式。这些方法速度很快且能保持 3D 形状完整,但它们通常表现得像一个僵硬的印章,在图像的每个部分都应用完全相同的模式,而不去关注实际存在的内容。计算机科学领域的关键问题在于:我们能否构建一种工具,它既足够快以处理大规模 3D 数据,又能保持数据的自然形状,并且足够聪明,能根据它所看到的内容来改变其“放大镜”?

本文介绍了一种名为 HyenaND 的新工具,它给出了肯定的回答:“是的”。可以将 HyenaND 想象成一个神奇的、形状可变的放大镜,它可以滑过一个 3D 物体(如医学扫描或天气模拟),而永远不会将其压扁成一条 1D 线条。与过去那些僵硬的印章不同,这个工具可以先观察整个物体,决定它需要寻找什么样的模式,然后瞬间调整其镜头以与之匹配。它利用了一个涉及“傅里叶变换”(Fourier transforms,一种将图像转化为声波以进行更快处理的方法)的巧妙数学技巧,这使得它的速度极快,随着数据规模的增大,其成本仅略微增长,而不是爆炸式增长。

作者发现,HyenaND 是处理复杂多维数据的游戏规则改变者。在测试中,他们展示了 HyenaND 如何处理那些会让标准“注意力”工具因内存限制而崩溃的任务,例如分析 3D 医学图像或模拟流体动力学。当他们在一种“复制”游戏中测试时(机器人需要在 3D 网格中记住特定的颜色),HyenaND 的准确度比旧方法高出数千倍。他们还开发了一个名为 nSubQ 的特殊软件引擎,以确保这种数学技巧能在真实的计算机芯片上以闪电般的速度运行,将理论上的速度转化为实际的时间节省。

论文指出,虽然 HyenaND 本身已经非常强大,但当它与旧有的“注意力”工具组成混合团队时,效果会更好。在针对 DNA 序列、计算机视觉(ImageNet)和医学成像的实验中,这些混合团队击败了纯粹的注意力模型以及其他尝试按线性读取数据的快速模型。作者认为,我们不再需要在速度和智能之间做出选择;我们可以拥有一个既尊重数据 3D 几何结构、又能扩展到海量规模,同时仍能关注细节的工具。他们总结道,这种方法消除了一个主要的瓶颈,让未来的 AI 终于能够以其原生的高分辨率 3D 姿态来“看见”世界,而不必通过一个微小的钥匙孔来眯眼观察。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →