← 最新论文
💻 computer science

Flash EQ-Linear: Accelerating Equivariant Linear Layers via Group-wise Discrete Fourier Transform

本文介绍了 Flash EQ-Linear,这是一种精确加速算法及专门的 CUDA 实现,它利用分组离散傅里叶变换显著降低了等变线性层的计算复杂度,使等变网络能够在准确率、参数效率和推理速度上同时超越其非等变对应网络。

原作者: Zhongchen Zhao, Jixin Wang, Qi Xie, Hui Lin, Lei Zhang, Deyu Meng, Zongben Xu

发布于 2026-07-27
📖 1 分钟阅读☕ 轻松阅读

原作者: Zhongchen Zhao, Jixin Wang, Qi Xie, Hui Lin, Lei Zhang, Deyu Meng, Zongben Xu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在试图教一个机器人识别猫。你可以给它看一百万张猫的照片,但如果这些照片里所有的猫都是正面向前的,那么当猫转头时,机器人可能会感到困惑。为了解决这个问题,科学家们一直在构建一种特殊的“智能”机器人,它们理解几何学。他们将诸如“如果我旋转图片,答案也应该随之旋转”之类的规则直接植入机器人的大脑中。这被称为等变性(equivariance)。这就像是给机器人内置了一个指南针,这样它就不需要去死记硬背猫可能处于的每一个角度。这使得机器人变得更小、更高效,因为它不需要一遍又一遍地学习同样的东西。

然而,这里有一个陷阱。虽然这些具备几何感知能力的智能机器人体积更小(它们的“神经元”更少),但它们的思考速度其实更慢。这就像是一个极其高效的食谱,但要求你必须按照一种非常特定且重复的模式来切菜。如果你只是按部就班地遵循食谱,那会耗费大量时间,因为你在做很多不必要的准备工作。长期以来,科学家们一直认为这是变聪明所必须付出的代价:你节省了内存,但牺牲了速度。但是,如果能够保持这种小巧的体积,同时让它运行得一样快,甚至更快呢?这正是这篇论文所要解决的核心问题。

这项研究的研究人员由赵中辰(Zhongchen Zhao)及其同事领导,他们发现了一个修复速度问题的巧妙方法。他们专注于这些智能机器人中最常见的部分,一个被称为 EQ-Linear 层的层。可以将这个层看作是机器人的主要计算器。在旧的方法中,机器人会采取一套小巧、高效的指令,然后一遍又一遍地进行复制粘贴,从而创建一个巨大且混乱的电子表格,仅仅是为了完成一个简单的数学问题。这就像是将一卷精巧的小卷轴展开成一面巨大的、沉重的文字墙,仅仅是为了阅读其中的一句话。这浪费了大量的时间和精力。

团队意识到,这个混乱的电子表格并非随机生成的;它实际上具有一种隐藏的节奏感。它实际上是一个循环卷积(circular convolution),这是一种高级说法,意思就是数字像项链上的珠子一样在循环移动。他们发现,与其进行繁重的巨型电子表格乘法运算,不如使用一种被称为**傅里叶变换(Fourier Transform)**的数学魔术。想象一下你有一首复杂的歌曲。与其逐一聆听每一个声波,不如查看歌曲的“频率图”(就像乐谱一样)并在那里进行乘法运算。这把一个缓慢、沉重的任务变成了一个快速、轻盈的任务。

该论文介绍了一种名为 Flash EQ-Linear 的新方法。它利用这种频率图技巧来跳过那些枯燥、重复的复制粘贴过程。因为机器人大脑中的数字是实数(而不是虚数),研究人员发现他们可以完全丢弃大约一半的计算,因为知道另一半仅仅是镜像对称的。这就像是意识到如果你知道了对称蝴蝶的左半部分,你就没必要再画右半部分,你可以直接把纸折叠起来。

结果令人印象深刻。团队构建了特殊的、高速的工具(称为 CUDA 内核)来让这种数学运算在计算机芯片上实现。经过测试,他们发现对于前向传播(即机器人的思考过程),Flash EQ-Linear 比 PyTorch 等流行软件中使用的标准、非专门化数学工具快达 2 倍。即使我们将它放入一个完整的机器人大脑(如 EQ-ViT,一种视觉 Transformer)中,整个系统的运行速度也比以前快了 1.7 倍

最关键的一点在于:这不仅仅是速度的提升。这是一个“三位一体”的胜利。在此之前,人们认为你必须在准确性、小巧程度(参数效率)和速度之间做出选择。这篇论文表明,通过 Flash EQ-Linear,你可以同时拥有这三者。这种新方法与旧的缓慢版本一样准确,占用的内存同样微小,但完成任务的速度却快得多。事实上,对于这些具备几何感知能力的机器人来说,它们是首次在速度上严格超越了其标准的、不具备几何感知能力的同类产品。

研究人员非常谨慎地证明了这并非偶然的运气。他们展示了新方法能提供与旧的、缓慢的方法完全相同的答案,精确到了微小的小数点后位,这意味着没有任何信息丢失。他们还证明了机器人仍然能完美地理解旋转,正如它本该做的那样。虽然他们目前的工具最适合 90 度旋转(例如旋转正方形图像),但他们相信这种理念未来可以扩展到其他形状和运动中。目前,他们向业界提供了一个全新的、开源的工具,让这些智能、高效的机器人能够以闪电般的速度运行,终于使其在现实世界中的应用变得切实可行。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →