想象一下,你正在组织一场庞大而混乱的派对,客人们站在一个三维房间里。有些人靠得很近,有些人相距甚远,房间里没有整齐的网格或行列。你的目标是根据客人们彼此之间的远近,来决定谁该和谁交谈。
在计算机视觉的世界里,这场“派对”就是3D 点云(代表空间中物体的一组点),而“客人”就是数据点。计算机使用一种称为Transformer的工具来决定谁该和谁交谈。
以下是这篇论文所解决的问题,用简单的方式解释:
问题:“二次方”瓶颈
标准的 Transformer 就像一位坚持在任何人开口说话之前,必须检查每一位客人与其他每一位客人之间距离的派对主持人。
- 如果你有 100 位客人,主持人需要进行 10,000 次检查。
- 如果你有 1,000 位客人,主持人需要进行 1,000,000 次检查。
- 如果你有 10,000 位客人(这在 3D 扫描中很常见),主持人就会不堪重负,耗尽内存,派对随之停止。这就是二次方成本(O(L2))。
为了解决这个问题,研究人员发明了“高效 Transformer"(例如Performers)。这些主持人使用捷径:他们利用巧妙的数学技巧来猜测谁该和谁交谈,从而使派对运行得更快(O(L))。
- 问题在于:这些捷径在速度上表现出色,但在理解几何结构方面却非常糟糕。它们忘记了在三维房间中,距离至关重要。它们将站在你身边的客人与站在房间另一端的客人同等对待,这破坏了 3D 任务的准确性。
解决方案:RelFlexformer
作者引入了RelFlexformer,这是一种新型的高效主持人,既快速又具备几何感知能力。
可以这样理解:
- 捷径:它不再检查每一对组合,而是使用一种“魔法透镜”(称为NU-FFT,即非均匀快速傅里叶变换)来即时计算距离如何影响交流。
- 灵活调制:想象主持人对每一对客人都有一个特殊的“音量旋钮”。如果两位客人靠得很近,音量就调高(他们交谈很多);如果他们相距较远,音量就调低。
- 旧的高效方法无法在不破坏其速度捷径的情况下调节这个旋钮。
- RelFlexformer 可以为任何形状的房间(甚至是杂乱无章、不规则的三维空间)调节这个旋钮,而不会降低速度。它通过将距离问题转化为频率问题(就像将一首复杂的歌曲转化为简单的旋律)并快速求解来实现这一点。
“魔法”类比:管弦乐队
想象 3D 点是一个管弦乐队中的音乐家,他们随机散布在大厅里。
- 标准 Transformer 要求每位音乐家倾听其他所有音乐家,以寻找和谐。对于大型管弦乐队来说,这需要耗费永恒的时间。
- 旧的高效 Transformer 要求音乐家仅根据简单规则来猜测和谐。这很快,但音乐听起来很平淡,因为它们忽略了谁坐在谁旁边。
- RelFlexformer 就像一位使用特殊声学镜子的指挥家。它不要求每个人倾听所有人,而是让镜子即时反射声波,使音乐家能够根据彼此的具体距离,确切地知道该演奏多大的音量。它保留了房间的“空间感”,同时缩短了排练时间。
他们声称达成的成就
该论文声称,通过使用这种“声学镜子”(即 NU-FFT 数学):
- 速度:它保持快速,即使面对海量数据,其扩展性也几乎呈线性(O(LlogL))。当“派对”变得太大时,它不会崩溃。
- 准确性:它恢复了缺失的“距离感”。在 3D 物体识别(例如从点云中识别椅子)和 3D 分割(标记房间的部分)的测试中,RelFlexformer:
- 击败了旧的“快但笨”的方法(Performers)。
- 经常击败慢但聪明的标准 Transformer,尽管它的速度快得多。
- 通用性:它适用于杂乱无章的真实世界数据,例如点云(来自激光雷达扫描仪)和RGB-D 图像(能感知深度的相机),在这些数据中,点并不在整齐的网格中。
总结
RelFlexformer 是计算机观察 3D 形状的一种新方法。它将捷径的速度与理解物理距离的精度相结合。它使计算机能够快速处理复杂的 3D 场景(例如机器人在房间内导航),而不会丧失判断事物之间距离的能力。
技术摘要:RelFlexformer
问题陈述
基于注意力的 Transformer 已成为 3D 学习(尤其是点云数据)的主导架构。然而,标准 Transformer 在该领域面临两个关键限制:
- 计算瓶颈:标准自注意力机制随序列长度 L 呈二次方缩放(O(L2))。这对于大规模点集和密集几何模型而言是难以承受的。
- 几何错位:标准注意力机制并不天然契合点云无序且不规则分布的特性。虽然存在相对位置编码(RPE)方法以注入几何偏置,但将其整合到高效的线性时间注意力机制(如 Performer)中并非易事。现有的高效 RPE 方法通常依赖于结构化的 Token 布局(例如规则网格),或需要显式构建 L×L 掩码,这抵消了线性注意力的计算优势。具体而言,在不实例化完整注意力矩阵的情况下,将几何掩码插入核化注意力机制,要求该掩码必须支持快速的矩阵 - 向量乘积,而现有方法中鲜有能满足针对任意 3D 分布的这一约束。
方法论
作者提出了 RelFlexformer,这是一类高效的 3D Transformer,它通过任意可积调制函数 f 整合了广泛的 RPE 家族。其核心创新在于应用 非均匀快速傅里叶变换(NU-FFT) 理论,以实现次二次方的掩码注意力。
关键技术组件:
- 基于卷积的调制:RPE 机制被表述为空间卷积。给定输入 Token 坐标 {ri} 和调制函数 f,Token 的掩码注意力值 w 计算为 f 与信号 P 的卷积(P 是由输入特征加权的狄拉克δ函数之和)。
- NU-FFT 公式化:根据卷积定理,空域中的卷积对应于频域中的乘法。作者利用 S 个样本的求积规则近似连续傅里叶积分。
- 前向步骤:使用 NU-FFT 在采样频率 ξs 处计算点云信号的傅里叶变换。耗时为 O(LlogL)。
- 调制:将变换后的信号乘以调制函数的傅里叶变换 Ff(ξs)。
- 逆步骤:计算逆 NU-FFT 以在原始 Token 坐标处评估调制后的值。耗时同样为 O(LlogL)。
- 与线性注意力的整合:该“FastMultM"算法替换了线性注意力框架(如 Performer)中显式的 L×L 掩码矩阵乘法。整体复杂度变为 O(LlogL),在保留线性注意力效率的同时融入了任意几何偏置。
- 泛化性:该框架泛化了现有方法。例如,如果调制函数被参数化为离散谐波函数,该方法在解析上可恢复旋转位置嵌入(RoPE)。它还将 ⊗-STRING 编码作为特例纳入其中,其中频率是从特定谱密度中抽取的。
主要贡献
- 通用公式化:作者提出了一类基于任意 L1 可积函数的通用 3D RPE 调制高效注意力机制。
- 高效实现:他们推导出了基于 NU-FFT 的 O(LlogL) 实现,实现了无需实例化注意力矩阵的快速掩码注意力。这使得几何信息能够直接融入 Performer 风格的注意力机制中。
- 多功能性与性能:论文验证了 RelFlexformer 可作为多种骨干网络(PCT、PTv3、DFormer)的即插即用替代方案。结果表明,RelFlexformer 不仅缩小了高效线性注意力与密集二次方注意力之间的性能差距,而且在多种情况下超越了标准的 O(L2) Transformer。
- 互补性:作者表明,其基于距离的 RPE 调制与 PointRoPE 等 Token 级编码是正交的,可以有效结合以进一步提升性能。
实验结果
作者在大量用于分类和分割的 3D 数据集上评估了 RelFlexformer:
- 物体分类(ModelNet40, ScanObjectNN):
- 在 ModelNet40 上,RelFlexformer 达到了 92.94% 的准确率,显著缩小了与密集 Transformer 基线(93.2%)的差距,优于普通 Performer(92.34%)。
- 在 ScanObjectNN 上,RelFlexformer(84.45%)超越了密集 Transformer 基线(84.0%)。
- 语义分割(ScanNet, ScanNet200, ScanNet++, nuScenes, S3DIS):
- RelFlexformer 持续优于普通 Performer 基线。例如,在 ScanNet 上,mIoU 从 Performer 的 74.8% 提升至 76.8%(RelFlexformer),接近 Transformer 基线(77.6%)。
- 在 nuScenes 上,RelFlexformer 实现了 80.3% 的 mIoU,超越了 Transformer 基线(Transformer 得分为 80.4%,但文中指出 RelFlexformer 通常表现更优;具体而言,在 nuScenes 上,RelFlexformer + PointRoPE 达到了 81.2%,超过了 Transformer 的 80.4%)。
- 在 S3DIS 的 6 折交叉验证中,RelFlexformer 将 mIoU 差距从 Performer 的 73.18% 缩小至 76.25%,几乎与 Transformer(77.70%)持平。
- RGB-D 分割(NYU Depth v2, SUN RGB-D):
- 使用 DFormer 骨干网络,RelFlexformer 在 NYU Depth v2 上实现了 55.32% 的 mIoU,在 SUN RGB-D 上实现了 51.04%,优于 Performer 基线和最近提出的 STRING 方法,同时避免了 STRING 的参数开销。
意义与主张
论文声称,RelFlexformer 提供了一个 统一的几何算子,它将最近的多维编码(如 STRING)作为特例纳入其中,同时通过坐标提升将次二次方效率扩展至密集 RGB-D 数据。
其主要意义在于缩小了高效线性注意力与标准密集注意力之间的准确率差距。作者认为,通过 NU-FFT 框架几何调制,可以在不牺牲核化注意力计算优势的前提下,融入广泛的 RPE 可积函数家族。这确立了 RelFlexformer 作为一种高度可扩展的架构,用于处理此前受限于标准密集注意力二次方成本的大规模不规则点云。结果表明,配备适当几何调制的注意力机制可以达到甚至有时超越密集 Transformer 的性能,使其成为延迟和内存是关键约束的现实世界 3D 感知任务的可行方案。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。