← 最新论文
🤖 machine learning

RelFlexformer: Efficient Attention 3D-Transformers for Integrable Relative Positional Encodings

本文介绍了 RelFlexformer,这是一类高效的 3D Transformer 模型,它利用非均匀傅里叶变换(NU-FFT)将任意可积的相对位置编码以O(LlogL)O(L \log L)的复杂度进行集成,从而为结构化网格以及点云等非结构化异构 3D 数据实现有效的注意力机制。

原作者: Byeongchan Kim, Arijit Sehanobish, Avinava Dubey, Min-hwan Oh, Krzysztof Choromanski

发布于 2026-05-12
📖 1 分钟阅读☕ 轻松阅读

原作者: Byeongchan Kim, Arijit Sehanobish, Avinava Dubey, Min-hwan Oh, Krzysztof Choromanski

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在组织一场庞大而混乱的派对,客人们站在一个三维房间里。有些人靠得很近,有些人相距甚远,房间里没有整齐的网格或行列。你的目标是根据客人们彼此之间的远近,来决定谁该和谁交谈。

在计算机视觉的世界里,这场“派对”就是3D 点云(代表空间中物体的一组点),而“客人”就是数据点。计算机使用一种称为Transformer的工具来决定谁该和谁交谈。

以下是这篇论文所解决的问题,用简单的方式解释:

问题:“二次方”瓶颈

标准的 Transformer 就像一位坚持在任何人开口说话之前,必须检查每一位客人与其他每一位客人之间距离的派对主持人。

  • 如果你有 100 位客人,主持人需要进行 10,000 次检查。
  • 如果你有 1,000 位客人,主持人需要进行 1,000,000 次检查。
  • 如果你有 10,000 位客人(这在 3D 扫描中很常见),主持人就会不堪重负,耗尽内存,派对随之停止。这就是二次方成本O(L2)O(L^2))。

为了解决这个问题,研究人员发明了“高效 Transformer"(例如Performers)。这些主持人使用捷径:他们利用巧妙的数学技巧来猜测谁该和谁交谈,从而使派对运行得更快(O(L)O(L))。

  • 问题在于:这些捷径在速度上表现出色,但在理解几何结构方面却非常糟糕。它们忘记了在三维房间中,距离至关重要。它们将站在你身边的客人与站在房间另一端的客人同等对待,这破坏了 3D 任务的准确性。

解决方案:RelFlexformer

作者引入了RelFlexformer,这是一种新型的高效主持人,既快速具备几何感知能力

可以这样理解:

  1. 捷径:它不再检查每一对组合,而是使用一种“魔法透镜”(称为NU-FFT,即非均匀快速傅里叶变换)来即时计算距离如何影响交流。
  2. 灵活调制:想象主持人对每一对客人都有一个特殊的“音量旋钮”。如果两位客人靠得很近,音量就调高(他们交谈很多);如果他们相距较远,音量就调低。
    • 旧的高效方法无法在不破坏其速度捷径的情况下调节这个旋钮。
    • RelFlexformer 可以为任何形状的房间(甚至是杂乱无章、不规则的三维空间)调节这个旋钮,而不会降低速度。它通过将距离问题转化为频率问题(就像将一首复杂的歌曲转化为简单的旋律)并快速求解来实现这一点。

“魔法”类比:管弦乐队

想象 3D 点是一个管弦乐队中的音乐家,他们随机散布在大厅里。

  • 标准 Transformer 要求每位音乐家倾听其他所有音乐家,以寻找和谐。对于大型管弦乐队来说,这需要耗费永恒的时间。
  • 旧的高效 Transformer 要求音乐家仅根据简单规则来猜测和谐。这很快,但音乐听起来很平淡,因为它们忽略了谁坐在谁旁边。
  • RelFlexformer 就像一位使用特殊声学镜子的指挥家。它不要求每个人倾听所有人,而是让镜子即时反射声波,使音乐家能够根据彼此的具体距离,确切地知道该演奏多大的音量。它保留了房间的“空间感”,同时缩短了排练时间。

他们声称达成的成就

该论文声称,通过使用这种“声学镜子”(即 NU-FFT 数学):

  1. 速度:它保持快速,即使面对海量数据,其扩展性也几乎呈线性(O(LlogL)O(L \log L))。当“派对”变得太大时,它不会崩溃。
  2. 准确性:它恢复了缺失的“距离感”。在 3D 物体识别(例如从点云中识别椅子)和 3D 分割(标记房间的部分)的测试中,RelFlexformer:
    • 击败了旧的“快但笨”的方法(Performers)。
    • 经常击败慢但聪明的标准 Transformer,尽管它的速度快得多。
  3. 通用性:它适用于杂乱无章的真实世界数据,例如点云(来自激光雷达扫描仪)和RGB-D 图像(能感知深度的相机),在这些数据中,点并不在整齐的网格中。

总结

RelFlexformer 是计算机观察 3D 形状的一种新方法。它将捷径的速度理解物理距离的精度相结合。它使计算机能够快速处理复杂的 3D 场景(例如机器人在房间内导航),而不会丧失判断事物之间距离的能力。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →