← 最新论文
💻 computer science

RI-Mamba: Rotation-Invariant Mamba for Robust Text-to-Shape Retrieval

本文提出了 RI-Mamba,这是首个用于点云的旋转不变状态空间模型,它通过定义参考系、利用希尔伯特排序构建序列以及引入方向嵌入调制策略,在无需人工标注的情况下实现了跨类别、任意朝向的鲁棒文本到形状检索,并在 OmniObject3D 基准测试中取得了最先进性能。

原作者: Khanh Nguyen, Dasith de Silva Edirimuni, Ghulam Mubashar Hassan, Ajmal Mian

发布于 2026-02-13
📖 1 分钟阅读☕ 轻松阅读

原作者: Khanh Nguyen, Dasith de Silva Edirimuni, Ghulam Mubashar Hassan, Ajmal Mian

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文介绍了一种名为 RI-Mamba 的新技术,它的核心目标是让计算机能更聪明、更灵活地通过“文字”来搜索"3D 物体”。

想象一下,你正在一个巨大的、没有标签的 3D 物品仓库里找东西。以前,如果你想找“一把红色的椅子”,你只能找到那些正正好好摆好面朝前方的椅子。如果椅子被倒过来放,或者侧着放,以前的系统就“瞎”了,根本认不出来。

这篇论文提出的 RI-Mamba 就像是一位拥有超级空间感的寻宝专家,无论椅子是倒立、侧躺还是旋转了 360 度,它都能一眼认出:“嘿,这就是你要找的那把红椅子!”

下面我们用几个生动的比喻来拆解这项技术:

1. 核心难题:为什么以前的系统会“晕头转向”?

以前的 3D 搜索系统就像是一个死板的图书管理员

  • 限制一:它只认识特定的书(物体类别很少,比如只认识椅子和桌子)。
  • 限制二:它要求书必须按标准姿势摆放(比如书脊朝外,封面朝上)。如果书被倒着放,它就找不到索引了。
  • 限制三:它需要人类管理员给每本书手写标签(人工标注),这太慢太贵了,没法处理海量的 3D 数据。

2. RI-Mamba 的三大“超能力”

超能力一:旋转免疫眼镜(Rotation Invariance)

比喻:想象你戴了一副智能眼镜。当你转头看一个苹果时,苹果在你的视野里是旋转的,但你的大脑知道“苹果还是那个苹果”。

  • RI-Mamba 怎么做:它给 3D 物体(点云)戴上了一副“旋转免疫眼镜”。
    • 局部参考系(LRF):对于物体的每一小块(比如椅子的腿),它都会建立一个“小指南针”。不管椅子怎么转,这个“小指南针”永远指着椅子的内部结构。这样,系统就能忽略旋转,只看物体本身的形状。
    • 全局参考系(GRF)+ 希尔伯特曲线:为了把散乱的 3D 点排成一队(因为计算机喜欢按顺序处理数据),它用一种叫“希尔伯特曲线”的魔法,把物体上的点像贪吃蛇一样,按照空间位置紧密地串起来。无论物体怎么转,这条“贪吃蛇”的排队顺序永远不变。

超能力二:找回“丢失”的方向感(Orientational Embeddings)

比喻:如果你把一张照片剪成碎片,然后只告诉别人“这是碎片 A",别人可能不知道碎片 A 原本在照片的左上角还是右下角。

  • 问题:为了做到“旋转免疫”,系统刚才把物体的方向信息(比如哪头朝上)给“过滤”掉了。这就像为了看清形状,把物体的“姿势”给忘了,导致它虽然认得形状,但不知道物体在空间里是怎么摆的。
  • RI-Mamba 的解法:它发明了一种**“方向记忆补丁”**。
    • 它在过滤掉方向信息的同时,偷偷给每一块碎片贴上一个“方向标签”,告诉它:“虽然你现在被摆正了,但你原本相对于整个物体是朝哪个方向的。”
    • 最后,它用一种叫 FiLM(特征线性调制) 的技术,把这些“方向标签”重新缝回到形状特征里。就像给一个没有表情的模特穿上了衣服,让它既保留了形状,又恢复了生动的姿态。

超能力三:像 Mamba 蛇一样高效(State-Space Model)

比喻:以前的系统(基于 Transformer)像是一个超级健谈但记性差的人,每认识一个新朋友,都要把之前认识的所有人重新过一遍脑子,人越多,脑子越乱,速度越慢(计算量呈平方级增长)。

  • RI-Mamba 的解法:它采用了 Mamba 架构,这就像一条聪明的蛇
    • 蛇在爬行时,只需要记住当前的状态和下一步,不需要回头重新检查整条路。
    • 这意味着,无论 3D 物体有多少个点,RI-Mamba 的处理速度都是线性增长的(点越多,时间只增加一点点),而且非常省电、省内存。这让它能轻松处理成千上万个物体。

3. 不用人工标注的“自学成才”

以前的系统需要人类给每个 3D 模型写描述(比如“这是一把红色的木椅子”),这太慢了。

  • RI-Mamba 的做法:它玩起了**“看图说话”和“连连看”**的游戏。
    • 它把 3D 模型渲染成图片,然后用现有的 AI(像 CLIP)自动给图片写描述。
    • 接着,它把"3D 模型”、“渲染图”和“自动生成的文字”凑成一组,强迫它们互相学习。
    • 结果:不需要人类动手,它就能在包含 200 多种物体、成千上万个模型的巨大数据库里自学成才。

4. 总结:它有多厉害?

在实验中,RI-Mamba 展现了惊人的能力:

  • 全能选手:它能在 200 多种不同的物体类别中进行搜索(以前只能搜几种)。
  • 旋转无敌:无论物体怎么转,它都能精准找到,而以前的方法一旦物体旋转,准确率就暴跌。
  • 速度快:它比目前最先进的方法(RI-Transformer)快得多,且更省内存,就像从“老式拖拉机”升级到了“特斯拉”。

一句话总结
RI-Mamba 就像是一个拥有超级空间感、不需要人工教、且跑得飞快的 3D 搜索专家。它打破了以前 3D 搜索必须“正襟危坐”的限制,让未来的虚拟现实(VR)、游戏和机器人能像人类一样,随意地通过文字在 3D 世界里寻找任何物体。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →