✨ 要点🔬 技术摘要
想象一下,你拥有一个由成千上万个微小的、发光的弹珠(这些就是“3D 高斯点”)组成的神奇、隐形的 3D 雕塑。你想从中挑选出一个特定的物体——比如一个红苹果——以便你可以移动或删除它。
旧有的问题:漫长的等待 以前,如果你想做到这一点,你必须花很长时间(几分钟甚至一小时)来“准备”这个雕塑。这就像雇佣一支工人团队绕着雕塑走动、从各个角度拍照、在这些照片上画出轮廓,然后花好几个小时教计算机如何识别这个苹果。只有在完成了所有这些繁琐的准备工作之后,你才能点击苹果进行移动。这使得实时交互变得不可能。
新的解决方案:SAGO 与虚拟无人机 这篇论文介绍了一种名为 SAGO (Segment Any Gaussians Online,在线分割任意高斯点)的新方法。它不需要漫长的准备过程,而是能瞬间响应。以下是它的工作原理,我们用一个简单的类比来说明:
1. 虚拟无人机 想象你站在雕塑前,指着那个苹果。SAGO 不会等待工人,而是会从你的位置立即发射出两架隐形的无人机 。
一架无人机绕着物体顺时针飞行。
另一架则逆时针飞行。
2. “最佳视角”游戏 这些无人机并不是随机飞行的;它们正在玩一场聪明的“下一最佳视角”(Next-Best-View)游戏。
目标: 它们想要找到一个完美的角度,既能清晰地看到苹果,又能遮挡住背景的杂乱。
策略: 无人机会询问:“如果我向左转 30 度,是否能看到更多的苹果并减少背景干扰?”它会测试几个选项(比如转动 30°、60° 或 90°),并选择能提供最佳视角的那个。
3. “剪枝”过程(魔法剪刀) 当无人机飞到新位置时,它会拍下一张照片,并使用一种智能 AI(称为 SAM)在苹果周围画出一个掩码(mask)。
过滤器: 系统随后会查看构成场景的数百万个发光弹珠(高斯点)。
切割: 如果某个弹珠位于无人机拍摄的新苹果图像之外,系统会立即将其剪掉(将其归类为背景)。
重复: 无人机飞向下一个最佳位置,拍下另一张照片,并再次剪掉更多的背景弹珠。
4. 结果 在不到一秒钟的时间里,无人机就已经绕着物体飞了一圈,拍了几张聪明的快照,并“剪掉”了所有不是苹果的部分。你得到了一个干净、独立的 3D 苹果,可以立即拖动、放置或编辑。
为什么这意义重大
速度: 旧的方法需要 50 到 60 秒来进行准备。而这种新方法完成整个工作仅需约 0.5 秒 (半秒)。这实现了 50 倍的加速 。
无需设置: 你不需要对场景进行预处理。你只需打开 3D 世界,点击,然后开始操作。
质量: 尽管速度极快,但论文声称其准确度与那些缓慢的旧方法一样高(甚至更好)。
总结 把 SAGO 想象成一组超级快速、隐形的无人机,它们环绕物体飞行,拍下几张具有战略意义的照片,并瞬间切除背景噪音,留下一个干净的 3D 物体供你立即操作。它将一个缓慢、枯燥的准备过程变成了一种即时的、交互式的体验。
技术摘要:SAGO —— 通过发射虚拟无人机实现在线 Segment 3D Gaussians
1. 问题陈述
对 3D 高斯泼溅(3DGS)场景进行交互式分割受到现有计算开销的限制。目前最先进的方法通常需要一个耗时的“设置阶段”(从数十秒到几分钟不等)才能进行交互式分割。该设置过程涉及多视图掩码准备、掩码提升、特征蒸馏以及针对特定场景的对比学习。这些要求为在线应用制造了显著的瓶颈,阻碍了对原始 3DGS 场景进行实时操作和编辑。本研究解决的核心挑战是在保持与离线方法相当的分割质量的同时,完全消除这一设置阶段,并实现低于一秒的交互延迟。
2. 方法论:SAGO
作者提出了 SAGO (Segment Any Gaussians Online) ,这是一个无需设置的框架,它将 3D 分割重新定义为一个在线 最佳下一视角 (Next-Best-View, NBV) 规划任务。该方法引入了“虚拟无人机”的概念来动态探索场景。
核心概念:虚拟无人机与 NBV 规划
SAGO 不依赖于预计算的特征或静态训练视图,而是将分割过程视为一个马尔可夫决策过程。
虚拟无人机: 从用户的初始交互视图开始,系统发射虚拟无人机,通过迭代规划其下一个最佳观察位置(NBV),以最大化目标对象的覆盖范围。
双轨迹: 两架虚拟无人机同时从交互视点出发,分别沿顺时针和逆时针方向探索场景(各覆盖 180 度的偏航角范围)。
状态表示: 系统在每一步的状态 S t S_t S t 由一个四元组定义:
A ( t ) \mathcal{A}^{(t)} A ( t ) :当前的当前前景高斯集合。
v t \mathbf{v}_t v t :虚拟无人机的位姿(目标中心 c t c_t c t ,半径 r t r_t r t ,偏航角 ϕ t \phi_t ϕ t ,俯仰角 θ t \theta_t θ t )。
M t \mathcal{M}_t M t :用于 Segment Anything Model (SAM) 在不同视图间追踪目标的记忆库。
τ t \tau_t τ t :覆盖率指标。
技术流水线
状态初始化:
过程始于用户在初始 2D 视图上的提示(点击、框选或文本)。
掩码形状视锥过滤 (Mask-shaped Frustum Filtering, MFF): 利用初始 2D 掩码来过滤 3D 高斯集合。作者采用了基于中心的 MFF ,即如果一个高斯的 3D 中心投影在 2D 掩码轮廓之外,则将其归类为背景。这立即缩小了搜索空间。
根据投影在初始掩码内的 3D 高斯位置来初始化目标中心 c t c_t c t 。
在线 NBV 规划:
系统采用 探索-评估 (Exploration-Evaluation, EE) 策略来确定下一个视图的最佳偏航角 (ϕ \phi ϕ ) 和俯仰角 (θ \theta θ )。
偏航增量 (Δ ϕ \Delta\phi Δ ϕ ) 的搜索空间为 { 90 ∘ , 60 ∘ , 30 ∘ } \{90^\circ, 60^\circ, 30^\circ\} { 9 0 ∘ , 6 0 ∘ , 3 0 ∘ } ,俯仰角 (θ \theta θ ) 的搜索空间为 { 0 ∘ , 30 ∘ , 60 ∘ } \{0^\circ, 30^\circ, 60^\circ\} { 0 ∘ , 3 0 ∘ , 6 0 ∘ } 。
NBV 的选择旨在最大化可以被过滤掉的背景高斯数量 (∣ Δ A ′ ∣ |\Delta\mathcal{A}'| ∣Δ A ′ ∣ ),同时确保新的分割掩码与初始掩码保持一致性(通过 mIoU ≥ σ \geq \sigma ≥ σ 衡量),以防止误差级联。
如果较大的偏航增量(如 90 ∘ 90^\circ 9 0 ∘ )未能追踪到目标,系统会退回到较小的增量(60 ∘ 60^\circ 6 0 ∘ ,然后是 30 ∘ 30^\circ 3 0 ∘ )。
状态更新:
虚拟无人机导航至选定的 NBV,渲染出新视图。
SAM (Segment Anything Model) 利用记忆库 M t \mathcal{M}_t M t 生成该新视图的分割掩码,用于追踪目标。
再次应用 MFF 以更新新视图中的前景集合 A ( t + 1 ) \mathcal{A}^{(t+1)} A ( t + 1 ) 和背景集合 B ( t + 1 ) \mathcal{B}^{(t+1)} B ( t + 1 ) 。
该过程循环迭代,直到实现目标对象的全覆盖。
3. 核心贡献
无需设置的框架: SAGO 完全消除了现有基于优化方法所需的逐场景设置阶段,实现了对原始 3DGS 场景的交互式分割。
虚拟无人机范式: 本文引入了一种原则性的公式,将 3D 在线分割重新构建为虚拟无人机的 NBV 规划问题,利用主动视觉原理来解决遮挡并精细化边界。
效率与质量: 与之前的无需设置框架相比,该方法实现了 50 倍的推理加速 (将延迟从 40–60s 降低到 0.4–0.9s),同时提供了与最先进的离线方法相当或更优的分割质量。
4. 实验结果
作者在多个数据集上评估了 SAGO,包括 SPIn-NeRF、NVOS、3D-OVS、LERF-Mask 等。
定量性能:
NVOS: 实现了 92.7% 的 mIoU 和 98.7% 的 mAcc,优于包括离线(如 SAGA)和在线(如 iSegMan, GaussianCut)在内的基准方法。
SPIn-NeRF: 实现了 92.5% 的 mIoU 和 99.3% 的 mAcc,在所有对比方法中 mIoU 位列第二,mAcc 位列第一。
3D-OVS: 实现了 96.2% 的平均 mIoU,超过了之前的最优方法 (SAGA) 0.2%。
LERF-Mask: 实现了 91.0% 的平均 mIoU,比 ClickGaussian 高出 1.9%。
延迟: 每次交互的平均分割延迟约为 500 ms (0.4–0.9s),支持实时交互。
消融实验:
取消 NBV 策略(仅依赖原始场景视图)会导致性能大幅下降,特别是在存在遮挡的场景中(例如在 LERF-Mask 上 mIoU 下降了 54.3%),这验证了主动视图探索的必要性。
研究发现,基于中心的 MFF 比基于点阵 (splat-based) 的 MFF 更高效且更有效。
5. 重要性与主张
本文声称 SAGO 通过消除预计算障碍,代表了 3DGS 交互领域的重大转变。通过利用虚拟无人机和 NBV 规划,该方法实现了:
直接资产提取: 用户可以在不到一秒的时间内从原始场景中提取干净的 3D 资产。
在线编辑: 提取的资产可以在 3DGS 场景中立即进行操作(移动、移除、复制、粘贴)。
广泛适用性: 该方法支持多种提示(点击、框选、文本),并在无需场景特定调优的情况下推广至各种数据集。
作者承认了局限性,指出基于中心的 MFF 可能会导致边界呈锯齿状(尽管这可以通过后续的修剪方法来解决),并且该方法依赖于高质量的初始视图来进行状态初始化。未来的工作建议探索寻找最优初始视图的主动策略。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。