← 最新论文
💻 computer science

TRACE-GS: On-Policy Trajectory Distillation with Privileged Geometric Conditioning for Sparse-View 3DGS Restoration

TRACE-GS 引入了一种在策略轨迹蒸馏框架,该框架在训练过程中利用特权几何条件来对齐去噪方向并修正稀疏视图 3D 高斯泼溅恢复中的累积误差,从而在部署时无需额外视图即可实现卓越的泛化能力。

原作者: Linlian Jiang, Yuchen Xi, Sadman Rakib Pinon, Ruigang Yang, Yang Wang, Xinxin Zuo

发布于 2026-08-12
📖 1 分钟阅读☕ 轻松阅读

原作者: Linlian Jiang, Yuchen Xi, Sadman Rakib Pinon, Ruigang Yang, Yang Wang, Xinxin Zuo

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图构建一个完美的 3D 房间模型,但你手里只有从几个角度拍摄的少量模糊照片。在计算机视觉领域,这是一个经典的难题,被称为“稀疏视图 3D 重建”(sparse-view 3D reconstruction)。目标是填补所有缺失的部分——墙壁、家具、阴影——以便你可以走入模型并在任何角度观察它。最近,一种名为 3D 高斯泼溅(3D Gaussian Splatting, 3DGS)的技术成为了这项工作的明星,因为它能以极快的速度渲染 3D 场景,几乎就像玩电子游戏一样。然而,当你没有足够的照片时,计算机就会感到困惑。它可能会制造出漂浮的彩色斑块、模糊边缘,或者让几何结构看起来像融化的蜡。为了解决这个问题,科学家们开始使用“扩散模型”(diffusion models),它们就像是在数百万张图像上训练出来的 AI 艺术家。这些 AI 可以猜测缺失的部分应该长什么样,但当它们必须在缺乏足够线索的情况下进行逐步猜测时,往往会出错。

于是,TRACE-GS 登场了,它像是一位正在训练运动员的顶级教练。研究人员意识到,虽然 AI 模型变得越来越聪明,但它们仍在犯一种特定的错误:它们被教导根据随机、孤立的快照进行猜测,但随后却必须完成一段漫长且连贯的旅程来创建最终图像。这就像是教学生通过看一些无关问题的答案来解决数学题,然后期望他们在没有任何帮助的情况下解出一长串方程组。学生会在途中迷失方向。TRACE-GS 通过彻底改变训练方式解决了这个问题。它不再仅仅给学生提供随机的线索,而是使用了一个在训练期间可以接触到高质量完整 3D 模型的“特权”教师(因为训练数据比现实世界的问题拥有更多的照片)。这位教师会在学生独自工作时的每一步都引导它,纠正它的航向。结果是,该系统可以利用几张模糊的照片,将它们转化为细节清晰、精细的 3D 场景,即使在其他方法失效的困难情况下也是如此。

问题所在:在途中迷失

当你尝试仅用极少数照片(例如 3 张、6 张或 9 张)重建 3D 场景时,计算机必须填补巨大的空白。现有方法试图使用 AI “扩散”模型来猜测缺失的细节。把这想象成一场“传声筒”游戏,你试图根据一段耳语的描述来画一幅画。大多数目前的 AI 方法是通过观察最终图像并询问:“如果我们加入一些噪声,它看起来会怎样?”来进行训练的。它们学习的是如何孤立地去除这些噪声。

但问题在于:当 AI 实际尝试构建图像时,它并不是从一张白纸开始直接跳到终点,而是经历一段漫长的、循序渐进的旅程——做一个猜测,然后利用这个猜测进行下一次猜测。如果第一个猜测稍有偏差(由于照片稀疏,这经常发生),这个误差就会传递下去。下一个步骤建立在错误之上,下一个步骤又建立在那个错误之上。到 AI 完成时,误差已经堆积如山,导致图像发生扭曲。论文称之为“离策不匹配”(off-policy mismatch)。这就像一个在完美地图上接受训练、却要在街道缺失的城市中导航的 GPS;它不断根据错误的数据重新计算,结果让你在原地绕圈。

解决方案:特权教练

TRACE-GS 的作者意识到,训练数据通常包含比现实世界问题更多的照片。在训练期间,他们可以接触到“稠密”视图(许多照片),但在部署阶段(即用户实际使用该工具时),他们只有“稀疏”视图(少量照片)。

他们创建了一个包含两个角色的系统:

  1. 学生: 这是将在现实世界中使用的模型。它只能看到少量的、稀疏的照片。
  2. 教师: 这是学生的副本,但在训练期间,它可以看到丰富的、稠密的照片集。这就是“特权信息”。

魔法发生在训练过程中。研究人员并没有简单地将学生的随机猜测与目标进行比较,而是让学生完成它自己的旅程(即“展开过程/rollout”)来生成图像。在这个旅程的每一步,拥有完整高品质几何信息的教师都会介入并说:“不,那样不对。这里是下一步正确的方向。”

至关重要的一点是,教师并不进行自己的旅程。它只是观察学生“当前”的状态,并给出修正。这确保了学生学习的是如何导航它实际会走的特定路径,而不是仅仅学习如何修复随机、孤立的错误。这被称为“在策轨迹蒸馏”(on-policy trajectory distillation)。

结果:更锐利的细节,更少的幻影

论文在各种数据集上测试了这种方法,包括真实场景和合成场景。他们将 TRACE-GS 与其他顶尖方法(如 Difix3D+、GenFusion 和 GSFixer)进行了对比。

结果令人印象深刻。在仅有 3 个输入视图(最难的情况)的测试中,TRACE-GS 始终比竞争对手产生更好的图像。例如,在 DL3DV-Benchmark 数据集上,它在 3 视图下的 PSNR(衡量图像质量的分数)达到了 16.92,击败了排名第二的 GSFixer(得分为 16.21)。随着视图数量增加到 6 个和 9 个,TRACE-GS 继续保持领先或并列第一。

视觉上的差异非常显著。在具有反射表面(如闪亮的商店橱窗)或复杂纹理的场景中,其他方法经常会产生模糊的斑块或“幻影”(漂浮的伪影)。然而,TRACE-GS 能够恢复锐利的细节。在一个例子中,当其他方法使标牌上的文字或椅子的轮廓变得模糊时,TRACE-GS 保持了边缘的清晰和结构的逻辑性。

研究人员还进行了“消融实验”(即通过移除系统中的部分组件来观察其影响的实验)。他们发现:

  • 特权几何信息至关重要: 如果教师无法接触到额外的照片(特权几何信息),系统的表现会比基准方法差。这些额外的视图对于提供正确的引导至关重要。
  • 在策训练至关重要: 如果他们使用旧的“离策”方法(使用随机步骤而非学生的实际路径)进行训练,质量就会下降。这证明了沿着学生自身的路径进行纠正是成功的关键。

为什么有效

核心思想在于,学生看到的(稀疏视图)与教师看到的(稠密视图)之间的“差距”被用作了一种教学工具。教师知道场景“应该”是什么样子,因为它拥有更多信息。通过在学生的整个旅程中进行步进式引导,教师防止了微小的误差演变成巨大的灾难。

一旦训练完成,教师就会被丢弃。此时的学生已成为自己路径的大师,被投入使用。它接收稀疏的照片,运行自己的去噪旅程,并生成高质量的 3D 场景,该场景可以进一步优化。论文指出,这种方法是迈向稀疏视图 3D 恢复的重要一步,它提供了一种无需昂贵、稠密相机设置即可获得高质量结果的方法。它将一场困难且易错的猜测游戏变成了一场引导式的巡游,确保即使信息有限,最终的目的地依然清晰且锐利。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →