← 最新论文
💻 computer science

JSGS: JPEG State-Guided Supervision for 3D Gaussian Splatting from Mixed-Quality Views

本文提出了 JSGS,这是一种利用 JPEG 量化表来构建特定视图观测算子和频率感知监督的新方法,有效地减轻了压缩伪影,并提高了在混合质量 JPEG 图像上训练的 3D 高斯泼溅(3D Gaussian Splatting)的重建质量。

原作者: Jinhua Cui, Anhong Wang, Kai Hu, Donghan Bu, Peihao Li, Tammam Tillo, Hao Jing, Shiao Xu

发布于 2026-08-11
📖 1 分钟阅读☕ 轻松阅读

原作者: Jinhua Cui, Anhong Wang, Kai Hu, Donghan Bu, Peihao Li, Tammam Tillo, Hao Jing, Shiao Xu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图仅凭照片来构建一个完美的 3D 城市模型。在计算机图形学世界中,有一种超快、超清晰的技术叫做 3D 高斯泼溅(3D Gaussian Splatting)。这就像一位数字艺术家向虚拟空间中投掷数百万个微小的、毛茸茸的、有颜色的云朵(称为高斯体)。计算机能够计算出每一朵云应该漂浮在哪里、有多大以及需要什么颜色,这样当你从任何角度观察模型时,它看起来都和真实照片一模一样。

通常情况下,这种魔术般的技巧在每一张输入给计算机的照片都清晰完美时效果最好。但在现实世界中,照片很少是完美的。它们会被“挤压”并保存为 JPEG 格式以节省手机或硬盘的空间。这种“挤压”过程(称为压缩)就像是试图把一个巨大的、蓬松的枕头塞进一个很小的行李箱。为了让它装得下,行李箱(JPEG 文件)必须挤压枕头,从而产生奇怪的块状图案或边缘周围的模糊环纹。这些被称为“伪影(artifacts)”。如果你尝试用一些完美的照片和一些被挤压过的、带有块状纹理的照片来构建这个 3D 城市,计算机就会感到困惑。它会试图修复那些块状的部分,但这样做却会弄乱那些原本完美的部分,导致生成的 3D 模型看起来出现闪烁和怪异的现象。

这正是研究人员在名为 JSGS 的新论文中所解决的难题。他们提出了一个简单的问题:如果计算机不仅仅是试图忽略那些糟糕的照片,而是实际上理解了它们是如何被挤压的呢? JSGS 不仅仅把低质量的 JPEG 看作一张“坏”照片,而是将其视为一个具有特定规则的谜题。论文指出,通过利用存储在每个 JPEG 文件内部的隐藏“说明书”(称为量化表),计算机可以准确学习该特定照片是如何被扭曲的。通过在自己的 3D 模型上模拟同样的扭曲过程,然后再与照片进行对比,计算机就可以停止与伪影作斗争,转而向它们学习。结果是,即使是用混合了高质量和低质量照片构建的模型,也能呈现出极其锐利且真实的视觉效果。

问题所在:“坏照片”带来的困惑

想象你是一位正在给学生的画作打分的老师。你有一张完美的自行车参考照片。但你的学生只能接触到那张照片的复印件,而那张复印件是用廉价、有颗粒感的打印机打印出来的。复印件的轮子周围有奇怪的方块,车把手周围有模糊的环纹。

如果你告诉学生:“照着这张复印件画。”他们就会画出那些方块和模糊感。如果你随后展示另一张清晰无比的自行车照片,并告诉他们去修正他们的画作,他们可能会感到困惑。他们应该保留那些方块(因为第一张照片有),还是应该去掉它们(因为第二张照片没有)?

这正是标准 3D 高斯泼溅技术中发生的情况。计算机试图利用许多不同的照片来构建一个单一的 3D 世界。如果一张是高质量的 JPEG,而另一张是低质量、带块状纹理的 JPEG,计算机就会“头疼”。它试图更新 3D “云朵”以匹配那个带块状纹理的照片,但这会破坏其他照片试图构建的平滑部分。论文认为,标准方法就像是在评分时完全不看打印机制作那张复印件时所使用的具体指令。

解决方案:“神奇翻译官”(JSGS)

作者们提出了一种巧妙的解决方案,称之为 JSGS(JPEG 状态引导监督)。JSGS 不再忽视照片经历的“挤压”,而是利用隐藏在每个 JPEG 文件中的秘密指令来引导计算机。

以下是它的工作原理,分为三个有趣的步骤:

1. “假戏真做”的翻译官(JPEG 观测算子)
每个 JPEG 文件内部都有一个隐藏的笔记,叫做量化表。这张表就像一张食谱卡,上面写着:“对于这张照片,我们将明亮的颜色挤压了这么多,将暗色的颜色挤压了那么多。”
JSGS 会获取计算机的 3D 模型,渲染出一张图片,然后使用原图中找到的完全相同的食谱卡,对这张图片运行一个“模拟”的 JPEG 处理过程。这就像计算机在说:“好吧,我会画出这辆自行车,但我会故意挤压我的画作,使其看起来和你那张低质量照片一模一样。” 现在,当它将自己挤压后的画作与你挤压后的照片进行对比时,它们就能完美匹配!计算机不再与方块作斗争,它正在学习如何“说”这种方块语言。

2. “频率侦探”(领域匹配的 DCT 监督)
照片是由不同类型的细节组成的。有些是大而模糊的形状(低频),有些是微小而锐利的边缘(高频)。“挤压”过程通常对中间大小的细节破坏最大。
JSGS 扮演着一名知道照片中哪些部分被挤压得最厉害的侦探。它利用食谱卡来权衡误差。如果照片在某个区域被严重挤压,计算机就知道在那里要“温柔”一点;如果照片很清晰,计算机就知道要密切关注。这就像一位老师知道:“哦,这个学生的字迹在页面中间有点抖动,所以我会在上下两端清晰的地方重点评分。” 这有助于计算机学习正确的细节,而不被噪声干扰。

3. “云朵管理者”(高斯控制器)
有时,计算机仍然会发现照片与模型之间存在分歧。也许照片中有一个奇怪的方块区域,而模型中却没有。
JSGS 有一个特殊的管理者来观察这些分歧。如果计算机看到一个微小的、模糊的云朵(高斯体)在方块区域造成了混乱,管理者就会命令它缩小或变得平滑。这就像一名交通警察,指挥微小的云朵避开麻烦点,以免造成“交通拥堵”。这能保持 3D 模型干净,防止“坏照片”毁掉整个场景。

研究发现

团队在七个不同的 3D 场景(从自行车到恐龙)上测试了他们的新方法,并使用了三种不同的高质量与低质量照片混合方式。

  • 结果: JSGS 取得了巨大的成功。它生成的 3D 模型比以往的方法看起来更真实。具体来说,它在所有测试中都拥有最低的误差率(称为 LPIPS),这意味着模型看起来最接近真实情况。它也拥有最高的结构相似度(SSIM),意味着形状和细节得到了最好的保留。
  • 速度: 最酷的事情之一是,JSGS 并没有减慢速度。它可以以大约 150 帧每秒 (FPS) 的速度渲染 3D 场景。这足以让 3D 世界感觉像真实的视频游戏一样流畅,即便它正在进行所有这些复杂的数学运算来修复糟糕的照片。
  • 权衡: 虽然 JSGS 在让图像看起来更真实和结构正确方面表现最好,但另一种名为 FDS-GS 的方法在测量原始像素亮度(PSNR)方面略胜一筹。然而,作者认为,对于人类的眼睛来说,看起来“真实”(低 LPIPS)通常比单纯匹配像素数值(PSNR)更重要。

核心结论

论文得出结论,通过理解照片是如何被压缩的,而不是仅仅将其视为一张坏图,我们可以构建出更好的 3D 世界。JSGS 就像是一个翻译官,帮助计算机理解不同 JPEG 照片的“口音”。

然而,作者也诚实地指出了局限性。他们的方法对于经过一次压缩的照片效果很好。但它还无法处理经过压缩、保存、然后再压缩(二次压缩)的照片,因为第二次压缩会覆盖掉原始的指令。此外,他们是在实验室环境中制作的照片上进行的测试,因此目前还不确定它在处理现实世界中随机相机拍摄的每一张照片时表现如何。

但就目前而言,JSGS 为如何将一堆杂乱的照片转化为令人惊叹的高速 3D 体验提供了一种有趣且强大的新途径。它证明了,有时为了构建完美,你必须理解那些不完美。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →