← 最新论文
💻 computer science

Denoising Monte Carlo Renders with Diffusion Models

本文表明,扩散模型在以自然渲染信息为条件时,能够通过利用产生如笔直阴影和光滑镜面反射等真实特征的图像先验,有效地对低保真蒙特卡洛渲染进行去噪,并在各种采样率下实现了与最先进方法相媲敌的性能。

原作者: Vaibhav Vavilala, Rahul Vasanth, David Forsyth

发布于 2026-07-22
📖 1 分钟阅读☕ 轻松阅读

原作者: Vaibhav Vavilala, Rahul Vasanth, David Forsyth

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图在一间漆黑的房间里用一台相机拍照,这台相机极其灵敏,但也有点笨拙。为了拍出一张清晰的照片,你必须长时间开启快门,让数百万个微小的光粒子进入镜头。但如果你只让极少数粒子进入,照片看起来就像旧电视上的静电一样——充满颗粒感、斑点,且布满了随机的亮点。这正是计算机图形学领域中,艺术家在尝试创建逼真的 3D 电影或游戏时所面临的情况。他们使用一种被称为“蒙特卡洛渲染”(Monte Carlo rendering)的技术,这基本上是一种猜测光线如何在场景中反弹的高级方法。他们制造的“猜测”(或称“射线”)越多,图像就越清晰,但所需的时间也越长。如果时间不够,结果就会是一个嘈 l 噪、混乱的废品,看起来完全不像真实的照片。

多年来,解决方案要么是等待更长时间(这既昂贵又缓慢),要么是使用巧妙的数学技巧来平滑噪声。但最近,一种被称为“扩散模型”(diffusion model)的新型 AI 成为了将随机静电转化为美丽画面的明星。你可以把它想象成一位看过数十亿张照片的大师画家,他非常清楚阴影、闪亮的苹果或蓬松的云朵应该是什么样子。这篇论文提出了一个重大问题:我们能否教会这位大师画家去修复那些杂乱、多噪的计算机生成图像?作者们建议,通过给 AI 提供一份关于 3D 场景的额外信息“小抄”(例如墙壁在哪里或物体的颜色是什么),它或许能比以往任何方法都更好地清理噪声,创造出足以欺骗肉眼的真实图像。


论文的核心思想:教 AI 修复杂乱的 3D 艺术

研究人员(来自伊利诺伊大学的一个团队)决定使用一种特定类型的 AI——像素空间扩散模型(pixel-space diffusion model)来解决“渲染噪声”问题。你可以将扩散模型想象成一名侦探,他从一张完全混乱、充满噪声的图像开始,一步步地将其解开,直到出现清晰的图像。通常,这些侦探是在现实世界的照片上训练出来的,因此他们对真实图像有着非常强烈的“直觉”(或称为先验知识)。

该团队的主要发现是,我们可以利用这种“直觉”来修复充满噪声的计算机生成图像。然而,他们意识到仅仅向 AI 展示噪声图像是不够的,AI 需要一个向导。因此,他们构建了一个特殊的“控制模块”(类似于名为 ControlNet 的工具),向 AI 输入来自 3D 场景的额外线索。这些线索包括反照率(albedo,物体的真实颜色)、法线(normals,表面朝向的方向)以及深度(depth,物体有多远)。这就像是在侦探破案时,给了他一张地图和一份嫌疑人名单。

论文显示,这种方法效果极佳。当他们在使用极少光线(具体为每像素 4、16 和 64 条射线)渲染的图像上进行测试时,他们的 AI 比现有最先进的方法产生了更干净、更锐利的图像。事实上,在测试中,他们的法在所有指标上都表现出色:误差率(以 L1 指标衡量)最低,视觉质量得分(FoVVDP)最高。例如,在每像素 4 条射线的测试中,他们的方法达到了 39.13 的 PSNR(衡量图像质量的指标),击败了得分仅为 38.82 的次优竞争对手。

他们排除了哪些方案及其重要性

作者非常谨慎地排除了一些看似是好方案但实际上并不适用于此特定任务的流行想法。

首先,他们反对使用潜变量模型(latent variable models,如 Stable Diffusion 中使用的模型)。这类模型在处理之前会将图像压缩成一个更小的、隐藏的代码。论文证明,这种压缩对于修复 3D 渲染图来说是一场灾难。因为图像被压缩了,像锐利的阴影或清晰的纹理这样的微小细节会被模糊化或永久丢失。作者证明了即使你尝试将图像拉伸回原样,损害也已经造成。他们通过展示标准的潜变量模型如何将锐利的黑色区域变成模糊的色块,并导致颜色偏移,证明了这一点。因此,他们排除了“压缩”路径,坚持直接在全分辨率像素上进行操作。

其次,他们认为仅仅使用预训练的 AI 而不提供任何额外帮助是行不通的。当他们尝试在没有特殊“控制模块”的情况下使用基础 AI 模型(DeepFloyd Stage II)时,结果非常糟糕。AI 不知道如何遵循 3D 场景的物理规律,只会制造出随机且不真实的图案。这证明了额外的线索(渲染缓冲区)是绝对必要的;AI 不能仅仅靠猜测来获得好的结果。

“真实感”的魔力

他们发现中最令人兴奋的部分是图像的观感。虽然其他方法可能只是平滑了噪声,但它们往往会留下奇怪的伪影,比如“斑驳”的色块或断裂的线条。作者指出,由于他们的 AI 经过了数十亿张真实照片的训练,它知道一张“真实”的图像应该是什么感觉。

例如,如果阴影落在墙上,真实的阴影具有笔直、干净的边缘。论文指出,他们的法能始终产生这些笔直的边缘,而其他方法往往会让它们看起来模糊或斑驳。同样,如果茶杯上有闪亮的亮点,AI 知道它应该是锐利且干净的,而不是模糊的。作者还指出,他们的 AI 甚至通过简单地忽略掉那些看起来像火星一样的烦人单像素亮点(fireflies),从而处理了这些问题,因为这些亮点不属于真实的图像。AI 不需要被明确告知要移除它们;它只是知道它们不符合现实的图像。

权衡:速度 vs 质量

论文对成本保持了诚实。作者指出,该方法并不是一种瞬间完成的“一键式”修复。他们提到,该系统处理一张 256x256 的小图大约需要 2.8 秒,而在强大的 GPU 上处理一张高清大图则需要约 63 秒。这比目前的“快速”方法要慢得多,后者可以在不到一秒钟内完成。

然而,作者认为这种速度仍然是值得的。他们指出,渲染单帧高质量 3D 电影可能需要在超级计算机上花费数小时甚至数天。与等待数小时才能得到完美图像相比,等待一分钟来清理一个多噪图像是一个微不足道的代价。他们还建议,通过跳过 AI 的部分“思考步骤”(大约一半),可以在不损失太多质量的情况下加快速度,这在未来可以让它变得更快。

总结

简而言之,这篇论文表明,我们可以通过使用一个见过数十亿张真实照片的强大 AI 来修复杂乱、多噪的 3D 计算机图形,前提是我们要给它一张可以遵循的 3D 场景地图。其结果是更加真实的图像,拥有更锐利的阴影和更干净的亮点,在数学评分和人类感知方面都超越了目前最先进的方法。虽然运行起来比旧方法稍慢,但作者认为,对于任何想要在无需等待计算机完成漫长工作的情况下创造逼真 3D 世界的人来说,这种质量上的飞跃是一个颠覆性的进步。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →