← 最新论文
💻 computer science

WildShadowRemover: In-the-Wild Video Shadow Removal via Detail-Preserving Video Diffusion Models

本文介绍了 WildShadowRemover,这是一个利用经过 LoRA 微调的视频扩散模型,并结合细节注入、频率分解调制模块以及深度先验,从而在复杂的现实场景中实现鲁棒且高质量视频阴影去除的框架,同时该框架得到了新构建的大规模 WildShadow 数据集的支持。

原作者: Jiamin Xu, Cong Wang, Zheng Dong, Chi Wang, Renshu Gu, Weiwei Xu, Gang Xu

发布于 2026-07-30
📖 1 分钟阅读☕ 轻松阅读

原作者: Jiamin Xu, Cong Wang, Zheng Dong, Chi Wang, Renshu Gu, Weiwei Xu, Gang Xu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正透过一扇窗户欣赏着一个阳光明媚的美丽晴天,但有人把一桶黑色的泥水泼在了玻璃上。窗外的世界依然存在,生机勃勃且充满活力,但泥水扭曲了一切,让你难以看清细节或欣赏美景。在计算机视觉领域——即教计算机如何“看”并理解图像的科学中——阴影就像是那滩泼洒的泥水。它们是光线作用的自然现象,但会干扰重要的任务,比如帮助自动驾驶汽车识别行人,或者帮助视频编辑清理场景。长期以来,计算机在处理单张静态照片(就像擦拭一块被弄脏的窗户玻璃)方面已经做得相当出色了。但当涉及到动态图像,也就是视频时,情况就完全不同了。视频就像是一连串流动的、成百上千块窗户玻璃;如果你在处理每一块时都不考虑整体的流动性,仅仅是一块接一块地清洗,结果看起来就会闪烁跳动、破碎不堪,就像一个闪烁不定的灯泡。最大的挑战在于,如何如何在不让画面产生涂抹感或让场景看起来像个故障动画的情况下,洗掉整个视频流中的“阴影泥水”。

这正是名为 WildShadowRemover 的新工具发挥作用的地方,它扮演着一个超级聪明、具备“穿越时空”能力的视频清洁工。这项研究背后的研究人员意识到,要清理“野外”(即指繁忙街道或森林等杂乱的真实世界场景)中的阴影,你需要的不仅仅是一把刷子;你还需要对物体如何移动以及光线如何随时间变化的深度理解。他们在一种“视频扩散模型”之上构建了这个系统,这种模型是一种已经通过学习数百万小时的视频素材,学会了如何从零开始生成视频的人工智能。你可以把这个 AI 想象成一位大师级的画家,他见过世界上各种各样的阴影和各种各样的物体。研究人员并没有教这位 AI 从头开始绘画,而是使用了一个巧妙的技巧,叫做“LoRA 微调”。想象一下,这就像是给这位大师级画家穿上了一件专门的、轻便的围裙,教他专门如何去除阴影,同时又不会忘记如何绘制画面的其余部分。

然而,研究人员注意到,虽然这位 AI 画家擅长去除那些巨大的黑色色块,但它有时会忘记微小的细节,比如砖墙的纹理或衬衫上的图案,这会让视频看起来有些模糊。为了解决这个问题,他们添加了一个“细节注入模块”。你可以把这想象成一个高科技放大镜,它观察原始的有阴影视频,捕捉出清晰锐利的细节,然后小心翼翼地将它们粘贴回清理后的版本上。但这里有一个陷阱:如果你只是把旧的细节贴回去,你也可能会不小心把阴影也贴回去!因此,团队发明了一个“阴影掩模引导的频率分解调制”系统。这个名字听起来很绕口,但你可以把它想象成一个智能过滤器,它将图像分为两堆:“平滑的低频”部分(比如树木的大致轮廓)和“粗糙的高频”部分(比如树叶)。该系统利用一张显示阴影位置的地图来发出指令:“保留那些粗糙的树叶,但扔掉那些粗糙的阴影。”

为了确保即使在光照异常或相机移动时视频看起来依然正确,该系统还使用了来自工具 Depth Anything 3 的“深度图”。这就像是给了 AI 一把 3D 尺子,让它理解物体的远近关系,这样它就知道地上的影子与墙上的影子是不同的。研究人员不仅开发了这个工具,还为它建立了一个庞大的训练场,名为 WildShadow。由于现实世界中很难找到完美的“处理前”与“处理后”成对的视频,他们利用 3D 计算机图形技术创建了一个包含 6,100 个合成视频片段(其中 4,500 个用于训练,600 个用于测试)的巨大库。这些片段涵盖了从室内房间到城市街道再到自然景观的所有内容,确保 AI 能够学习处理各种复杂的现实世界场景。

结果表明,这种新方法非常有效。在测试时,WildShadowRemover 不仅去除了阴影,还保持了视频的平滑度和一致性,使得清理后的场景不会出现闪烁或跳动。它成功保留了其他方法经常丢失的精细细节,生成的视频看起来自然且清晰。作者发现,通过将预训练视频 AI 强大的“想象力”与这些专注于细节的特定工具相结合,他们可以比以往的方法更好地处理复杂且不可预测的光照条件。虽然该论文侧重于使用合成数据进行训练和测试,但结果表明,这种方法可以显著改善计算机处理现实世界阴影的能力,使视频变得更干净,并能更好地服务于从娱乐到安全系统等各种用途。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →