← 最新论文
💻 computer science

Scanline-Aware Animatable Gaussian Avatars from Rolling-Shutter Videos

本文介绍了 RS-Avatar,这是一种通过将标准运动模糊渲染替换为能够正确处理单帧内不同身体部位顺序读取过程的扫描线感知复合算子,从而从卷帘快门视频中重建清晰且可驱动的 3D 高斯化身的方法。

原作者: Youxiang Wang

发布于 2026-08-19
📖 1 分钟阅读☕ 轻松阅读

原作者: Youxiang Wang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在数字成像领域,存在着一个无声的假设,即每一张照片都捕捉了一个单一且冻结的时间瞬间。当相机拍摄照片时,人们普遍认为整个场景——从人的头顶到脚尖——都是在完全相同的瞬间被记录下来的。这种信念构成了现代计算机视觉的基础,该领域致力于教会机器如何观察和理解世界。它让研究人员能够构建复杂的个人三维模型(即数字人或化身),这些模型可以被动画化并从任何角度进行观看。这些数字双胞胎正变得至关重要,应用范围涵盖了从虚拟远程呈现、电影制作到体育分析及人工智能的各个领域。然而,这种假设在现实世界中几乎从未成立。绝大多数相机,从我们口袋里的智能手机到专业工作室中的高速传感器,都不会同时捕捉整幅图像。相反,它们是以极短的时间内逐行、自上而下地扫描图像。这种被称为“滚动快门”(rolling shutter)的方法意味着,当相机完成读取帧底部的像素时,帧顶部已经被记录在几毫秒之前了。对于正在挥动手臂或行走的人来说,这几毫秒的时间足以让身体发生显著的位置偏移,从而产生一种微妙但普遍存在的畸变,使得身体的不同部分是在不同时间被捕捉到的。

多年来,试图通过视频构建这些三维数字人的研究人员在很大程度上忽略了这种时间上的不匹配,将每一帧都视为完美的快照。其结果就是一个“数字幽灵”:这种三维模型在从原始视频的拍摄角度观看时看起来是正确的,但当观众尝试从新角度观察或将数字人移动到新姿势时,模型就会崩溃。这种畸变被固化到了模型的形状中,导致肢体看起来摇晃、扭曲或异常肥厚。现在,一位研究人员直接针对这一问题提出了解决方案,他并非试图在构建模型之前修复视频,而是教会模型本身如何理解相机的扫描行为。他开发了一种新系统,可以直接从滚动快门视频中重建清晰、无畸变的三维数字人,该系统承认图像中的每一行像素都代表了一个略微不同的时刻。

这位研究人员称之为 RS-Avatar 的新方法的核心,依赖于一种简单而强大的视角转变。该系统不再要求计算机去猜测一个人在单一时刻的样子,而是接受了人在整个扫描过程中一直在运动的事实。该软件构建了一个精确的身体运动模型,足以知道在任何给定的微小时间片段内,身体的每个部位处于什么位置。当它创建最终图像时,它并不会将不同的位置进行平均处理(因为平均处理会导致模糊),而是像一位细心的编辑一样,为图像顶部的每一行像素选择精确的身体位置,为下一行像素选择稍有不同的位置,依此类同,以匹配相机捕捉每一行时的特定时间。这个过程与运动模糊(motion blur)的工作原理截然不同;运动模糊像是将运动物体的所有颜色混合成一个单一的涂抹痕迹,而滚动快门更像是对时间的精确切割,每一片切片都包含了身体在特定瞬间的清晰、锐利的图像。

为了测试他们的想法,研究人员利用来自标准动作捕捉工作室的数据创建了一个新的基准。他们采集了高质量的人物运动录像,并人工模拟了滚动快门效应,从而创建了一个已知“真实且清晰答案”的数据集。随后,他们将这种新方法与几种现有方法进行了对比。一种常见的策略是先尝试“修复”视频,即使用软件在构建三维模型之前将扭曲的线条拉直。另一种策略是使用专为运动模糊设计的模型,该模型假设相机在运动过程中进行了时间上的平均处理。结果清晰且令人惊讶。那种尝试先修复视频的方法虽然略微改善了图像质量,但生成的模型仍然存在缺陷,因为修复软件无法保证不同的相机角度在三维空间中能够达成一致。而运动模糊模型的效果甚至更差,其产生的质量甚至低于完全忽略快门问题的情况。这是因为处理模糊的数学逻辑与处理滚动快门的数学逻辑有着本质的区别:模糊模型试图猜测运动的方向,而滚动快门通过扫描行的顺序已经提供了这种方向。

这个直接对快门进行建模的新系统表现优于所有其他方法。它生成的数字人明显更加清晰和准确,保留了诸如手臂的锥度以及手与臀部之间的间隙等精细细节,而其他方法则会将这些细节平滑掉或使其变形。研究人员发现,他们并不需要让时间切片变得更细或更多来获得更好的结果;现有的运动模型已经足够详细,足以捕捉单帧内的运动。关键在于如何改变计算机将身体运动的不同时刻组合成最终图像的方式。通过将相机的扫描视为一系列事件的日程表而非单一的快照,该系统可以重建出一个干净、无畸变的三维身体,使其可以进行动画处理并从任何角度观看,而不会出现困扰以往尝试的摇晃或扭曲现象。

这项工作表明,相机捕捉图像的方式不仅仅是一个稍后需要修正的技术细节,更是视觉物理学的一个基本组成部分。通过将相机的行为直接整合进三维重建过程中,研究人员展示了从不完美的视频中恢复出清晰、准确的运动人体数字表示是可能的。研究结果表明,用于修复某种图像畸变(如模糊)的工具不能简单地替换为修复另一种畸变(如滚动快门)的工具,因为误差的性质是不同的。虽然目前的系统在多摄像头和良好光照条件下表现最佳,且依赖于身体关节的数学模型,但它为从我们周围随处可见的日常视频中创建逼真的数字人类开辟了一条新路径。研究人员留下了一个悬念:这种对时间的密集采样是否最终可以被用于创造比相机捕捉速度更快的视频,但就目前而言,这一成就已经为呈现运动的人类形态提供了更清晰、更真实的画面。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →