Frequency-Decomposed Avatar Representation for Varying Camera Distances
CloseUpAvatar 是一种新颖的关节化人体数字人表示方法,它利用纹理平面上经过频率分解的可学习纹理,能够根据摄像机距离自动调整渲染细节,从而在保持高帧率的同时,实现跨越广泛视角的高质量、逼真渲染效果。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,试图在一个数字世界中完美地捕捉一个人,让你能够走上前去,观察他们衬衫的纹理,或者退后一步观察他们在拥挤房间里的全身。多年来,计算机科学家一直致力于创造这些在任何距离下看起来都真实的“数字人”。问题在于一种权衡:当你在近处观察时看起来很清晰的方法,在退后观察时往往会变得模糊或出现故障;而那些在远处表现良好的方法,则会失去近距离观察所需的精细细节。这种局限性阻碍了虚拟现实、视频游戏和远程呈现的应用,在这些领域中,用户需要自然地与数字人互动,自由地移动而不会导致图像破碎。
解决这一问题的方案长期以来一直是一个被称为“细节水平”(level of detail)的概念,这是一种在计算机图形学中使用的技术,用于在物体远离时简化复杂对象,并在靠近时增加细节。然而,现有的创建动画人体化身的方法一直无法平滑地应用这一理念。它们要么依赖于缺乏纹理的刚性3D形状,要么使用数以千计的微小漂浮点,而在相机靠近时,这些点会变得杂乱且运行缓慢。一组研究人员现在开发了一种构建数字人的新方法,解决了这个距离问题,使得单一的高质量表示无论是在几英寸近处还是在房间另一头,看起来都非常真实。
研究人员利用来自高分辨率摄像机的数据,创建了一个名为 CloseUpAvatar 的系统。他们并没有尝试用坚实的网格或数百万个点组成的云来构建人体,而是将人体表现为一系列小的、扁平的、带有纹理的正方形。可以将这些正方形想象成覆盖在身体表面的微型、灵活的广告牌。每个广告牌都自带一张图片,并且可以随着人的移动而变化。创新的关键在于这些图片是如何存储的。团队意识到,单个图片文件无法在处理面部的宽泛色彩和皮肤毛孔的锐利细节时同时保持清晰而不产生混乱。
为了解决这个问题,他们为每一个广告牌都将视觉信息拆分为两个独立的层。一层保存低频细节,即定义人物整体外观的平滑、通用的颜色和形状;第二层保存高频细节,即像皱纹、毛孔和织物图案那样锐利、清晰的纹理。该系统被设计得非常聪明,能够决定何时使用哪一层。当相机远离时,系统仅显示平滑的低频层,这非常高效且在远处看起来很完美。当相机靠近时,系统会自动且逐渐地融入锐利的高频层。这种过渡非常平滑,以至于观众永远不会察觉到切换,图像只是随着距离的拉近而变得更加清晰,而不会出现突然的跳变或模糊。
研究人员使用一个包含从许多角度拍摄真实人物的大型数据集对这种方法进行了测试,其中包括允许模拟极端特写的超高清视频。他们将这种新方法与该领域现有的最佳技术进行了对比。结果显示,虽然其他方法在相机缩放时难以产生清晰图像,经常导致面部模糊或变形,但他们的新系统保持了照片级的写实质量。事实上,该方法能够以每秒超过 200 帧的速度渲染这些精细的化身,这足以满足实时交互在虚拟现实中的需求。这种速度是通过使用比以往方法更少的构建模块实现的,证明了拥有更少、更智能的部件比拥有数百万个简单的部件更有效。
其中一个最重要的发现是,系统可以在训练过程中学习处理这些变化的距离。研究人员通过向计算机展示同一个人在极近和极远距离下的影像来对其进行教学,而其他方法在面对这种情况时往往会失败或产生奇怪的伪影。通过使用他们的频率拆分法,系统学会了将通用形状与精细细节分离,从而使其能够根据相机的实时位置进行调整。这意味着用这种方法创建的数字人可以被环绕观察、近距离检查,并在远处观看时都不会出现图像质量下降的情况。
这项工作证明了创建一个既高效又极其精细的单一数字人是可能的。研究人员指出,虽然他们的系统在处理身体和通用特征方面非常有效,但在处理像手指或复杂的面部表情这类极细微的细节时仍面临挑战,这些仍是未来改进的领域。然而,对于创建逼真的交互式数字人的广泛任务而言,这种新方法提供了一个显著的飞跃。它消除了用户与数字世界之间的障碍,确保无论你离得有多近,屏幕上的人看起来都和远处一样真实。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。