SemPix3D: Hybrid approach to generalized 3D aware image Synthesis and Generation using Conditional GAN
SemPix3D 提出了一种结合了用于 3D 感知标签图生成的神经辐射场与基于 StyleGAN 的生成器的混合框架,用以合成高质量且一致的多视图 RGB 图像,在多样性和 FID 分数方面较现有方法取得了显著提升。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图为一款视频游戏或虚拟现实体验构建一个虚拟世界。你希望能够从任何角度展示一个角色或物体,而不仅仅是正面。长期以来,计算机就像是平面的画家;它们可以拍下一张脸并将其变成卡通画,但它们并不真正理解这张脸具有深度,或者有凸出的鼻子、侧边的耳朵。如果你尝试将图片转向侧面,计算机只会拉伸图像,让脸部看起来像个融化的煎饼。为了解决这个问题,科学家们正在研究“具备3D感知能力”的生成技术。这是在教计算机理解物体存在于三维空间中,具有体积和结构,从而能够创建看起来真实且保持一致的新视角。它们使用的工具就像是数字粘土(NeRF,通过光影构建3D形状)和数字艺术家(GAN,在这些形状上绘制逼真的纹理)。大问题在于:我们如何让这个过程更快、更准确,并且能够处理不同类型的物体,而不需要为我们想要创建的每一件东西都准备一个庞大的照片库?
这就是一项名为“SemPix3D”的新研究发挥作用的地方。研究人员 Souvik Bandyopadhyay 和 Tamal Pal 提出了一种聪明的“混合”方法,结合了两种不同的技术,以解决仅凭少量线索生成3D图像的问题。你可以将他们的方法想象成一个两步走的流水线。首先,他们使用一个称为神经辐射场(NeRF)的系统来充当“骨架构建者”。这个系统的部分并不关心颜色或肤色;相反,它学习物体的纯粹形状和结构,就像一个人体模型。它通过几张照片,弄清楚边缘在哪里,鼻子在哪里,以及眼睛凹陷有多深,从而创建一个物体的3D形态图。
一旦这个“骨架”构建完成,机器的第二部分就会介入:生成对抗网络(GAN)。如果说 NeRF 是骨架,那么 GAN 就是化妆师和服装设计师。它获取第一步创建的形状图,并在其上绘制出逼真、高质量的彩色图像。这里的魔力在于,这个 GAN 是“条件性”的,这意味着它只绘制符合其所接收到的形状的内容。这使得系统即使在从未见过该特定角度的情况下,也能从新角度生成写实的图像,比如一张脸或一把椅子。研究人员在两种截然不同的事物上测试了它:合成3D形状(如计算机生成的椅子和汽车)以及来自大型数据集 CelebMaskHQ 的人脸。
结果表明,这个两步协作的团队比那些试图一次性完成所有工作的现有方法效果更好。在模拟中,SemPix3D 模型在生成图像的多样性和逼真度方面表现出了提升。具体而言,在合成形状数据集上,与 Pix2Pix3D 方法相比,它在名为 FID 的质量评分上提升了 15%,在另一项评分 KID 上提升了 5%。当他们在人脸数据集上进行测试时,该模型的图像多样性提升了约 10%,KID 评分提升了 2%。作者发现,通过将“理解形状”的任务与“绘制颜色”的任务分离,他们可以以更少的训练周期创建更一致、更准确的3D视图。他们还指出,这种方法减少了对每种物体大量数据的需求,因为“骨架”部分学习的是一类物体的通用形状(例如“所有人脸”),而“画家”只需添加具体的细节。虽然论文并未声称这是一个已经解决的科学难题,但模拟结果表明,这种混合策略是朝着让虚拟现实和增强现实体验看起来更加真实、更加沉浸式迈出的极具前景的一步。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。