Emotion Intensity Matters: Generating Realistic Expressions in Virtual Humans with CVAEs
本文提出了一种在真实人类面部表情小数据集上训练的条件变分自编码器(CVAE),旨在生成可控且逼真的虚拟人动画,在无需人工干预的情况下保持语义一致性并准确反映变化的情感强度。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在计算机图形学领域,创造一个真正具有生命感的角色是艺术家面临的最艰巨任务之一。虽然我们长期以来已经能够构建外观逼真的虚拟人类,但要让它们感觉真实,需要的不仅仅是一张好看的面孔,还需要微妙且不断变化的表情语言。几十年来,动画师一直依赖一种被称为“表演驱动动画”的方法,即通过摄像机捕捉真人演员的面部动作,并将其映射到数字角色上。这种方法效果很好,但它需要为每一种表情配备一名人类表演者,并且限制了在不重新开始的情况下创造变化的能力。一种更新的方法试图教计算机理解人类情感的规则,以便它们能够自主发明新的表情,而无需在摄像机前有演员。挑战在于,情感并非静态的;它们会随强度而变化,从一丝微弱的忧伤到一阵排山倒海般的悲恸。大多数计算机模型难以捕捉这种细微差别,往往生成的面部过于平滑或平庸,缺乏使情感显得可信的特定强度。
巴西里奥格兰德河畔保利斯塔天主教大学的研究人员开发出一种新方法来解决这个问题,旨在教计算机生成具有不同强度水平的逼真情感表达。他们专注于六种基本人类情感:快乐、愤怒、恐惧、悲伤、厌恶和惊讶。他们并没有要求计算机仅仅复制一段视频,而是训练了一个系统,让它从一系列真实的真人表演中学习这些情感的底层结构。团队收集了16个人(8男8女)表演这六种情绪(分为高、低两个强度等级)的视频片段。通过这些片段,他们提取了控制虚拟面部运动的具体数值,例如眉毛抬起的高度或嘴巴张开的宽度。这产生了一个包含7,680个特定表情瞬间的数据集,对于如此复杂的任务来说,这个数量相对较小,但研究人员利用它来训练他们的模型。
他们方法的核心是一种被称为“条件变分自编码器”的人工智能。简单来说,这个系统就像一个学生,通过学习一组示例,然后根据描述画出新的图画。计算机被赋予了面部数据,以及告知其正在展示哪种情绪、强度如何以及性别是男是女的标签。该系统学习将这些信息压缩成一个紧凑的内部表示,本质上是创建了一张关于每种情绪在不同强度下看起来是什么样的“心理地图”。当被要求生成一种新表情时,可以指令计算机创建一个“高强度的女性快乐脸”或“低强度的男性悲伤脸”,它就会生成一组符合这些指令的新面部动作。研究人员发现,该系统能够成功创建连贯的情感变化,但最初的结果存在一个此类技术常见的缺陷:表情过于平滑。计算机倾向于平均化细节,使得面部看起来平静且略显乏味,缺失了真实人类情感中的那种锐利峰值。
为了修复这种平滑效应,团队在流程中增加了第二步,作为一个精炼层。他们计算了最初的真实人类表情与第一个计算机模型生成的略显乏味的版本之间的差异。然后,他们训练了第二个专门的系统来学习这些差异的模式。第二个系统充当了一个修正工具,识别出第一个模型在何处失准,并补回缺失的能量与动态。当应用这种修正时,虚拟面部恢复了自然的活力。嘴部动作变得更加显著,情感的强度也回到了与原始人类表演高度匹配的水平。统计测试证实,经过修正后的表情在面部控制运动方面,与真实人类数据的相似度几乎翻倍,比初始的计算机生成版本更接近真人。
该研究还测量了一个独立的计算机程序识别这些新虚拟面部中情感的能力。在修正步骤之前,计算机有时难以识别某些情感,尤其是在面对恐惧或惊讶等复杂情感时。在精炼步骤之后,大多数情感的识别率显著提高,这表明添加的细节并非随机噪声,而是真实的情感线索。研究人员指出,该系统在低强度和高强度水平下均表现良好,证明它可以处理全方位的人类表达,而无需为每个新场景重新进行训练。虽然该系统仍需通过人类观察者的测试,以观察这些面部对真实观众而言是否自然,但结果表明,利用相对较小的现实世界数据集,创造出可控且富有表现力的虚拟角色是可能的。这种方法为创造能够表达全人类情感谱系的数字角色提供了一条路径,而无需持续依赖人类演员或人工艺术调整。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。