DuoGesture: Neuro-Inspired and Biomechanically Informed Dual-Stream Co-Speech Gesture Generation
本文介绍了 DuoGesture,这是一种受神经科学启发的双流框架,通过解耦语义与节拍运动、利用随机门控进行协调、采用基于运动的语义条件以增强词汇对齐,并引入惯性先验以确保符合生物力学的节奏一致性,从而提升伴随语音的手势生成效果。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在观看一个人讲故事。有时,他们用手来配合声音的节奏,就像指挥家随着歌曲的节拍轻敲指挥棒。而另一些时候,他们用手在空中描绘画面,精准地展示他们所说的话语究竟意味着什么。
长期以来,试图让数字虚拟人做到这一点的计算机一直面临困难。它们往往试图将这两种不同类型的手部动作混合成一大锅混乱的“杂烩”。结果呢?虚拟人的手要么移动得过于机械,要么显得不知所措,要么只是毫无自然地抖动。
这篇论文介绍了DuoGesture,一种教导计算机在说话时如何移动双手的新方法。你可以把它想象成给计算机的大脑配备了两位独立的“乐手”,他们协同工作,却演奏着不同的乐器。
两位乐手(双流方法)
DuoGesture 没有让一个大脑试图包揽所有工作,而是将任务拆分为两个独立的流:
- 节奏流(鼓手): 这一部分负责处理与语音韵律(prosody)相匹配的节奏性、弹跳性动作。它就像一位打拍子的鼓手。它的任务是确保手部动作流畅,并与声音的节奏同步,而不受具体词语含义的干扰。
- 语义流(画家): 这一部分负责处理与具体词语相匹配的有意义手势(例如指向某物或用手指比划圆圈)。它就像一位试图通过绘画来讲述故事的画家。它专注于词语的具体含义,即使这些词语生僻或独特。
指挥家(随机门控)
这两位乐手如何知道何时演奏、何时停止?他们拥有一位名为**语义变分信息瓶颈(S-VIB)**的指挥家。
想象一下十字路口的红绿灯:
- 当说话者只是在有节奏地交谈时,绿灯对鼓手(节奏流)亮起。“画家”保持安静。
- 当说话者说出一个需要特定手形的词(如“大”或“这里”)时,绿灯对画家(语义流)亮起。“鼓手”则退居幕后。
论文指出,这盏交通灯并非僵化的;它具有一定的“随机性”(概率性)。这一点至关重要,因为它防止系统陷入总是选择其中一种而忽略另一种的死循环。它允许一种自然的、类人的混合状态,即两条流可以重叠或快速切换,就像真实人类所做的那样。
特殊工具
作者添加了三种特殊的“工具”,使该系统比以往的尝试表现更佳:
- 动作词典(MGSC): 旧式计算机试图使用标准词典(如 BERT)来理解单词。但像“杂耍”这样的词,在词典中是一个意思,在现实生活中却对应着非常具体的动作。DuoGesture 使用了一种基于人们运动视频训练而成的“动作词典”。这有助于计算机理解,单词“杂耍”应触发特定的手部动作,即使计算机从未见过该确切单词。
- 平滑规则(IBP): 有时,“鼓手”(节奏流)会变得过于抖动,导致手部不自然地颤动。作者添加了一条基于人体解剖学(我们手臂骨骼的重量)的“平滑规则”。这就像减震器一样,确保节奏性动作流畅且沉稳,如同真实的人类手臂,同时不会让“画家”(语义流)变得僵硬。
- 交通灯(S-VIB): 如前所述,它决定在任意毫秒内由哪条流来“驾驶”这辆车。
结果
研究人员在名为BEAT2的数据集上测试了该系统,该数据集包含数小时真实人类说话和移动的记录。他们将 DuoGesture 与许多其他顶级计算机模型进行了比较。
- 得分: DuoGesture 在“真实感”(动作看起来像真实人类的程度)方面得分最高。
- 感受: 在一项让真实人类观看视频的测试中,他们评价 DuoGesture 比其他模型更自然,且与语音的契合度更好。
- 平衡: 虽然其他某些模型在单一方面表现更好(例如多样性极佳或完美契合节拍),但 DuoGesture 找到了最佳平衡点。它没有为了节奏准确而牺牲词语的含义,也没有为了表达含义而让节奏变得生硬。
总结
DuoGesture 就像一位聪明的导演,深知说话者的双手有两项任务:保持节拍和讲述故事。它没有强迫双手在一套规则下同时完成这两项工作,而是聘请了两位专家,并配备了一位聪明的指挥家来在他们之间进行切换。其结果是,数字虚拟人的手部动作呈现出一种令人惊讶的类人感、节奏感和表现力。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。