Speech-Gesture GAN: Gesture Generation for Robots and Embodied Agents
本文提出了一种语音 - 手势生成对抗网络框架,该框架利用条件生成对抗网络,通过从公开数据集中学习语音文本、音频特征与关节角度之间的关系,为具身智能体生成逼真的伴随语音的手势序列。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在教一个机器人与人类进行对话。你可以编程让机器人说话,但如果它说话时像雕像一样静止不动,对话就会显得尴尬且充满机械感。然而,人类在说话时会不断挥手、耸肩和指点。这些动作被称为手势,它们帮助我们表达情感、强调重点,并让言语听起来更自然。
本文介绍了一种为机器人(及虚拟角色)设计的新“大脑”,它能学习如何根据说话内容同步移动双手。以下是其工作原理的简明解释:
问题所在:说话时的“恐怖谷”
当机器人说话却不动时,会让人感到怪异;如果它随机挥手,又看起来像故障的游戏角色。我们的目标是让机器人的手部动作既匹配词语的含义(例如说到“二”时伸出两根手指),也匹配语音的节奏(例如说到短促有力的词时快速挥动手掌)。
解决方案:“模仿游戏”(生成对抗网络 GAN)
研究人员构建了一个基于**生成对抗网络(GAN)**概念的系统。你可以将其想象成两名学生之间的游戏:
- 伪造者(生成器):这部分人工智能根据机器人所说的话,尝试生成虚假的手部动作。它试图“欺骗”老师,使其相信这些是真实的人类动作。
- 侦探(判别器):这部分人工智能观察这些动作,并试图判断:“这是真实的人类手势,还是机器人凭空捏造的?”
它们反复进行这场游戏。伪造者越来越擅长生成逼真的动作,而侦探也越来越擅长识破赝品。最终,伪造者变得如此出色,以至于生成的动作与真实人类动作几乎无法区分。
秘诀:听与读
大多数以往的机器人只听取语音的声音,或只阅读文本。而本文中的机器人两者兼顾,这就像一位音乐家同时阅读乐谱并聆听指挥家的指挥棒。
- 声音(音频):机器人通过聆听语音的音高和节奏,知道何时移动。
- 含义(文本):机器人通过阅读词语,知道如何移动(例如,如果词语是“大”,双手可能会向两侧展开)。
通过结合两者,机器人能够创造出既符合语音节奏、又契合故事实际含义的手势。
训练营
为了训练这个机器人,研究人员使用了一个名为Trinity 数据集的特殊数据集。想象一位专业演员站在一个装有 20 台高速摄像头的房间里。他连续数小时谈论电影、爱好和日常生活,同时自然地挥动手臂。这些摄像头记录了他身体每个关节的角度。
- 研究人员将这些数据输入到他们的人工智能系统中。
- 他们剔除了腿部和手指的数据(因为许多机器人,如流行的 NAO 或 Pepper,并不具备像人类那样复杂的手指或腿部动作)。
- 他们专注于脊柱、颈部、肩膀和手臂。
效果如何?
研究人员通过两种方式测试了他们的机器人:
- 数学测试(客观):他们将机器人手部动作的流畅度和速度与真实人类演员进行了测量比较。与其他对比机器人相比,该机器人的动作更接近真实人类。
- 人类测试(主观):他们向真实人类展示机器人移动的视频,并询问:“这看起来自然吗?它与语音匹配吗?”
- 结果:人们无法分辨出差异!在统计上,该机器人的手势与真实人类演员的手势一样自然、时机恰当且富有意义。
核心结论
本文证明,通过利用“伪造者对决侦探”的游戏机制,并教导机器人同时倾听语音的声音与含义,我们可以创造出不仅会说话,而且能以类人肢体语言真正交流的机器人。这是迈向让数字和机器人朋友不再像机器、而更像自然对话伙伴的重要一步。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。