← 最新论文
💻 computer science

Realistic Lip Motion Generation Based on 3D Dynamic Viseme and Coarticulation Modeling for Human-Robot Interaction

该论文提出了一种基于 3D 动态音素和协同发音建模的唇部运动生成框架,通过构建符合 ARKit 标准的中文动态音素库并结合声韵母解耦与能量调制机制,成功实现了将高维语音运动高效映射至 14 自由度人形机器人唇部执行系统,显著提升了人机交互中唇同步的自然度与准确性。

原作者: Sheng Li, Jingcheng Huang, Min Li

发布于 2026-04-03
📖 1 分钟阅读☕ 轻松阅读

原作者: Sheng Li, Jingcheng Huang, Min Li

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 ✨ 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文主要解决了一个让人类机器人说话时看起来更“自然”的大难题:如何让机器人的嘴巴动作和它说的话完美同步,就像真人一样?

想象一下,如果机器人说话时嘴巴动得很僵硬,或者口型和声音对不上,你会觉得它很假,甚至有点吓人(这就是所谓的“恐怖谷”效应)。为了解决这个问题,作者团队开发了一套让机器人“学会说话”的新方法。

我们可以把这项技术拆解成三个有趣的步骤,用生活中的例子来解释:

1. 建立一本“动态动作字典” (3D 动态音素库)

以前的做法: 就像给机器人一本只有“静态照片”的字典。比如发"b"音,就给它一张嘴巴闭上的照片;发"a"音,就给它一张嘴巴张开的照片。机器人说话时,就在这些照片之间快速切换,结果就是嘴巴在“瞬移”,看起来一顿一顿的,很不自然。

这篇论文的做法: 作者们不再用静态照片,而是建立了一本**“动态动作视频库”**。

  • 怎么做到的? 他们让真人对着镜头说中文,用高科技设备(ARKit)记录下嘴巴肌肉从开始动、保持形状到放松的全过程(就像拍了一段慢动作视频)。
  • 中文特色: 中文发音很复杂,比如“瓜”(gua)这个音,嘴巴要从微张变成圆唇再张大。作者把中文的声母(如 b, p, m)和韵母(如 a, o, e)拆解,整理出了14 种核心的动态嘴型。
  • 比喻: 以前是“翻书看字”,现在是“播放动画”。机器人不再是生硬地切换姿势,而是像真人一样,嘴巴是滑过去的,有起承转合。

2. 学会“连读”和“抢跑” (协同发音建模)

问题: 真人说话时,嘴巴不会等上一个字完全说完才开始准备下一个字。比如你说“兔”(tu),在发"t"音的时候,嘴巴其实已经开始准备做"u"的圆唇动作了。这种“未雨绸缪”的现象叫协同发音。
以前的机器人不懂这个,导致字与字之间断断续续,或者该圆唇的时候没圆起来。

这篇论文的做法: 他们设计了一个聪明的**“融合算法”**。

  • 怎么做的? 把中文的“声母”和“韵母”拆开看,但让它们互相“渗透”。
  • 比喻: 想象你在开车换挡。以前的机器人是“踩死刹车 -> 挂挡 -> 再踩油门”,顿挫感很强。现在的算法像是**“自动挡”**,在还没完全松开油门(上一个音)的时候,就已经开始轻柔地挂入下一挡(下一个音)了。
  • 特别技巧: 他们还加入了一个“能量调节”机制。如果声音很大,嘴巴动作就夸张一点;声音很小,动作就收敛一点。这让机器人的表情有了轻重缓急,更像真人说话时的语气。

3. 把“大脑指令”翻译成“机械动作” (动作映射与校准)

挑战: 机器人的头只有 14 个电机(关节),但刚才那个“动态字典”里有 27 种面部肌肉参数。这就好比用 14 根手指去模仿 27 种复杂的表情,怎么映射?而且机器人的脸是硅胶做的,拉一下会回弹,不像真人肌肉那么听话。

这篇论文的做法: 他们设计了一套**“翻译官”系统**。

  • 怎么做到的? 先通过数学公式,把 27 种复杂的肌肉指令“压缩”成 14 个电机能听懂的指令。
  • 校准环节: 光靠数学公式不够,因为硅胶脸有弹性。作者们像调音师一样,先让机器人试着动,然后人工微调那些“权重系数”。
  • 比喻: 就像给机器人做**“康复训练”**。先让它按理论动作走,发现它嘴角拉不开,就手动把控制嘴角的电机力度调大一点。经过这种“人机配合”的校准,机器人终于能做出既符合物理规律,又看起来像真人的表情了。

实验结果:真的有用吗?

作者拿这个新方法和旧方法做了对比测试(比如读“一个大西瓜”这种绕口令):

  • 旧方法: 嘴巴动作像抽搐,抖动很厉害,看起来非常假。
  • 新方法: 嘴巴动作丝滑流畅,抖动极小。
  • 数据说话: 他们的算法生成的嘴型,和真人说话时的相似度(相关性)提高了近 40%,而且动作的平滑度几乎和真人一样好。

总结

简单来说,这篇论文就是给机器人装了一个**“中文口语大师”的大脑和“灵活肌肉”的控制系统**。
它不再死板地照搬规则,而是学会了:

  1. 看全过程(用动态视频代替静态照片);
  2. 懂连招(学会声母韵母的无缝衔接);
  3. 会微调(根据声音大小调整表情幅度,并适应机械结构)。

这让机器人说话时,不再是一个只会发声的机器,而是一个真正能和你进行眼神和表情交流的伙伴。这对于未来机器人进入家庭、医院或学校,与老人、孩子或听障人士交流,有着非常重要的意义。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →