← 最新论文
💻 computer science

HolisticSemGes: Semantic Grounding of Holistic Co-Speech Gesture Generation with Contrastive Flow-Matching

本文提出了一种名为 HolisticSemGes 的基于对比流匹配的共说话手势生成模型,通过将不匹配的音频 - 文本条件作为负样本并构建复合潜在空间,有效解决了现有方法在语义泛化、稀疏手势生成及跨模态一致性方面的局限,在 BEAT2 和 SHOW 数据集上取得了优于最先进方法的表现。

原作者: Lanmiao Liu, Esam Ghaleb, Aslı Özyürek, Zerrin Yumak

发布于 2026-03-30
📖 1 分钟阅读☕ 轻松阅读

原作者: Lanmiao Liu, Esam Ghaleb, Aslı Özyürek, Zerrin Yumak

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文介绍了一种名为 HolisticSemGes 的新方法,它的目标是让电脑生成的“说话手势”变得更加自然、聪明,并且真正符合说话的内容。

为了让你更容易理解,我们可以把这项技术想象成教一个机器人演员如何“演”好一场戏

1. 以前的“演员”有什么问题?

在 HolisticSemGes 出现之前,现有的技术就像是一个只会打拍子的机械舞者

  • 只会动节奏,不懂意思:以前的模型听到说话有节奏(比如重音),就会挥手。但这就像一个人不管说什么话,都只是机械地跟着节拍点头或摆手。它分不清什么时候该用“大拇指点赞”(表示同意),什么时候该用“双手摊开”(表示无奈)。它生成的动作虽然流畅,但缺乏灵魂,无法传达具体的含义(比如“比喻”或“象征”)。
  • 身体各部位“各玩各的”:以前的模型是把手、头、身体分开训练的。结果就是,手可能在比划“大”,头却在看别处,或者脸上一脸茫然。这就好比一个乐队,鼓手、吉他手和主唱各吹各的调,完全没有配合,看起来很奇怪。
  • 只学“好”的,没学“坏”的:以前的训练就像只给学生看“正确答案”,没告诉学生“错误答案”长什么样。所以模型不知道哪些动作是不该做的,导致它生成的动作虽然看起来像那么回事,但往往只是通用的、平庸的动作。

2. HolisticSemGes 是怎么做的?(核心魔法)

这篇论文提出了两个核心“魔法”来解决上述问题:

魔法一:全身体“统一战线” (SACM 模块)

  • 比喻:想象一下,以前的模型是三个独立的实习生(一个管手,一个管头,一个管身体),他们互不沟通。而 HolisticSemGes 给它们开了一次全员大会
  • 做法:它把文字(剧本)、声音(语调)和全身的动作(表演)全部扔进同一个“大脑”里。它强迫手、脸和身体必须作为一个整体来理解这句话的意思。
  • 效果:当说到“我”的时候,手会自然地指自己,头也会微微转向自己,整个身体都在表达同一个意思,而不是各做各的。

魔法二:对比学习“排雷” (Contrastive Flow Matching)

  • 比喻:这是最精彩的部分。以前的训练就像老师只给学生看“正确的路”。而 HolisticSemGes 的老师不仅带学生走正确的路,还故意把学生带到错误的路上,然后大声说:“停!这条路是错的,别往这边走!”
  • 做法
    • 正例:给模型看“这句话 + 这个手势”(比如:说“大”的时候张开双臂)。
    • 负例(排雷):故意给模型看“这句话 + 错误的手势”(比如:说“大”的时候却握紧拳头,或者把这句话配给另一个人的手势)。
    • 训练过程:模型被训练成要紧紧抓住正确的路径,同时拼命推开那些错误的路径。
  • 效果:这让模型学会了“避坑”。它不仅能生成动作,还能确保生成的动作绝对不是那些语义不通的动作。这让手势变得非常精准,充满了“语义感”。

3. 结果怎么样?

研究人员在两个大型数据集上测试了这个模型,结果非常棒:

  • 更真实:生成的动作看起来不像机器人,更像真人在说话。
  • 更同步:手势和说话的节奏、重音配合得天衣无缝。
  • 更多样:它不再只会做那几种通用的动作,而是能根据语境做出丰富多变的表达(比如比喻、强调、否定等)。
  • 用户反馈:在真人测试中,大家觉得这个模型生成的动作最自然,最像真人,而且能准确传达说话人的意图。

总结

简单来说,HolisticSemGes 就是给 AI 装上了一个懂戏的导演大脑。它不仅知道什么时候该动(节奏),更知道为什么要这么动(语义),并且确保全身上下配合默契,不再让手、脚、脸“各唱各的戏”。它通过“教 AI 识别错误动作”的方法,让 AI 学会了如何像一个真正的沟通者那样,用肢体语言辅助说话。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →