← 最新论文
💻 computer science

DyaDiT: A Multi-Modal Diffusion Transformer for Socially Favorable Dyadic Gesture Generation

本文提出了 DyaDiT,一种基于多模态扩散变换器的框架,能够利用双人对讲音频及社交上下文信息生成自然且符合社交规范的双人交互手势,并在客观指标和用户偏好上均优于现有方法。

原作者: Yichen Peng, Jyun-Ting Song, Siyeol Jung, Ruofan Liu, Haiyang Liu, Xuangeng Chu, Ruicong Liu, Erwin Wu, Hideki Koike, Kris Kitani

发布于 2026-03-31
📖 1 分钟阅读☕ 轻松阅读

原作者: Yichen Peng, Jyun-Ting Song, Siyeol Jung, Ruofan Liu, Haiyang Liu, Xuangeng Chu, Ruicong Liu, Erwin Wu, Hideki Koike, Kris Kitani

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文介绍了一个名为 DyaDiT 的新技术,它的核心任务是让电脑生成的“数字人”在聊天时,能做出非常自然、符合社交礼仪的手势

想象一下,你正在和一个虚拟朋友视频聊天。如果对方只是嘴巴在动,身体却像根木头一样僵硬,你会觉得他很假。但如果他不仅能说话,还能根据你们的关系(是死党还是陌生人)、他的性格(是外向还是内向)以及你们聊天的氛围,自然地挥手、点头或做出反应,那感觉就会像真人在和你交流。

DyaDiT 就是为了让这种“像真人一样”的互动成为现实而诞生的。

以下是用通俗易懂的比喻来解释它的核心原理和亮点:

1. 它解决了什么痛点?(以前的“木头人”问题)

以前的技术就像是一个只会背台词的演员。你给它一段录音,它就机械地配上一套标准动作。

  • 问题一:不懂社交。 它不知道对方是“老板”还是“死党”,对老板和死党可能做出完全一样的手势,这很不自然。
  • 问题二:不懂“听”别人说话。 在双人对话中,两个人经常抢话、插嘴或者互相配合。以前的模型往往把两个人的声音混在一起,分不清谁在说话,导致生成的动作很混乱,比如你在听别人说话时,它却让你像演讲一样手舞足蹈。

2. DyaDiT 是怎么工作的?(三个核心“超能力”)

超能力一:给数字人装上“社交雷达” (Relationship & Personality Tokens)

DyaDiT 不仅仅听声音,它还会看“身份证”。

  • 比喻: 就像你走进一个房间,DyaDiT 会先问:“嘿,这位数字人,你是跟家人聊天,还是跟陌生人聊天?你的性格是开朗的还是内向的?”
  • 效果: 如果设定是“跟死党聊天”,它生成的动作就会很随意、夸张;如果设定是“跟陌生人”,动作就会比较拘谨、礼貌。这让数字人看起来更有“人情味”。

超能力二:神奇的“分音器” (ORCA 模块)

这是论文中最硬核的技术部分,叫 正交化交叉注意力 (ORCA)

  • 比喻: 想象两个人在嘈杂的酒吧里聊天,声音混在一起。以前的模型像个晕头转向的听众,分不清谁在说话。DyaDiT 则像是一个高明的调音师,它有一个特殊的“分音器”,能把“自己说话的声音”和“对方说话的声音”完美地分离开,甚至能听出谁在打断谁。
  • 效果: 即使两个人同时说话(抢话),DyaDiT 也能知道:“哦,现在是 A 在打断 B,所以 B 应该做出惊讶或停顿的手势,而不是继续滔滔不绝。”这让互动变得非常真实。

超能力三:动作“字典” (Motion Dictionary)

  • 比喻: 就像学画画的人有一个“色卡”或“笔触库”。DyaDiT 手里有一本动作字典,里面存着各种各样的“手势风格”(比如:热情型、冷静型、犹豫型)。
  • 效果: 在生成动作时,它可以从字典里挑选最合适的“笔触”,让动作不仅符合声音,还符合特定的风格,避免动作千篇一律。

3. 它是怎么“画”出动作的? (Diffusion Transformer)

  • 比喻: 想象你在一张画纸上先画满噪点(像电视雪花屏),然后 DyaDiT 像一位神奇的画家,一步步擦除噪点,根据刚才听到的声音和社交设定,慢慢“显影”出清晰、流畅的动作。
  • 这种技术(扩散模型)让它生成的动作非常细腻,不像以前那样僵硬。

4. 效果怎么样?(大家喜欢吗?)

研究人员找了一群真人来做测试(A/B 测试):

  • 对比对象: 拿 DyaDiT 和以前的顶尖技术(ConvoFusion)以及真实的真人录像做对比。
  • 结果: 令人惊讶的是,大多数人觉得 DyaDiT 生成的动作比以前的技术好得多,甚至觉得它比真实的真人录像还要自然和讨喜!
  • 人们觉得 DyaDiT 的动作更懂“眼色”,更符合社交场合,看起来更像是一个有血有肉的人在交流。

总结

DyaDiT 就像是一个懂社交礼仪、听力超群、且动作优雅的虚拟演员。它不再只是机械地对口型,而是真正理解了“我们在跟谁聊”、“聊得怎么样”以及“对方在说什么”,从而做出最得体、最自然的反应。

这项技术未来可以让虚拟助手、游戏 NPC 或者元宇宙里的数字人,真正走进我们的生活,让我们感觉它们不再是冷冰冰的代码,而是可以交心的朋友。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →