← 最新论文
💻 computer science

Context-Aware Autoregressive Diffusion for Gloss-Wise Sign Language Production

本文提出了 GARD,一种上下文感知的自回归扩散模型,该模型通过结合语义与运动学约束对手势词进行个体合成,并利用词间转换引导和全局运动协调器来消除时间漂移并确保动作的无缝连续性,从而生成自然的句子级手语。

原作者: JungHoon Sung, Boeun Kim, Chu Xin, Hyung Jin Chang, ChangHo Kim, Sang-Il Choi, Younggeun Choi

发布于 2026-06-23
📖 1 分钟阅读☕ 轻松阅读

原作者: JungHoon Sung, Boeun Kim, Chu Xin, Hyung Jin Chang, ChangHo Kim, Sang-Il Choi, Younggeun Choi

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图仅通过手势(如美国手语)来教机器人说话。你的目标是让机器人的动作看起来自然、流畅且易于理解,而不是像一个僵硬、抽搐的木偶在做动作。

这篇论文介绍了一种名为 GARD(上下文感知词汇级自回归扩散模型,Context-aware Gloss-wise Autoregressive Diffusion)的新系统,旨在帮助机器人实现这一目标。以下是其工作原理的简单解释:

问题所在:“机器人木偶”效应

目前大多数方法都试图一次性生成整句手语。想象一下,试图在不抬起手的情况下,用一笔画完一整幅画。随着句子变长,机器人会逐渐迷失方向。它的手部可能会出现模糊、时机不对,或者忘记如何精准地形成特定的词汇。这就像汽车行驶在漫长的公路上;如果你不经常查看地图,最终就会偏离航线。

其他方法尝试通过拼接预录制的单个单词(称为“词汇/glosses”)片段来解决这个问题。但这就像是通过剪辑拼接不同的家庭录像来制作一部电影。两个片段之间的过渡往往看起来非常生硬——就像突然的跳剪一样——因为一个词的结尾并不能自然地流动到下一个词的开始。

解决方案:GARD 的“步步为营”法

GARD 改变了策略。它不再试图一次性完成整个句子,而是像一位大师级讲述者那样,逐个单词(逐个词汇/gloss by gloss)地构建手语,就像讲故事时一次讲一个句子。

为了让动作看起来更像人类,GARD 使用了三个主要的“超能力”:

1. “记忆与惯性”系统(上下文感知)

当人类做出“苹果”这个手势时,手的位置和速度取决于他们刚刚做出的前一个动作。如果刚才做的是“大”,手可能会在高处;如果刚才做的是“小”,手则会在低处。

  • 类比: 想象一位舞者。如果他们刚完成一个高跳,下一个动作自然会从空中开始;如果他们刚完成一个低蹲,则会从地面开始。
  • GARD 如何实现: 在生成下一个词之前,GARD 会观察两件事:
    • 语义上下文: 前一个词的“含义”是什么?
    • 运动学上下文: 前一个词结束时,手部和身体在“物理位置”上究竟在哪里?
      通过同时记住含义和物理位置,GARD 确保下一个词的起始点恰好衔接在上一个词的结束点。

2. “魔术扣/魔术贴”式衔接(词间过渡引导)

即使有了记忆,机器人有时仍难以完美地连接两个词。一个词的结尾可能与下一个词的开始在旋转角度上略有不同。

  • 类比: 想象将两个乐高积木扣在一起。如果你以错误的倾斜角度去压,它们不会卡住,只会发生碰撞。
  • GARD 如何实现: GARD 使用一种数学“磁铁”(称为基于梯度的引导),将新词的起始位置向后拉,使其完美地对齐旧词的结束位置。它强制机器人的手在开始移动新词之前,先“扣入”正确的起始姿态。

3. “流动的河流”(全局运动协调器)

修复起始点固然很好,但有时剩余的动作看起来仍然有些僵硬或抽搐。

  • 类比: 想象一条河流。你虽然固定了水坝处的水平(起始点),但下游的水流可能仍然波浪起伏。你需要一个机制来抚平整条河流的涟漪。
  • GARD 如何实现: 在固定了起始点之后,GARD 使用第二个辅助模块(协调器)来平滑整个单词的运动。它确保动作从那个完美的起始点自然地流动到结束,使整个手势看起来既有机又流畅。

实验结果

研究人员在两个大型手语数据集(一个德语,一个中文)上测试了 GARD。他们发现:

  • 表达更佳: GARD 生成的手势更准确地传达了意图(具有更高的“语言准确度”)。
  • 动作更优: 动作更加平滑,看起来更像真实的人类在做手势,并且拥有更好的手型和手指细节(具有更高的“运动相似度”)。

局限性

论文也指出了一项局限性:由于 GARD 是逐词构建句子,并使用了一种复杂的“扩散”过程(类似于将一张模糊的图像慢慢细化成清晰图像的过程),它目前比其他方法运行速度更慢。这就像一位大师级的画家,虽然能创作出精美的杰作,但需要很长时间才能完成,而不是像机器那样快速吐出一个模糊的草图。

总结: GARD 是计算机学习手语的一种新方式,它通过将每个单词视为一个独特的、相互连接的步骤,利用对过去的记忆和数学上的“扣合”技术,确保机器人的手部动作像人类一样自然。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →