Toward Signing Activity Projection in Sign Language Interaction
本文通过使用 Public DGS 语料库研究了语音活动投影(VAP)向手语交互的迁移,发现虽然基于手势提示的模型在预测手语延续方面展现出潜力,但准确的轮次转换预测仍然具有挑战性,并且需要超越语音衍生类别的手语特定事件定义。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
把社交机器人想象成一位新的舞伴。在正常的对话中,人们轮流说话。如果你停止了说话,你的搭档就会知道何时介入或何时等待。计算机现在已经非常擅长预测这种说话时的“舞蹈”,使用的是一种被称为**语音活动预测(Voice Activity Projection, VAP)**的系统。这就像是一个雷达,倾听着沉默,并猜测:“这个人是准备再次说话,还是轮到我了?”
但如果这场“舞蹈”不是通过语言表达,而是通过手语呢?
这篇论文是首次尝试教机器人使用同样的“雷达”技术来预测手语中的轮流对话,只不过它不是在听声音,而是在看视频。
核心挑战:用眼睛“聆听”
在口语中,机器人通过听声音来获取信息。在手语中,没有可以听到的声音。其“声音”是手的动作、眼神的注视以及嘴型的变化。
研究人员想看看他们是否可以简单地将机器人的“耳朵”换成“眼睛”。他们采用了一个为语音设计的系统,并尝试将其应用于来自公共数据库(Public DGS Corpus)的手语数据。
他们是如何进行实验的
由于机器人无法真正“听见”手语,研究人员必须创建一个简化版的游戏:
- “开关”机制: 他们并没有试图理解复杂的句子,而是将视频变成了一个简单的“开/关”灯。如果一个人正在做手势,灯就是**亮(ON)的;如果他们保持静止,灯就是灭(OFF)**的。
- 两个问题: 他们向机器人提出了两个关于未来的特定问题:
- 问题 A(“谁是下一个?”测试): 在双方都处于沉默的状态后,谁会再次开始?是同一个人(保持/HOLD),还是轮到了另一个人(转换/SHIFT)?
- 问题 B(“他们结束了吗?”测试): 如果某人正在做手势,他们是否很快就要停止并把话语权交给另一个人?
工具:机器人观察了什么?
机器人不仅仅是在观看整个视频,它还专注于特定的身体部位,就像侦探寻找线索一样:
- 手部: 手语中的主角。
- 眼睛: 人看向哪里。
- 嘴部: 嘴型的形状(这通常有助于辅助理解手语)。
他们利用这些视觉线索来训练机器人,以预测未来的“开/关”灯状态。
实验结果:喜忧参半
研究结果有点像一个擅长一门学科但另一门不及格的学生:
- 好消息(“谁是下一个?”测试): 机器人实际上非常擅长猜测在沉默之后谁会开始说话,尤其是当它观察手部时。事实证明,手部动作是了解谁掌握着手语对话“话语权”的一个非常强力的线索。
- 坏消息(“他们结束了吗?”测试): 机器人很难猜出一个人是否即将停止并交出轮次。即使机器人观察了眼睛或嘴部,它也无法可靠地预测轮次结束的确切时刻。
为什么会这么难?
作者解释说,他们教给机器人的“规则”是从口语中借用的,而这些规则可能并不完全适用于手语。
- 错误的地图: 他们使用了一张为“声音”设计的地图来导航“手势”。在手语中,一个轮次的结束不仅仅是停止发声,还涉及复杂的视觉线索,比如保持某个姿势、看向对方或特定的手型,而简单的“开/关”灯并不能很好地捕捉到这些细节。
- 缺失的细节: 机器人观察的是身体的 2D 骨架轮廓(关键点)。它忽略了手部动作的深度以及对于判断轮次何时真正结束至关重要的细微面部表情。
总结
这篇论文是一个“概念验证”。它表明:
- 我们可以尝试使用与语音预测相同的技术来进行手语预测。
- 手部动作是了解谁在说话的一个强大线索。
- 然而,仅仅复制语音的规则并不能完美运作。为了让机器人真正擅长手语对话,我们需要发明专门针对手语的新规则和定义,而不是仅仅把语音规则强加于它。
简而言之,机器人正在学习跳舞,但它仍然在手语舞蹈的特定舞步上绊倒了,因为它正试图用一张为另一种舞蹈设计的地图来学习这种舞蹈。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。