FEA-SLT: A Gloss-Free End-to-End Framework for Facial-Expression-Aware Sign Language Translation
本文提出了一种无 gloss 的端到端框架 FEA-SLT,该框架利用面部动态作为语义锚点以消除人工歧义并提升翻译准确率,在 PHOENIX14T 和 CSL-Daily 数据集上实现了最先进的性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图将一场手语对话翻译成口语。在手语中,故事不仅仅由双手讲述,也由面部讲述。扬起眉毛可以将陈述句变为疑问句,而紧锁的眉头则能彻底改变一个词的含义。
长期以来,尝试翻译手语(手语翻译,简称 SLT)的计算机程序,就像那些只倾听双手却忽略面部的翻译者。它们非常擅长观察双手在做什么,但往往忽略了手语者感受如何,或者面部正在传达何种语法规则。这会导致错误,例如将“我很高兴”翻译成“我很生气”,因为手势动作看起来相似,但面部表情却不同。
本文介绍了一种名为FEA-SLT(面部表情感知手语翻译)的新系统,旨在解决这一问题。以下是其工作原理,使用简单的类比来说明:
1. 问题所在:“仅靠双手”的翻译器
将手语想象成一首由钢琴(双手)和歌手嗓音(面部)共同演奏的歌曲。
- 旧方法就像试图仅通过观察钢琴琴键来理解这首歌。它们能看到按下了哪些音符,却错过了情感、音量和演唱风格。
- 结果:如果两首不同的歌曲使用了相同的钢琴音符,但演唱风格不同,旧的翻译器就会感到困惑并选错歌曲。
2. 解决方案:“面部优先”的侦探
作者构建了 FEA-SLT,使其像一位既关注钢琴又关注歌手的侦探。
专用面部镜头:该系统不使用那种只能看到“一张脸”的通用摄像头,而是使用一种专门训练过的特殊镜头,用于捕捉微小的肌肉运动(如扬起的眉毛或紧绷的下颚)。它们借用了一种通常用于识别情绪(如“高兴”或“惊讶”)的工具,并将其重新用于理解语法。
- 类比:想象一位精通肢体语言的翻译专家。即使双手移动很快,这位专家也知道特定的挑眉意味着“这是一个问题”,而不仅仅是一个随机动作。
双向对话(融合):该系统并非单独观察双手和面部,而是迫使它们相互“交流”。
- 类比:想象一个双人舞组合。双手是领舞者,面部是舞伴。在 FEA-SLT 中,舞伴(面部)告诉领舞者(双手):“嘿,慢一点,这是一个悲伤的故事”,而领舞者告诉舞伴:“我移动得快,因为这是激动人心的部分。”它们不断相互调整以讲述正确的故事。这被称为“双向调制”。
3. 实际运作方式
该系统分三个步骤处理视频:
- 拆分视图:它将视频分为三个流:手的形状(空间)、手的运动(动作)以及面部表情。
- “面部检查”:它利用那个经过情绪训练的特殊镜头来提取面部细节。
- 混合:它使用一个“融合模块”将这三个流结合起来。该模块确保如果双手表示“走”,但面部看起来担忧,系统能理解这种担忧并正确翻译,而不仅仅是说“走”。
4. 结果
作者在两个主要的手语数据集(一个是德语,一个是中文)上测试了该系统。
- 得分:FEA-SLT 在“无词表”翻译(即直接从视频翻译为文本,无需人类先标注每一个手势)中取得了有史以来最高的分数。
- 证明:当在含义严重依赖面部表情的句子(如疑问句或情感陈述)上进行测试时,FEA-SLT 的表现远优于之前的模型。
- 示例:在一次测试中,一名手语者带着恐惧的表情说“我很害怕”。旧模型仅观察双手,将其翻译为“很安静”或“很黑暗”。而 FEA-SLT 正确翻译为“我很害怕”,因为它在眼中看到了恐惧。
总结
FEA-SLT 是一种教授计算机翻译手语的新方法,它终于教会了计算机阅读面部。通过将面部表情不仅仅视为背景装饰,而是视为必要的语法和含义,该系统能够更准确地理解手语,尤其是在仅靠手势动作存在歧义的情况下。
本文未声称的内容:
- 它并未声称目前适用于世界上所有的手语(仅在德语和中文上进行了测试)。
- 它并未声称能取代医疗或法律场景中的专业人工翻译。
- 它并未声称在光线昏暗或手语者遮挡面部时能完美工作(论文承认这些是当前的局限性)。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。