← 最新论文
💬 NLP

Emotion Recognition in Sign Language Conversation

本文通过引入 eJSL Dialog 数据集,解决了手语情感识别中缺乏对话上下文的问题,并通过系统性基准测试证明现有通用模型存在领域差距,从而凸显了未来研究需要上下文感知的视觉提取器和更大规模数据集的必要性。

原作者: Yusong Wang, Keyu Mao, Takao Obi, Minghao Shao, Kotaro Funakoshi

发布于 2026-05-25
📖 1 分钟阅读☕ 轻松阅读

原作者: Yusong Wang, Keyu Mao, Takao Obi, Minghao Shao, Kotaro Funakoshi

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,试图通过只观看电影中随机、孤立的帧来理解整部电影。你可能会看到一个人面带微笑,但你不知道他们为什么微笑。是因为刚获奖而开心,还是因为即将发表演讲而紧张地微笑?这正是研究人员在尝试教会计算机理解手语中的情感时所面临的问题。

以下是用日常类比对本文内容的简要拆解:

1. 问题:“无声电影”陷阱

大多数现有的手语情感识别计算机程序就像无声电影评论家。它们观察一个人打手语的单个片段,并试图猜测其情感。

  • 缺陷:在现实生活中,情感是一场对话。学生打手语时可能看起来“中性”(平静),但如果老师刚刚表扬了他们,那张“中性”的脸实际上意味着“自豪”。如果计算机只看脸部而忽略对话历史,它就会出错。
  • 混淆:在手语中,面部表情身兼二职。皱眉可能意味着“我在提问”(语法)或者“我很生气”(情感)。这就像交通灯,有时意味着“停止”,有时意味着“左转”,具体取决于上下文。现有的计算机因这种重叠而感到困惑。

2. 解决方案:新的“剧本”和数据集

为了解决这个问题,作者创建了一个名为eJSL Dialog的新资源。

  • 类比:这就像从“抽认卡”式的学习方法转变为“完整戏剧”式的学习方法。他们不是使用孤立的句子,而是创建了480 段简短对话(像迷你戏剧),发生在老师和学生之间。
  • 内容:他们采用了现有剧本,让专业的聋人演员用日本手语(JSL)进行表演,并录制了 1,920 个视频片段。每个片段都标记了情感(快乐、悲伤、愤怒或中性)。
  • 目标:该数据集迫使计算机学习情感如何在对话过程中发生变化,而不仅仅是在真空中。

3. 实验:测试“学生”们

研究人员将这一新数据集视为不同计算机模型(即“学生”)的期末考试:

  • “仅视觉”学生:该模型只看视频(手和脸)。它表现尚可,但由于无法听到上下文,难以理解悲伤等微妙情感。
  • “仅文本”学生:该模型只阅读手语翻译的文本。总体而言它表现最好,因为词语本身往往能透露出情感。
  • “通用多模态”学生:这些是通常针对口语(人们说话并做表情)训练的高级模型。当研究人员尝试将这些模型用于手语时,它们惨败。
    • 为什么? 这就像试图教狗说法语。模型预期的是人类的面部表情(例如微笑代表快乐),但在手语中,“微笑”可能只是一个语法标记。模型感到困惑,表现甚至不如更简单的模型。

4. 关键要点

本文揭示了两个主要教训:

  1. 上下文为王:如果不了解之前说了什么,就无法理解手语情感。模型需要像人类一样记住对话的历史。
  2. 一刀切行不通:你不能直接将为口语构建的计算机程序应用于手语。手语的视觉“语法”差异太大。我们需要专门为手语者使用面部和手部的独特方式而设计的特殊工具。

5. 下一步是什么?

作者承认他们的“戏剧”是在完美的白色演播室中,仅由两名演员拍摄的。现实生活是混乱的,光线不佳且人物众多。

  • 未来:他们计划扩大数据集规模,包含更多自发的(非脚本)对话,并利用先进的人工智能更好地理解长对话的流动。

简而言之:本文建立了首个手语情感“对话库”,以证明当前的计算机过于“短视”。要真正理解手语者的感受,计算机需要观看整部电影,而不仅仅是单帧画面。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →