← 最新论文
💻 computer science

VISAFF: Speaker-Centered Visual Affective Feature Learning for Emotion Recognition in Conversation

本文提出了 VISAFF,这是一种无需微调、以说话者为中心的框架,它利用冻结的视觉 - 语言模型,通过聚焦主动说话者的视觉线索并动态地辅以文本和声学模态,来实现对话中的情感识别,从而在显著降低计算成本的同时达成高性能。

原作者: Linan ZHU, Zihao Zhai, Xiao Han, Yuqian Fu, Xiangfan Chen, Xiangjie Kong, Guojiang Shen

发布于 2026-05-19
📖 1 分钟阅读☕ 轻松阅读

原作者: Linan ZHU, Zihao Zhai, Xiao Han, Yuqian Fu, Xiangfan Chen, Xiangjie Kong, Guojiang Shen

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图仅通过观看朋友说话的视频来猜测他们的情绪。这就是“对话中的情感识别(ERC)”所面临的挑战。

长期以来,计算机试图仅通过阅读人们所说的话语来猜测情绪。但这就像只读剧本去理解一个笑话,却忽略了说话者的面部表情和语调。你可能会错过讽刺或假笑。

最近,随着“视觉 - 语言模型(VLMs)”的出现,计算机变得更聪明了。这些模型就像超级敏锐的 AI 侦探,能够观看视频并理解其中发生的事情。然而,本文作者发现,使用这些 AI 侦探来处理对话存在两个大问题:

  1. “分心的侦探”问题:当你要求一个标准的 AI 观看群聊视频时,它往往会分心。它可能会关注背景中有趣的海报、听众挥动的手,或者窗外移动的车辆,而不是真正说话者的脸。它忽略了说话者特有的情感线索。
  2. “模棱两可的微笑”问题:微笑并不总是意味着“快乐”。有时它是紧张的 grimace(龇牙咧嘴)或讽刺的 smirk(假笑)。如果 AI 只看视频,它会感到困惑。它需要听到话语和语调,才能判断那个微笑是真实的还是虚假的。

解决方案:VISAFF

作者创建了一个名为VISAFF(以说话者为中心的视觉情感特征学习)的新系统。可以将其视为一个两步过程,用于训练一位“超级侦探”,而无需付出从头重新训练 AI 的巨额成本。

第一步:“聚光灯”(以说话者为中心的情感定位)

想象 AI 侦探身处一个挤满人的黑暗房间。VISAFF 不会让它四处游荡、观察一切,而是将一道聚光灯专门打在正在说话的人身上。

  • 工作原理:系统向一个冻结的(未改变的)AI 发出特殊指令:“忽略背景和其他人。关注说话者的面部和身体。”
  • 神奇之处:它不需要重新训练 AI(这既昂贵又缓慢)。相反,它利用巧妙的提示和说话者的参考照片,来“解锁”AI 现有的聚焦能力。这就像给一位已经懂得如何观察的侦探递上一把放大镜,他只需要知道该看哪里

第二步:“安全网”(可靠性引导的情感互补)

现在,想象说话者戴着墨镜,或者视频模糊不清,或者他们遮住了脸。“聚光灯”步骤可能仍然不确定。这时,第二步就派上用场了。

  • 概念:系统会自问:“我对所见内容的把握有多大?”
  • 安全网:如果视觉线索不可靠(置信度低),系统会自动从文本(他们说了什么)和音频(他们如何说的)中引入帮助,以填补空白。
  • 守门人:如果视频清晰无比且情绪显而易见(高置信度),系统会忽略文本和音频以避免混淆。它就像一个智能守门人:“如果眼睛看得清,就相信眼睛;如果眼睛看不清,就相信声音。”

为什么这很重要

论文声称,这种方法是一个游戏规则的改变者,因为:

  • 它既便宜又快速:它不需要重新训练巨型 AI 模型所需的庞大计算能力。它直接“原样”使用(冻结的)AI,只是更好地引导它。
  • 它更聪明:通过只关注说话者,并且仅在视频不清楚时才使用文本/音频,它避免了旧方法的错误——那些方法容易被背景分散注意力,或误读模棱两可的面部表情。

简而言之,VISAFF就像雇佣了一位受过高度训练的侦探,你无需重新培训他们。你只需给他们一盏聚光灯来找到正确的人,并给出一本规则手册,上面写着:“如果你看不清楚,就问问证人他们听到了什么。”其结果是,计算机在对话中理解人类情绪的方式变得更加准确。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →