Causal Supervision of Attention for Affective Behaviour Analysis
本文提出了一种用于情感行为分析中注意力机制的因果监督框架,该框架通过强制执行主体不变的关注点、通过互协方差正则化鼓励非冗余表示,以及通过门控非线性变换增强特征表达能力,从而在第11届情感行为野外分析竞赛中取得了最先进的性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在试图教一个机器人通过阅读你的脸来猜测你的感受。你想让它能识别出真诚的微笑或皱眉,对吧?但棘手的部分在于:这个机器人很容易分心。它可能会想:“哦,这个人看起来很伤心,因为他有一个大鼻子,”或者“这个人看起来很快乐,因为阳光照在了他的额头上。”这些就像是伪相关(spurious correlations)——这些线索与实际情感无关,只是恰好在训练数据中多次出现。如果机器人学会了这些坏习惯,当它遇到具有不同鼻子或不同光照条件的新人时,它会表现得一败涂地。
这篇论文的作者提出了一种巧妙的新方法来训练机器人的“注意力”,让它不再盯着错误的东西,而是开始专注于真实的感情信号,无论面前的人是谁。他们称之为因果监督注意力(Causal Supervision of Attention)。
三个魔法技巧
为了纠正机器人的坏习惯,团队在其学习过程中加入了三个特殊的成分:
1. “如果……会怎样?”游戏(因果监督)
通常情况下,机器人只是看一眼脸然后进行猜测。而这个团队让机器人玩了一个“如果……会怎样?”的游戏。他们问它:“如果我强迫你忽略鼻子,只看眼睛,你对情绪的判断会改变吗?”
他们创建了一个“反事实(counterfactual)”版本的注意力(一个机器人看向随机位置的虚假版本),并将它与真实的注意力进行比较。他们并没有仅仅追求原始差异的最大化,而是最大化了总直接效应(Total Direct Effect, TDE)——这是一个衡量注意力对预测的因果贡献的具体指标。通过这样做,他们鼓励机器人去关注**受试者不变性(subject-invariant)的面部区域——即在不同人身上都能一致预测情绪的区域,而不是仅仅关注某一个人的特定特征。这确保了机器人学会关注具有不变预测价值(invariant predictive value)**的区域,从而有效地将真实的感官线索与身份或光照等伪相关因素区分开来,而不必完全忽略身份信息。
2. “无重叠”规则(互协方差正则化)
把机器人的大脑想象成有两个工作小组:键(Key)小组(负责决定看什么)和值(Value)*小组(负责收集所见内容的细节*)。
在标准模型中,这两个小组经常互相重叠并重复相同的信息。这就像房间里的两个人都在大喊:“看眼睛!”却忽略了嘴巴。作者引入了一条规则,以确保这两个小组是互补的**,而不是冗余的。他们增加了一个惩罚项,如果“键”小组和“值”小组开始表达相同的内容,就会触发该惩罚。这迫使他们分工协作:一个可能专注于眉毛的形状,而另一个则专注于下颚的紧张程度,从而使最终呈现的画面更加丰富。
3. “超级 Transformer”(SwiGLU)
最后,团队提升了机器人的脑力。标准模型使用一种简单的、直线式的数学技巧来处理收集到的细节。作者将其更换为一种名为 SwiGLU 的高级非线性工具。
想象一下,旧的方法是一条直滑梯,而新方法是一个扭曲旋转的过山车。这使得机器人能够捕捉到关于情绪的更细微、更复杂的细节,而简单的滑梯会错过这些细节。它让机器人对“细粒度”情感的理解变得更加敏锐。
效果如何?
团队在名为 s-Aff-Wild2 的大规模真实世界视频数据集上进行了测试,其中人们在自然环境中进行着各种活动。他们使用一个名为 P 的分数来衡量成功,该分数综合了机器人完成三项任务的表现:猜测效价-唤醒度(Valence-Arousal)(即情绪的正向/负向程度以及强度)、识别表情(Expressions)(如开心或悲伤)以及捕捉动作单元(Action Units)(面部微小的肌肉运动)。
以下是他们的发现:
- 基准线(The Baseline): 标准机器人(使用 ConvNeXt 模型)在官方验证集上的得分为 0.45。
- 新方法: 当他们使用带有强大视觉编码器 FRoundation 的“因果监督”技巧时,得分跃升至 1.2214。
- 明细分解: 具体而言,对于猜测效价-唤醒度,他们得到了 0.5123 的得分;对于识别表情,得到了 0.3116 的 F1 分数;对于捕捉肌肉运动,得到了 0.3974。
他们还进行了五次重复测试(称为 5 折交叉验证),以确保结果并非偶然。新方法始终优于旧方法:使用一种大脑(DINOv2)时,平均得分从 0.8730 提高到了 0.9569;使用另一种大脑(FRoundation)时,从 1.0524 提高到了 1.1948。
核心结论
论文表明,通过迫使机器人区分真实的感官线索与“虚假”线索(如身份或光照),并专注于在不同受试者中具有不变预测价值的面部部分,我们可以构建出能更好地理解人类情感的系统。他们不仅仅是猜测这一点,他们通过对数千张图像的测量发现,他们三个新技巧中的每一个都帮助机器人表现得更好。虽然机器人的表现还不完美(仍有提升空间),但这种方法展示了一条清晰的路径,让我们能制造出真正“理解”我们,而不仅仅是根据我们的长相进行猜测的机器。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。