← 最新论文
💻 computer science

A Shared Latent for Partially-Labeled Multi-Task Facial Affect Recognition

本文提出了一种共享潜在变分框架,将部分标注的多任务面部情感识别视为对共同情感表示的边缘化,并通过在 s-Aff-Wild2 上进行的严格受控实验证明,该方法通过有效地利用跨任务信号,在面对严重的标签稀疏性和不平衡性时,其表现显著优于专家模型和掩码损失基准模型。

原作者: Hong Hai Nguyen, Sy Phan Van, Soo-Hyung Kim, Van-Thong Huynh

发布于 2026-07-21
📖 1 分钟阅读☕ 轻松阅读

原作者: Hong Hai Nguyen, Sy Phan Van, Soo-Hyung Kim, Van-Thong Huynh

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,试图教一个机器人仅通过观察脸部来理解人类的情绪。这不仅仅是识别一个微笑或一个皱眉;这是在解码一个同时发生的、由三个部分组成的复杂谜题。首先是“情绪计”,一个连续的刻度,衡量一个人感受到的积极或消极程度以及这种感觉的强度。第二是“标签书”,它试图为特定的情绪命名,比如“愤怒”或“惊讶”。第三是“肌肉图”,追踪即使在我们试图隐藏情感时也会发生的细微、不自主的面部肌肉运动。

棘手之处在于,在现实世界中,我们很少能得到完美的教科书式范例。有时一段视频片段有情绪评分,但没有肌肉数据;有时它有肌肉图,但没有情绪标签。这就像是在尝试解决一个拼图问题,而大部分碎片都丢失了,剩下的碎片也散落在不同的盒子里。大多数计算机程序处理这个问题的方法是忽略缺失的部分,或者猜测它们可能是什么,但本文提出了一个大胆的问题:如果我们不再忽视这些缺口,而是利用这些缺失的碎片来帮助补全整幅图像呢?作者提出了一种新的教学方式,即告诉计算机,即使是对一种情绪的部分线索也有助于它理解其他情绪,从而将一个混乱、不完整的数据库转化为一个强大的学习工具。


缺失碎片的谜题

研究人员解决了一个他们称之为“部分标注多任务学习”的问题。可以把它想象成一个教室,老师针对同一个学生提出了三个不同的问题:“他们的感受如何?”(情绪)、“他们在表达什么内容?”(表情)以及“哪些肌肉在运动?”(动作单元)。在一个理想的世界里,每个学生都会回答所有三个问题。但在现实世界中(具体来说是一个名为 s-Aff-Wild2 的数据集),只有大约 37% 的学生回答了所有三个问题。其余的学生只回答了一个或两个。

传统上,处理这种情况的计算机程序会简单地丢弃针对特定学生无法回答的问题。如果一个学生只回答了“情绪”问题,程序就会完全忽略该学生的“表情”和“肌肉”问题。作者意识到这是一种浪费。他们认为,即使一个学生只回答了一个问题,那个答案仍然能向老师传达关于该学生整体性格的一些信息。

神奇的“共享秘密”

为了解决这个问题,团队发明了一个聪明的技巧,称之为**“共享潜变量”(Shared Latent)**。想象一个每个人在回答任何问题之前都必须填写的秘密、隐形的笔记本。这个笔记本包含了学生真实情绪状态的一个压缩摘要。

这里的奥妙在于:即使一个学生只回答了“情绪”问题,他们的回答也会迫使他们更新那个秘密笔记本。因为“表情”和“肌肉”问题也依赖于同一个笔记本,所以“情绪”的回答会间接地帮助计算机在以后更好地猜测另外两个问题。这就像如果你只告诉朋友你最喜欢的颜色,这一个事实就能帮助他们猜出你喜欢的食物和音乐,因为他们足够了解你,能够把这些点连接起来。

通过将缺失的答案视为不是错误,而是需要被“边缘化”(这是一个高级数学术语,意为对各种可能性进行平均化处理)的线索,计算机能学到更丰富的理解。

双眼的威力

论文还发现了一个关于如何构建计算机“大脑”的惊人发现。通常,科学家们试图制造一个超级聪明的脑。但在这里,团队发现使用两个略有不同的、协同工作的脑效果更好,但有一个前提条件。

他们尝试使用两种不同类型的预训练面部识别器(称为骨干网络/backbones)。当他们对这两个结果取平均值时,结果变得更好了。然而,这只有在两个大脑是“近亲”的情况下才有效——这意味着它们大致一样聪明,但犯的是不同的错误。如果他们使用一个超级聪明的脑和一个较弱的脑,平均值并不会带来帮助。这就像有两个侦探:如果他们都很敏锐但观察线索的角度不同,他们就能更快破案。如果一个是天才而另一个是新手,天才就会被拖累。

成功与失败

研究结果令人印象深刻,但作者非常谨慎地说明了哪些方法没有奏效,这同样重要。

  • 好消息: 在表情任务(命名情绪)上,他们的新方法将得分从 0.403(使用标准专家模型)提升到了 0.446。这是一个其他方法无法达到的显著飞跃。
  • 动作单元的天花板: 对于肌肉追踪任务,他们成功突破了之前的限制,将得分从 0.543 提高到了 0.556。这发生是因为第二个“近亲”大脑提供了帮助,而不是因为他们增加了数据。
  • 情绪计: 连续情绪得分(效价-唤醒度)保持在 0.641 左右,基本没有变化。作者指出这处于“噪声”范围内,意味着改进在统计学上并不显著。
  • 失败之处: 他们尝试添加更多外部数据(例如来自其他研究的数据集)来帮助肌肉追踪,但这并没有产生任何效果。他们还尝试了一种流行的“平均教师”(Mean Teacher,即计算机自我教学)方法,但该方法未能改善情绪命名任务。这证明了问题不在于如何分配问题的权重,而在于“秘密笔记本”(表示层)本身的质量。

结论

论文得出结论,计算机之所以难以识别稀有情绪(如“恐惧”或“厌恶”),并不是因为它们需要更好的数学规则或更多的数据。而是因为它们“观察”脸部的方式不够细腻,无法区分那些微妙的情绪。通过使用“共享潜变量”来迫使计算机从部分线索中学习,并结合两个聪明且各具特色的大脑,他们成功构建了一个能够看到情绪、表情和肌肉运动之间隐形联系的系统。

他们在测试集上取得的最终得分为 1.679。虽然这是一个很强的结果,但作者很谦虚:他们承认这是一个“样本内”(in-sample)终点(是在他们调优的数据上进行的测试),真正的考验是这个“共享秘密”笔记本的想法是否能在其他未见过的数据库上奏效。在其他数据集上的早期测试表明,它是有效的,但仅在特定条件下。完美读取人类面部的旅程仍在继续,但本文为研究人员递上了一把新的、强大的手电筒,让他们得以看清黑暗中的缺口。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →