SSRNet: Robust Facial Expression Representation Learning Using Structure Prior and Self-Supervised Regularization
该论文提出了 SSRNet,这是一个鲁棒的面部表情识别框架,它结合了结构先验引导的特征增强模块与自监督对比学习,以有效应对噪声和遮挡等现实世界中的挑战,并在 FER2013 和 RAF-DB 数据集上实现了最先进的性能。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在计算机视觉的寂静角落,一个特定的挑战长期以来阻碍着机器真正理解人类情感:那就是现实生活的凌乱。虽然计算机可以轻松识别完美光照下的影棚照片中的面部,但当同一个脸部侧转、被手部分遮挡,或是在强烈且不均匀的光线下时,它们往往会出错。这种困难因用于训练这些系统的数据而变得更加复杂。用于训练人工智能的图像通常由人类标注,而人类也会犯错。他们可能会在某个表情是愤怒还是厌恶上产生分歧,或者可能完全标错了照片。当计算机从这些不完美的指令中学习时,它往往会记住错误而非真相,导致模型在实验室之外显得脆弱且不可靠。面部表情识别的目标不仅是识别微笑或皱眉,而是要构建一个能够观察到定义我们情感的细微、瞬时肌肉运动的系统,即使在图像充满噪声且标签错误的情况下也是如此。
为了解决这个问题,昆明理工大学的李静及其团队开发了一种名为 SSRNet 的新方法。他们并没有试图强迫计算机从零开始学习一切,而是构建了一个结合了两种不同策略的系统:一种教机器注视脸部的正确部位,另一种教它即使在标签混乱时也要信任其看到的视觉模式。团队从一个标准且可靠的计算机视觉骨干网络出发,并添加了一层基于人体解剖学的引导层。他们知道脸部的某些区域——眼睛、眉毛、鼻子和嘴巴——是情感表达最清晰的地方。因此,他们创建了一个模块来明确强调这些区域,告诉网络要额外关注形成皱眉或展开微笑的具体皮肤区域。这并不是一个复杂且变化的地图,而是一个固定的指南,确保无论脸部如何定位或背景如何干扰,系统都不会丢失对最具表现力特征的关注。
然而,仅仅关注正确的部位只是成功的一半。研究人员还需要确保系统能够处理由错误标签引起的困惑。为此,他们引入了一个自监督正则化分支。想象一个正在为考试复习的学生,但手中的教科书里充满了错别字。如果这个学生只看书后附带的答案,他们就会学到错误。但如果这个学生通过比较同一概念的不同图片,观察哪些特征保持不变来进行练习,那么无论是否存在错别字,他们都能掌握底层的真相。类似地,系统的这一部分通过观察同一张脸的不同版本,学习识别出它们是同一个人在表达同一种情感,即使附加在图像上的标签是错误的。通过迫使计算机在图像本身内部寻找一致性,该系统变得不再那么依赖于可能存在缺陷的人类标签,而是更加专注于实际的视觉证据。
这种双重方法的成果在两个以复杂性和噪声著称的大型真实世界数据集上进行了测试。在包含数千张在不受控环境下拍摄图像的 FER2013 数据集上,新系统实现了 72.51% 的准确率。在另一个包含来自互联网、具有多样化光照和角度的 RAF-DB 数据集上,它达到了 85.09%。这些数字高于其他几种领先方法所取得的数值,表明解剖学引导与自我纠正的结合行之有效。研究人员还测试了当他们有意在训练数据中增加更多错误时,系统的表现如何。即使 40% 的标签是错误的,新系统仍然保持着相对于旧模型的明显优势,证明了它已经学会了忽略噪声并专注于信号。
当团队将计算机观察世界的方式可视化时,差异非常显著。旧的模型倾向于将不同的情绪聚集在一起形成一片混乱的云团,难以区分恐惧与惊讶或悲伤与中性。然而,新系统将这些情绪组织成截然不同、紧凑的簇。它学会了分离定义特定情感的细微变化,并在它们之间建立清晰的边界。这表明,通过教计算机观察正确的部位并验证其自身的观察结果,该系统可以建立起对人类情感更稳定、更准确的理解。这项工作并不声称解决了所有问题;该系统仍然依赖于预定义的面部地图,如果一个人被严重遮挡或处于极端角度,可能会面临困难。然而,它为构建能够像我们阅读彼此那样,在现实世界不完美的灯光下依然具备韧性和细微洞察力的机器,提供了一条充满希望的前行之路。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。