Design and Evaluation of a Lightweight Real-Time Facial Expression Recognition System: A PyTorch Mini-Xception Implementation Trained on FERPlus.
本文提出了一种轻量级、实时的面部表情识别系统,该系统使用基于 FERPlus 数据集并采用平方根反频率加权的自定义 PyTorch “Mini-Xception”模型进行训练,在无需显著 GPU 资源的情况下,在 Apple M1 Pro 上实现了 75.40% 的平衡测试准确率和 30 FPS 的帧率。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,有一台能够观察人的脸部并理解其感受的计算机。这就是面部表情识别的目标——这是一个试图将我们肌肉的细微运动转化为特定情绪(如快乐、悲伤或愤怒)的科学领域。几十年来,研究人员一直致力于构建复杂的数字大脑来完成这项任务,但这些系统通常需要庞大且昂贵的计算机才能运行。这些沉重的系统在被要求进行实时工作时(例如处理来自网络摄像头的实时视频流)往往表现挣扎。挑战在于,如何创造出一个既足够聪明以准确识别这些表情,又足够轻量以能在普通的日常电脑上运行,且不会出现卡顿或冻结的系统。
一位名叫 Debanjan Chakraborty 的研究人员通过设计一种专门用于此任务的新型精简版数字大脑,解决了这一问题。Chakraborty 没有使用该领域常见的巨大且耗能的模型,而是构建了一个名为 Mini-Xception 的微型、高效的架构。该模型是在一个名为 FERPlus 的大型面部图像集上训练的,该数据集包含数千张展示七种不同情绪的人脸照片。然而,这个数据集提出了一个棘手的障碍:它是严重不平衡的。虽然有数千张人们表现出快乐或中性表情的照片,但表现出厌恶或恐惧等情绪的照片却非常少。如果计算机从这样一个倾斜的集合中学习,它往往会忽略那些稀有情绪,为了保证大部分时间下的正确率,它会对几乎所有情况都猜测为“快乐”或“中性”。
为了解决这个问题,研究人员测试了不同的方法,以教导计算机去关注那些稀有情绪。他们尝试了忽略这种不平衡,尝试了给予稀有情绪最大重要性,还尝试了一种给予它们适度提升的折中方案。结果显示,这种折中方案效果最好。通过调整训练过程,使系统在不过度反应的前提下,恰到好处地重视稀有情绪,该系统学会了以高度平衡的方式识别所有七种情绪。最终的模型极其微小,包含不到 57,000 个可调节参数,这与通常拥有数百万参数的标准系统相比简直微不足道。这种微小的体积意味着整个模型占用的存储空间不到一兆字节,使其易于携带并在标准设备上运行。
然而,真正的考验在于这个小型系统是否能跟上实时视频流。研究人员建立了一个系统,利用网络摄像头实时检测人脸,并立即进行表情分类。他们在一部常见的高性能笔记本电脑 Apple M1 Pro 上进行了测试。他们发现,该系统能以大约每秒 30 帧的速度稳定处理视频,这足以让肉眼感知为连续的运动。从发现人脸到命名情绪的整个过程耗时不到六毫秒。令人惊讶的是,研究人员发现,对于处理单个视频帧这一特定任务,计算机的主处理器实际上比其专门的图形芯片更快。这是因为图形芯片虽然在处理大规模数据批次时功能强大,但在为每个单独的帧启动时会有轻微延迟,而主处理器处理这类小型、快速的任务效率更高。
该系统还包含了一个人脸检测的安全网。它主要使用一种现代且快速的方法来寻找视频中的人脸,但如果该方法失效,它可以立即切换到一种旧有的、可靠的技术,以确保视频流不会中断。为了让输出结果看起来自然,系统对结果进行了平滑处理,使得情绪标签不会在帧与帧之间剧烈跳动,而是像人类表情一样逐渐变化。这项研究证实,一个轻量级且经过精心调优的系统确实可以在不需要超级计算机的情况下,实现实时的面部表情识别。
尽管取得了这些成功,研究人员仍谨慎地指出该系统无法做到的事情。计算机只能看到脸部的物理形状,它并不知道一个人真实的内心感受。微笑可能代表真诚的喜悦,也可能只是一种礼貌的面具,系统无法分辨其中的区别。此外,该系统是在低分辨率图像上训练的,无法诊断医疗状况,也无法在敏感情况下取代人类的判断。它是一个识别可见线索的工具,而不是通往人类灵魂的窗口。这项工作证明,只要设计得当,强大的人工智能可以被缩小到适配笔记本电脑,从而为日常技术中的实时情感感知开启大门,而无需庞大的硬件支持。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。