← 最新论文
🤖 AI

Spatiotemporal Facial Action Unit Detection using Twin Cycle Autoencoders for Driver Monitoring

本文提出了双循环自编码器(Twin Cycle Autoencoder, TCA),这是一种创新的时空架构,通过整合空间外观解耦与时间轨迹一致性,旨在挑战性的座舱条件下鲁棒地检测驾驶员监控中的面部动作单元(Facial Action Units),在实现基准测试性能达到最先进水平的同时,保持了嵌入式硬件上的实时吞吐量。

原作者: Sai Sidharth D

发布于 2026-07-21✓ Author reviewed
📖 1 分钟阅读☕ 轻松阅读

原作者: Sai Sidharth D

原始论文根据 CC0 1.0(http://creativecommons.org/publicdomain/zero/1.0/)发布到公有领域。 这是对下方论文的AI生成解释。它不是由作者撰写的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你是一名正在试图破解谜题的侦探,但你唯一的线索是一个闪烁且充满颗粒感的监控摄像头画面。你寻找的不是小偷,而是一名即将在驾驶时打瞌睡的司机。这就是驾驶员监控系统(DMS)的世界——这是一个致力于通过观察我们的面部表情来保障我们安全的计算机科学领域。多年来,这些系统一直依赖于简单的技巧,比如计算你的眼睛闭合了多久,或者检查你是否在左右晃动。但真正的故事隐藏在面部肌肉极其微小的、不自主的抽动中。科学家们称这些微小的动作叫做“动作单元”(Action Units,简称 AUs)。把一个 AU 想象成一个单一的、原子的肌肉指令——比如打哈欠时发生的特定抽动,或者是你在对抗困意时眼睑细微的收紧。挑战在于,在车内,光影环境瞬息万变,从刺眼的阳光到漆黑一片;你的头部会前后晃动;有时你还会戴着墨镜。这是一个混乱的环境,计算机必须在其中捕捉那些持续时间不到一秒、且往往隐藏在阴影或玻璃之后的肌肉抽动。

本文介绍了一种新型的数字侦探——“双循环自动编码器”(Twin Cycle Autoencoder,简称 TCA)。它不仅仅是观察单张快照来猜测驾驶员的情绪,而是利用两个巧妙的“循环”来学习面部随时间演变的故事。第一个循环是“空间”分支,它学习识别肌肉运动,同时忽略这个人是谁或他穿着什么。第二个循环是“时间”分支,它就像一个“时空编辑师”,通过正向和反向观看视频,以确保运动的故事在两个方向上都符合逻辑。通过强制这两个循环达成一致,该系统能够识别出即使在摄像头表现不佳的情况下,也能捕捉到极其细微的疲劳迹象,例如缓慢的眨眼或半张的嘴巴。研究人员在标准数据集和真实的驾驶模拟器上对其进行了测试,结果发现,与旧方法相比,他们的“双生”系统能更好地捕捉这些微妙且转瞬即逝的困倦迹象,并且运行速度足以在当今的真实汽车中使用。

问题所在:混乱的车内环境

检测驾驶中的困倦是非常困难的。在安静的实验室里,摄像头可以轻松发现打哈欠。但在移动的车辆中,世界充满了挑战。阳光可能会直接照射进镜头,然后车辆又突然进入黑暗的隧道。驾驶员可能会转头检查盲点,或者戴着遮住眼睛的墨镜。此外,疲劳的迹象通常非常微妙。驾驶员可能还没有进入睡眠状态,他们可能只是在经历疲劳的微表情——眉毛的一次微小抽动,或是一次几乎不可见的快速眨眼。这些信号如此微弱且短暂,以至于通常逐帧观察的旧模型往往会完全错过它们。由于缺乏标注数据,它们也面临困难;获取数千小时的驾驶视频并由专家手动标记每一个肌肉抽动,既昂贵又困难。

解决方案:双循环自动编码器

作者提出了一种名为“双循环自动编码器”(TCA)的解决方案。要理解它的工作原理,请想象你正试图教机器人识别一种特定的舞蹈动作,但你手头没有舞蹈视频,只有一堆随机的照片。

1. 两个分支(双胞胎)
TCA 的构建就像一对擅长不同技能但又协同工作的双胞胎:

  • 空间双胞胎(“形似”检测器): 这个分支观察视频的单帧。它的任务是剥离掉所有与肌肉运动无关的信息。它忽略驾驶员的身份、发型或是否戴帽子,只专注于“动作单元”——即特定的肌肉形状。它使用了一个“循环”技巧:尝试从肌肉数据中重建面部。如果它能正确重建面部,就说明它捕捉到了正确的肌肉信息。
  • 时间双胞胎(“时空”编辑师): 这个分支观察一段短视频(约 1.6 秒)。它观察面部随时间向前运动的过程,然后尝试将视频倒放。它在这里也使用了“循环”技巧:如果运动在正向播放时有意义,那么在反向播放时也应该有意义。这有助于系统理解打哈欠或眨眼的“节奏”,而不仅仅是一个静态的嘴部图像。

2. 握手(潜空间对齐)
这两个双胞胎并非孤立工作。它们通过一个“握手”机制连接在一起。系统强制要求空间双胞胎在特定时刻对脸部的理解,必须与时间双胞胎在同一时刻对运动的理解相匹配。这确保了“外观”与“动作”讲述的是同一个故事。如果时间双胞胎看到打哈欠的开始,空间双胞胎也必须同意嘴部正在张开,即使是在光线不佳的情况下。

3. 无需老师的学习(自监督学习)
该系统最强大的特性之一是它的学习方式。通常,要训练一个 AI,你需要一个巨大的数据集,其中人类已经标记了每一个肌肉抽动。但在驾驶场景中,这类数据非常稀缺。TCA 通过使用“自监督学习”解决了这个问题。它可以观察数小时未标记的驾驶视频(即没有人标记 AUs 的视频),并利用其“循环”技巧自行学习面部运动的规则。它通过观察视频的正向和反向播放,来学习什么是“正常”的面部及其运动方式。随后,它才使用少量的标注数据来微调其识别特定疲劳迹象的能力。

研究发现

研究人员将他们的“双生”系统与几种流行的其他方法进行了对比测试,包括仅观察单帧的系统、使用 3D 视频滤波器的系统以及使用图网络的系统。他们在标准基准(DISFA 和 BP4D)以及从带有真实驾驶员的模拟器中记录的自然驾驶数据集上进行了测试。

  • 更擅长捕捉细微变化: TCA 一致优于其他方法。它在检测低强度或极快的 AUs(如 AU45 眼部闭合和 AU43 缓慢闭眼)方面表现尤为出色,而这些正是困倦的关键迹象。它在检测表示打哈欠的 AU26(下颌下垂)方面也表现良好。
  • 时间的威力: 当他们移除“时间”分支(时空编辑师)时,系统的性能显著下降。这证明了观察随时间变化的“运动”对于识别疲劳至关重要。
  • 自学习的力量: 当他们将使用自监督预训练(从无标签视频中学习)的 TCA 版本与未使用预训练的版本进行比较时,预训练版本的效果要好得多。这表明该系统成功地从数小时的无标签驾驶影像中学习到了有用的模式,弥补了因缺乏标注数据而造成的差距。
  • 现实世界的速度: 该系统不仅准确,而且运行迅速。在可安装于汽车内的嵌入式计算机(NVIDIA Jetson Xavier NX)上测试时,该系统的运行速度为 28.4 帧/秒。这足以提供实时警报,超过了安全系统通常要求的 10–15 帧/秒。

局限性与未来步骤

该系统并非完美。研究人员发现,当驾驶员佩戴墨镜时,系统在处理与上半脸相关的 AUs(如眉毛或眼睑)时表现得非常吃力。墨镜遮挡了视线,系统无法仅凭下半脸的动作来“推测”出上半脸的运动。然而,对于像打哈欠这样的下半脸动作,它依然保持稳健,因为嘴部仍然可见。

论文总结道,这种“双循环”方法是下一代驾驶员监控的可行路径。它表明,通过结合空间循环和时间循环,并利用自监督学习来充分利用无标签数据,我们可以构建出既准确又实用的汽车监控系统。未来的工作将集中在如何更好地处理遮挡问题(如墨镜),并将面部线索与其它数据(如方向盘动作)相结合,以获得更清晰的驾驶员疲劳画像。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →