← 最新论文
💻 computer science

Combining Facial Videos and Biosignals for Stress Estimation During Driving

本文提出了一种用于驾驶的多模态压力估计框架,该框架利用跨模态注意力机制将基于三维可变形模型的面部视频特征与生理信号相融合,相较于仅使用生物信号,显著提升了压力检测的准确率和 AUROC。

原作者: Paraskevi Valergaki, Vassilis C. Nicodemou, Iason Oikonomidis, Antonis Argyros, Anastasios Roussos

发布于 2026-05-05
📖 1 分钟阅读☕ 轻松阅读

原作者: Paraskevi Valergaki, Vassilis C. Nicodemou, Iason Oikonomidis, Antonis Argyros, Anastasios Roussos

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在试图猜测一位朋友在开车时是否感到压力。你有两种方法可以做到这一点:你可以观看他们的面部视频,或者你可以监听他们的心跳并观察他们的出汗情况。通常,科学家会选择其中一种。但这篇论文问道:“为什么不同时使用两者呢?”更重要的是,“如果视频能帮助我们理解身体信号,即使这些身体信号杂乱无章,会怎么样?”

以下是研究人员破解压力检测密码的故事,用简单的方式解释。

问题所在:压力是一只变色龙

压力很棘手。有时人们会隐藏它;有时他们的身体会出卖他们。如果你只看司机的脸,他们可能正在假装平静。如果你只看他们的心率,传感器可能会滑落或产生噪声。研究人员希望建立一个系统,能够同时观察面部和身体信号,以获得清晰的画面,即使其中一个信号很弱。

“面部扫描仪”:一位 3D 木偶大师

团队没有只是拍摄司机的普通视频,而是使用了一种名为EMOCA的特殊工具。把这想象成一位高科技木偶大师。

当你观看司机的视频时,该工具看到的不仅仅是“一张脸”。它会剥离这个人的身份特征(如鼻子形状或肤色),并将他们的脸转化为一个56 维的数字木偶

  • 它追踪嘴巴如何移动(表情)。
  • 它追踪头部如何倾斜或转动(姿态)。
  • 它甚至追踪这些移动的速度

研究人员发现,压力不仅仅关乎脸看起来是什么样子,更关乎它变化得有多快。这就像平静湖面与被风暴袭击的湖面之间的区别。这场“风暴”(压力)体现在数字木偶快速、颤抖的动作中,而不仅仅是静态的形状。

“身体信号”:心跳与汗水

他们还使用标准传感器观察司机的身体:

  • 心率:心跳有多快。
  • 呼吸频率:呼吸有多快。
  • 鼻周出汗:鼻子周围的汗水(经典的压力迹象)。

重大发现:面部比你想象的更像侦探

在构建他们的人工智能之前,研究人员进行了一场统计学的“对决”。他们比较了压力驾驶时刻(如开车时发短信)与平静驾驶期间面部动作与身体信号的反应。

结果:他们发现,56 个数字面部木偶部件中的 38 个对压力的反应强度与心率或出汗传感器一样强。

  • 类比:想象一下,你试图猜测某人是否紧张。你可能会检查他们的手是否在颤抖(身体信号)。但这篇论文发现,如果你观察他们的眼睛是否游移或下巴是否紧绷(面部信号),你获得的信息量同样多。事实上,面部在这一点上表现得太好了,以至于仅靠身体信号来猜测压力实际上相当糟糕(准确率仅为 50% 左右——基本上等同于抛硬币!)。

解决方案:“队长”人工智能(Transformer)

研究人员使用一种名为Transformer的技术构建了一个智能人工智能系统。把这个 AI 想象成拥有两名队员的队长:

  1. 队员 A:面部(3D 木偶)。
  2. 队员 B:身体(心跳、呼吸、汗水)。

他们尝试了三种让这两名队员交流的方式:

  1. 单人表演:让面部单独表演,或让身体单独表演。
  2. 早期融合:将两名队员的手绑在一起,使他们作为一个整体移动。
  3. 跨模态注意力(获胜者):这是秘密武器。AI 充当一位超级智能翻译。它让面部观察身体并说:“嘿,你的心跳在加速,让我检查一下你的下巴是否紧绷以确认。”然后它让身体观察面部并说:“你的脸在抽搐,让我检查一下你的呼吸是否浅促。”

这种“跨模态注意力”允许两个信号互相帮助,填补空白。

结果:从抛硬币到水晶球

以下是不同方法在猜测司机是否感到压力方面的表现:

  • 仅靠身体信号:约 52% 的准确率。(基本上是在猜测)。
  • 仅靠面部:约 90% 的准确率。(非常好!)。
  • 面部 + 身体(简单混合):约 90% 的准确率。
  • 面部 + 身体(“翻译”AI)92% 的准确率

最令人惊讶的部分是什么?尽管身体信号单独表现不佳,但当 AI 使用“翻译”方法将它们与面部结合时,准确率显著提高。这证明了面部和身体是一个完美的团队,但前提是它们必须以正确的方式相互沟通。

这对驾驶为何重要

这项研究是在驾驶模拟器中进行的。研究人员发现,在车里,你并不总能看清司机的手或脚(身体线索有限)。但你几乎总是能看到他们的脸。该系统证明,通过观察司机面部细微、快速的动作,你可以检测压力,其效果几乎等同于给他们 strapped 上一套完整的医疗套件。

简而言之:这篇论文表明,如果你想知道司机是否感到压力,不要只看他们的心率。像鹰一样盯着他们的脸,使用 3D 木偶追踪每一个微小的抽搐,并让 AI 将这些动作转化为清晰的“压力”或“平静”信号。这就像拥有一种超视力,能在司机自己意识到之前就看到压力。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →