← 最新论文
💻 computer science

Reweighting Framewise Attention in Video Transformers for Facial Expression Understanding

该论文提出了 MiRA,一个无参数的即插即用框架,通过重新分配视觉 Transformer 中的帧间注意力来增强对细微面部动态的敏感性,并提供了一种精确的 post-softmax 方法和一种高效的集成 FlashAttention 的近似方法,从而提升了在面部表情识别基准测试中的性能。

原作者: Seongro Yoon, Donghyeon Cho, Jinsun Park, François Brémond

发布于 2026-06-30
📖 1 分钟阅读☕ 轻松阅读

原作者: Seongro Yoon, Donghyeon Cho, Jinsun Park, François Brémond

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图通过观察一段视频来理解一个人的细微情绪。问题在于,视频中往往充满了“噪声”。这个人可能会转头,摄像机可能会晃动,或者背景可能会剧烈移动。这些巨大的、明显的动作就像是响亮的警笛声;它们淹没了你真正关心的那些安静、微小的细节,比如嘴角的一丝抽动或眉毛的一次瞬时紧蹙。

目前的 AI 模型(特别是“视觉 Transformer”)非常擅长观看视频,但它们很容易被这种响亮的警笛声分散注意力。它们会关注头部转动等大动作,而忽略了微小的、重要的面部线索。

这篇论文介绍了一个名为 MiRA(边际诱导注意力重分配)的新工具来解决这个问题。以下是它的工作原理,使用简单的类比进行说明:

问题所在:“嘈杂的人群”

把一段视频想象成一个正在交谈的拥挤房间。

  • 大动作: 一个人转头就像是一个人在大喊大叫。这很容易听到,所以 AI 的“注意力”(即它的焦点)会直接转向他们。
  • 细微的情绪: 微笑或皱眉就像是低语。因为喊叫声太响了,AI 会完全错过这些低语。

解决方案:MiRA(聪明的协调员)

MiRA 是一个作为 AI 插件的“聪明协调员”。它不需要从头学习新知识;它只是改变了 AI “聆听”视频的方式。它使用了两个主要技巧来让喊叫声安静下来,并放大低语声:

  1. “置信度”评分(谁在说话?):
    MiRA 会逐帧观察视频。它会问:“这一特定时刻对于表达情绪真的重要吗,还是仅仅是一个无聊的停顿或随机的转头动作?”如果一帧画面充满了噪声,Mi 就会告诉 AI 降低该帧的音量。如果一帧画面有清晰的情绪线索,它就会调高音量。

  2. “专注度”评分(焦点在哪里?):
    MiRA 还会检查 AI 在单帧画面内的观察位置。

    • 糟糕的焦点: 如果 AI 盯着整个背景或人的头发看(弥散性注意力),MiRA 会说:“这太分散了。”
    • 良好的焦点: 如果 AI 紧紧锁定在嘴部或眼睛上(集中性注意力),MiRA 会说:“没错!这正是情绪所在。”

MiRA 将这两个评分结合起来创建一个“优先级列表”。然后,它会轻轻地引导 AI 去忽略那些嘈杂的帧和分散的视角,迫使它专注于那些隐藏着真实情绪的、安静且局部的瞬间。

两种模式:“精确版”与“闪电版”

作者为这个工具创建了两个版本:

  • 精确模式 (Exact Mode): 这是“完美”的版本。它在 AI 做出决定后查看完整的注意力图,计算出完美的调整方案,并重新进行数学运算,以确保 AI 精确地聚焦在应该关注的地方。它非常准确,但有点慢,因为它需要读取和写入大量数据,就像一个必须走到每个书架前去检查书籍的图书管理员。
  • FlashLite 模式: 这是“快速”的版本。它意识到走遍每个书架太慢了。因此,它使用了一个聪明的捷径。它在 AI 做出最终决定之前观察数据的“能量”,并在那时注入优先级调整。这就像是一个知道哪些书很受欢迎,无需检查整个图书馆就能直接抓取它们的图书管理员。
    • 结果: FlashLite 的速度快了约 20%,且占用更少的内存,但其表现几乎与完美版本一样出色。

研究发现

研究人员在困难的面部表情数据集(即现实世界而非摄影棚拍摄的视频)上测试了该工具。

  • 更好的结果: 通过使用 MiRA,与标准模型相比,AI 识别情绪的能力显著提升。
  • 无需额外训练: MiRA 并没有增加 AI 的新“脑细胞”(参数)。它只是重新排列了现有大脑的工作方式。
  • 可扩展性: 由于“FlashLite”版本非常高效,他们可以将它用于更大、更强大的 AI 模型(高达 5 亿参数),并依然获得极佳的效果。

核心结论

MiRA 教会了 AI 如何停止盯着那些巨大的、明显的动作(如转头),转而开始倾听面部表情中那些安静、细微的低语。它通过作为一个智能过滤器,精准地知道何时以及何处该投入注意力,从而在不降低计算机运行速度的情况下,使基于视频的情绪识别变得更加准确。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →