想象一下,你正试图通过观察一段视频来理解一个人的细微情绪。问题在于,视频中往往充满了“噪声”。这个人可能会转头,摄像机可能会晃动,或者背景可能会剧烈移动。这些巨大的、明显的动作就像是响亮的警笛声;它们淹没了你真正关心的那些安静、微小的细节,比如嘴角的一丝抽动或眉毛的一次瞬时紧蹙。
目前的 AI 模型(特别是“视觉 Transformer”)非常擅长观看视频,但它们很容易被这种响亮的警笛声分散注意力。它们会关注头部转动等大动作,而忽略了微小的、重要的面部线索。
这篇论文介绍了一个名为 MiRA(边际诱导注意力重分配)的新工具来解决这个问题。以下是它的工作原理,使用简单的类比进行说明:
问题所在:“嘈杂的人群”
把一段视频想象成一个正在交谈的拥挤房间。
- 大动作: 一个人转头就像是一个人在大喊大叫。这很容易听到,所以 AI 的“注意力”(即它的焦点)会直接转向他们。
- 细微的情绪: 微笑或皱眉就像是低语。因为喊叫声太响了,AI 会完全错过这些低语。
解决方案:MiRA(聪明的协调员)
MiRA 是一个作为 AI 插件的“聪明协调员”。它不需要从头学习新知识;它只是改变了 AI “聆听”视频的方式。它使用了两个主要技巧来让喊叫声安静下来,并放大低语声:
“置信度”评分(谁在说话?):
MiRA 会逐帧观察视频。它会问:“这一特定时刻对于表达情绪真的重要吗,还是仅仅是一个无聊的停顿或随机的转头动作?”如果一帧画面充满了噪声,Mi 就会告诉 AI 降低该帧的音量。如果一帧画面有清晰的情绪线索,它就会调高音量。
“专注度”评分(焦点在哪里?):
MiRA 还会检查 AI 在单帧画面内的观察位置。
- 糟糕的焦点: 如果 AI 盯着整个背景或人的头发看(弥散性注意力),MiRA 会说:“这太分散了。”
- 良好的焦点: 如果 AI 紧紧锁定在嘴部或眼睛上(集中性注意力),MiRA 会说:“没错!这正是情绪所在。”
MiRA 将这两个评分结合起来创建一个“优先级列表”。然后,它会轻轻地引导 AI 去忽略那些嘈杂的帧和分散的视角,迫使它专注于那些隐藏着真实情绪的、安静且局部的瞬间。
两种模式:“精确版”与“闪电版”
作者为这个工具创建了两个版本:
- 精确模式 (Exact Mode): 这是“完美”的版本。它在 AI 做出决定后查看完整的注意力图,计算出完美的调整方案,并重新进行数学运算,以确保 AI 精确地聚焦在应该关注的地方。它非常准确,但有点慢,因为它需要读取和写入大量数据,就像一个必须走到每个书架前去检查书籍的图书管理员。
- FlashLite 模式: 这是“快速”的版本。它意识到走遍每个书架太慢了。因此,它使用了一个聪明的捷径。它在 AI 做出最终决定之前观察数据的“能量”,并在那时注入优先级调整。这就像是一个知道哪些书很受欢迎,无需检查整个图书馆就能直接抓取它们的图书管理员。
- 结果: FlashLite 的速度快了约 20%,且占用更少的内存,但其表现几乎与完美版本一样出色。
研究发现
研究人员在困难的面部表情数据集(即现实世界而非摄影棚拍摄的视频)上测试了该工具。
- 更好的结果: 通过使用 MiRA,与标准模型相比,AI 识别情绪的能力显著提升。
- 无需额外训练: MiRA 并没有增加 AI 的新“脑细胞”(参数)。它只是重新排列了现有大脑的工作方式。
- 可扩展性: 由于“FlashLite”版本非常高效,他们可以将它用于更大、更强大的 AI 模型(高达 5 亿参数),并依然获得极佳的效果。
核心结论
MiRA 教会了 AI 如何停止盯着那些巨大的、明显的动作(如转头),转而开始倾听面部表情中那些安静、细微的低语。它通过作为一个智能过滤器,精准地知道何时以及何处该投入注意力,从而在不降低计算机运行速度的情况下,使基于视频的情绪识别变得更加准确。
技术摘要:用于面部表情理解的 MiRA
问题陈述
在不受限视频中理解面部表情需要对微妙、局部且瞬时的时空动态(例如微小的皱纹、皱眉)进行建模。然而,现有的基于视觉 Transformer (ViT) 的视频模型,即使是经过大规模自监督目标(如掩码自编码器 MAE)预训练的模型,在该领域也表现不佳。这些模型往往倾向于优化主导性的全局运动(例如头部运动)和粗粒度的场景级动态。因此,细微的面部内部变化往往被视为冗余,或被全局运动所掩盖,导致对精细化表情线索的建模不足。此外,标准的注意力机制通常缺乏选择性地将注意力分配给信息丰富的面部瞬间,同时抑制运动主导或冗余帧的能力。
方法论:MiRA(边缘诱导注意力重分配)
为了解决这些局限性,作者提出了 MiRA,这是一个旨在应用于 ViT 骨干网络的插件式帧边缘注意力重分配框架。MiRA 在不引入额外可训练参数的情况下,增强了对微妙面部动态的时空选择性。该方法通过从自注意力图中导出帧级统计量来估计边缘重要性,并据此重新分配注意力。
1. 核心机制:帧边缘重加权
该方法从头平均注意力矩阵 Aˉ 中计算两个互补的统计量:
- 帧级置信度 (ct): 衡量整个序列中分配给特定帧 t 的总注意力质量,指示该帧作为关键帧被关注的强度。
- 帧内集中度 (Ht): 使用逆熵量化一帧内注意力的空间集中程度。高集中度表示注意力局部化(有利于捕捉面部线索),而低集中度则表明存在弥散性的全局模式。
这些统计量被组合成帧边缘重要性得分 ft。该得分经过归一化处理,并通过幂函数 Softmax 转换为目标先验分布 πt。为了在不破坏已学习的查询-键(query-key)结构的前提下实现注意力重分配,MiRA 应用了基于比例的对齐。它根据目标先验与当前置信度的比例计算缩放因子 αt,并对数值进行裁剪以防止极端偏差。这些因子对注意力图进行重缩放,随后进行微小的均匀混合和行归一化,以确保概率分布的有效性。
2. 两种运行模式
论文引入了两种模式,以平衡有效性与计算效率:
- 精确模式 (Exact Mode): 这是原理性的公式化实现,在 Post-softmax 注意力图上执行重加权。它需要实例化完整的注意力图 (O(L2)),执行行归一化,并保留用于反向传播的 post-softmax 激活值。虽然有效,但这会产生显著的内存 I/O 开销,并且与 FlashAttention 等融合算子不兼容。
- FlashLite 模式: 为了提高效率,该模式将重分配直接集成到 FlashAttention 内核中。它不再进行 post-softmax 重缩放,而是利用 键向代理 (key-wise proxies)(具体为 key token 的平方 L2 范数)在 pre-softmax 阶段近似计算必要的帧级统计量。这些代理用于估计帧的显著性和集中度。生成的缩放因子被转换为加性偏置 (logαt),并在 Softmax 操作之前应用于注意力逻辑值 (Z=QK⊤/dK)。这使得重分配可以在 FlashAttention 的流式计算过程中完成,避免了完整注意力图的实例化,并显著降低了内存 I/O。
核心贡献
- 插件式注意力重分配: 一种用于 ViT 骨干网络的创新模块,通过基于帧级置信度和帧内集中度的注意力重分配,增强了对微妙面部动态的敏感度,且无需额外的可训练参数。
- FlashLite 近似: 一种轻量级的 pre-softmax 近似方法,将重分配机制集成到 FlashAttention 内核中。它在保持精确公式有效性的同时,减少了内存 I/O 并提高了吞吐量,使其适用于大规模训练。
- 对不受限条件的鲁棒性: 该方法在具有挑战性的面部表情识别 (FER) 基准测试中,展现出优于强力 ViT 基线的持续改进,且无需依赖特定任务的启发式方法(如紧密的脸部对齐或裁剪),而这些方法在可扩展预训练和现实世界设置中往往难以实现。
实验结果
作者使用 VideoMAE 作为骨干网络评估了 MiRA,该模型在 VoxCeleb2 上进行预训练,并在大规模自然场景下的 FER 基准数据集 DFEW、MAFW 和 FERV39k 上进行微调。
- 性能提升: MiRA 在所有数据集上均一致优于强力的 ViT 基线(包括 VideoMAE、VideoMAEv2 及其他 MAE 变体)。例如,在 DFEW (Fold 1) 上,ViT-B FlashLite 模型实现了 65.11% 的未加权平均召回率 (UAR) 和 76.25% 的加权平均召回率 (WAR),超过了 vanilla VideoMAE 基线的 59.94% UAR。
- 与 SOTA 对比: 该方法在纯视频方法中达到了最先进的性能,并与利用音频或语言监督的多模态方法保持了竞争力。值得注意的是,它在无需面部对齐预处理的情况下实现了这些结果。
- 效率: 与精确模式相比,FlashLite 模式在 H100 GPU 上实现了 20% 的延迟降低 (400.6 ms → 318.7 ms) 和 26% 的吞吐量增益,且识别性能几乎一致。
- 表示质量: 在微表情数据集 (SAMM, MMEW) 上使用冻结特征进行的 k-NN 探测显示,与通用视频模型和其他特定于 FER 的基线相比,MiRA 学习到的表示能更好地捕捉微妙的动态变化。
- 定性分析: 可视化结果表明,虽然基线模型侧重于主导性的全局运动(如头部转动、背景边界),但 MiRA 成功地将注意力转向了局部的面部区域和具有信息量的时序时刻。
意义与主张
论文声称,有效地建模视频中的面部动态对于表示情感上下文至关重要,即使在没有多模态输入的情况下也是如此。MiRA 的意义在于其能够 重新审视自注意力机制,专门解决通用视频 Transformer 中固有的对主导性全局运动的偏好问题。
通过引入帧边缘重分配机制,作者证明了在不损害现代训练流水线效率的前提下(通过 FlashLite),可以增强时空选择性以捕捉微妙线索。这项工作表明,通过抑制干扰性的全局运动并减少冗余,可以使模型更好地泛化到大规模、多样化且不受限的数据中,而在这些场景下进行显式对齐是不切实际的。作者将其定位为迈向能够进行细粒度理解的高效、可扩展视频基础模型的重要一步。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。