✨ 要点🔬 技术摘要
想象一下,你正试图通过观看一段朋友说话的视频来理解他们的情绪。如果你逐秒观看一段 10 分钟的视频,你会感到疲惫,并且会花费大量时间盯着那些毫无趣味的时刻——比如他们只是静坐或眨眼的时候。你还会被背景分散注意力,比如凌乱的房间或路过的汽车,这些都与他们的感受无关。
这正是计算机在尝试识别**动态面部表情(DFER)**时所面临的问题。它们试图处理视频的每一帧,结果被“冗余”信息(无聊的部分)和“噪声”(背景杂讯)所拖累。这使得过程既缓慢又昂贵。
本文介绍了一种名为AdaTosk 的新 AI 模型来解决这个问题。将 AdaTosk 想象成面部表情视频的智能自适应编辑器 。以下是其工作原理,分解为简单的概念:
1. 双轨系统(“导师”与“学生”)
大多数 AI 模型只是试图猜测情绪(如“快乐”或“悲伤”)。AdaTosk 不同,因为它同时运行两条轨道:
自监督轨道(“导师”): 想象一位老师遮住图片的随机部分,让学生猜测缺失的内容。这迫使 AI 通过尝试“重建”隐藏部分,真正学习面部的样子。这有助于 AI 在不需要每一帧都有标签的情况下,理解面部特征的基础知识。
监督轨道(“学生”): 这是实际猜测情绪的部分。但这里的技巧是:它不是查看整个视频,而是使用一种特殊过滤器,只查看最重要的部分。
2. “硬掩码”与“软掩码”
为了使 AI 高效,作者使用了两种类型的“掩码”(就像隐藏或调暗视频部分的编辑工具):
硬掩码(“随机橡皮擦”): 这就像眼罩。AI 随机隐藏视频的大块部分(高达 70%!),并迫使“导师”轨道填补空白。这是一种让 AI 变得更聪明的标准技巧,但它是随机的。
软掩码(“智能调光器”): 这是本文的重大创新。与随机隐藏事物不同,这个掩码是自适应的 。它会查看视频并问:“这一刻重要吗?”
如果某一帧显示突然的变化(例如微笑开始),掩码保持轻盈 (让 AI 清晰地看到它)。
如果某一帧只是无聊的静态时刻(例如一个人静坐),掩码会变得更重 (将其调暗,以免 AI 浪费精力)。
3. “软掩码”如何决定保留什么
“智能调光器”使用两种具体策略来决定什么很重要:
策略 A:“变化检测器”(类别无关): 想象在看电影时,只在动作发生变化时才会注意。如果角色的脸保持静止 5 秒,AI 就会忽略它。如果他们突然皱眉,AI 就会放大。这种策略查看一帧与下一帧之间的差异。如果有很大差异,这就是“关键时刻”,会被保留。
策略 B:“意义保持者”(类别语义): 有时,一张脸看起来与前一帧非常相似,但它仍然很重要(例如保持悲伤的表情)。“变化检测器”可能会意外删除这一点。“意义保持者”修复了这个问题。它记住了情绪的上下文 。即使面部看起来是静态的,如果它是“悲伤”序列的一部分,掩码就会保持足够轻盈,以保留该信息。它防止 AI 仅仅因为某些内容没有太多移动就删除关键的情感细节。
4. 结果:更快、更智能
通过使用这种“软掩码”,AdaTosk 就像一个高速编辑器,在 AI 尝试理解情绪之前,就剪掉了视频中所有无聊、重复和嘈杂的部分。
本文声称,通过这样做:
它节省了巨大的计算能力: 它将计算机需要完成的工作减少了约 60 亿次计算(FLOPs),并显著缩小了模型规模。
它的表现更好: 尽管查看的数据更少,但在识别情绪方面,它实际上比当前的顶级方法获得了更高的分数。在标准测试中,它在减少资源使用的同时,将性能提高了约 3%。
总结
将 AdaTosk 想象成一位智能摄影师 ,他不仅仅是记录一切。相反,他本能地知道何时放大突然的微笑,何时忽略无聊的停顿,以及何时保持对 lingering 皱眉的平稳镜头。通过过滤掉“废话”并只关注表情的“实质”,计算机可以更快、更准确地理解人类情绪。
技术摘要:AdaTosk——用于高效动态面部表情识别的自适应时序软掩码
问题陈述
动态面部表情识别(DFER)旨在通过视频序列中的非语言交流来识别心理意图。尽管现有方法行之有效,但在效率和冗余 方面面临重大挑战。由于连续性,视频数据本质上包含大量时序冗余 ,导致处理诸如背景噪声和语义重复的静态帧等无关信息。包括受掩码自编码器(MAE)启发的方法在内的当前方法,往往难以区分关键的表情动态与冗余令牌。因此,模型可能要么在无关帧上计算不必要的特征,要么未能捕捉细微且难以检测的表情变化,从而导致计算成本高昂,而准确率并未获得相应提升。
方法论:AdaTosk
作者提出了AdaTosk ,这是一种新颖的有监督时序软掩码自编码器网络,旨在解决这些低效问题。该架构集成了两个并行分支:一个自监督重建分支 和一个有监督分类分支 。
1. 双分支架构
自监督重建分支 :该分支利用随机二值硬掩码 (受 VideoMAE 启发)对大部分视频令牌进行掩码。模型被训练为使用轻量级解码器从可见令牌中重建被掩码的令牌。这一过程鼓励编码器从剩余的可见令牌中学习有意义的特征表示。
有监督分类分支 :该分支处理最优可见令牌 (X o p t X_{opt} X o pt )以执行表情分类。与硬掩码不同,该分支采用自适应时序软掩码 (S S S ),根据令牌的时序重要性和语义冗余度,为可见令牌分配不同程度的掩码。
2. 自适应时序软掩码机制
AdaTosk 的核心创新在于自适应软掩码,它能够动态调整令牌的影响。它结合了两种不同的策略:
类别无关动态软掩码 :
目标 :在不依赖预定义类别偏差的情况下捕捉表情动态的关键时刻。
机制 :它计算相邻可见帧之间的帧间特征差异(τ \tau τ )。差异最大的前K K K 对帧对被识别为“激活帧”。一个通道级信息交互单元(Squeeze-and-Excitation 模式)增强这些帧,而一个时序信息交互单元生成一个软掩码(S a g n o s t i c S_{agnostic} S a g n os t i c ),在整个序列中优先处理这些动态变化。
类别语义相似软掩码 :
目标 :减少随时间积累的语义相似但冗余的令牌,同时保留关键信息。
机制 :它使用时序累积分数(M M M )来建模令牌被掩码的概率。为了处理连续性,马尔可夫链 在帧之间传递分数,排除前r r r 个令牌以减少计算负载。关键在于,该分数由源自类别监督(绝对激活值之和)的语义分数 (A A A )进行重加权。这确保了具有高语义价值的令牌即使表现出时序冗余也能被保留。
最终掩码 :最终的自适应掩码(S S S )是类别无关掩码和类别语义掩码的逐元素乘积(S = S a g n o s t i c ⊙ S s e m a n t i c S = S_{agnostic} \odot S_{semantic} S = S a g n os t i c ⊙ S se man t i c )。
3. 训练目标
总损失函数(L L L )结合了来自自监督分支的重建损失(L r e c L_{rec} L r ec )和来自有监督分支的分类损失(L c l s L_{cls} L c l s ),并通过权重λ r e c \lambda_{rec} λ r ec 和λ c l s \lambda_{cls} λ c l s 进行平衡。
主要贡献
本文概述了三项主要贡献:
有监督 VideoMAE 的集成 :AdaTosk 是首个将有监督 VideoMAE 框架集成到 DFER 任务中的方法,通过优化可见令牌显著提高了识别效率。
自适应时序软掩码 :作者提出了一种创新的掩码策略,能够自适应地调整掩码程度。其两个组成部分——类别无关动态掩码和类别语义相似软掩码——专门针对激活关键表情动态和抑制时序语义冗余。
效率与性能提升 :该模型实现了高性能与低计算成本之间的平衡,在保持或提高准确率的同时,与最先进的方法相比,减少了模型大小和浮点运算次数(FLOPs)。
实验结果
作者在三个广泛使用的野外 DFER 基准测试集上评估了 AdaTosk:DFEW 、FERV39K 和MAFW 。
性能 :AdaTosk(带软掩码,记为 AdaTosk†)在所有数据集上的未加权平均召回率(UAR)和加权平均召回率(WAR)均比现有有监督模型高出9–10% 。它还超越了基于大语言模型的方法以及其他基于 VideoMAE 的方法(如 MAE-DFER、MMA-DFER),优势幅度在**2.1% 到 4.8%**之间。
效率 :
与基线 VideoMAE 相比,AdaTosk 将参数量减少了约1200 万 ,FLOPs 减少了380 亿 。
与不带软掩码的版本(AdaTosk)相比,添加时序软掩码(AdaTosk†)进一步将参数量减少了200 万 ,FLOPs 减少了40 亿 ,同时 UAR 和 WAR 提高了约2% 。
总体而言,与当前的最先进方法相比,该模型将计算成本降低了60 亿 FLOPs ,模型大小减少了1000 万参数 。
意义与主张
本文声称,AdaTosk 成功解决了现有方法的关键局限性:在处理冗余信息时倾向于忽略细微的表情动态。通过引入自适应时序软掩码 ,该模型有效地聚焦于表情演变的关键时刻,并减少了语义相似令牌的积累。
作者断言,这种方法能够实现高效的动态表情识别 ,而不会牺牲性能。结果表明,通过软掩码智能地管理时序冗余,该模型以显著更低的计算开销实现了具有竞争力且往往更优越的准确率。可视化结果进一步证实,该模型能够正确识别关键面部区域(例如嘴巴、脸颊、眉毛),并根据表情变化和语义重要性动态调整掩码强度。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。