想象一下,你正试图教会一个机器人仅仅通过观察人类的面部表情来理解人类的情感。这听起来很简单,但实际上是一场混乱的三方拉锯战。机器人必须在一条情感滑块上(就像调节音量的旋钮一样)猜测一个人是快乐还是悲伤;从八个特定的情感词汇中(比如“愤怒”或“惊讶”)选出一个词;并且还要捕捉到即使在人们试图掩饰时也会出现在眼睛和嘴部周围的细微肌肉抽动。问题在于,机器人的训练数据是破碎的:有时它只能看到肌肉抽动,有时只能看到情感词汇,极少能同时看到这三者。此外,数据中充满了罕见的、奇怪的案例,却缺失了最常见的案例。这就是“情感计算”的世界,科学家们正试图借此构建能够理解我们的机器。核心问题不仅在于“我们能否制造出聪明的机器人?”,而在于“我们如何构建一支不会犯完全相同错误的机器人团队?”
这篇论文解决了这个团队建设问题,针对的是一项名为第11届ABAW挑战赛的重大竞赛。作者们发现了一个令人沮丧的秘密:如果你只是拿走一个聪明的机器人,对其进行微调,然后让它再试一次,它通常会犯下与第一个机器人完全相同的错误。这就像要求一对双胞胎去解谜题;即使他们坐在不同的椅子上,他们也往往会盯着同一个错误的碎片并说:“那就是答案!”研究人员发现,仅仅重新训练模型或改变其学习顺序并无帮助,因为模型会“重新收敛”到同样的坏习惯中,其预测相关性高达0.98。
为了解决这个问题,该团队为向他们的机器人团队添加新成员提出了一个严格的“强度-对等”(Strength-Parity)规则。他们认为,一个新机器人只有同时通过两项测试才是有用的:它必须像当前的团队一样聪明(即“近邻”),并且必须以不同的方式看待问题(即“去相关”)。如果一个新机器人非常聪明但思考方式与其他人完全一致,那它就是没用的。如果它思考方式不同但很笨,同样也是没用的。你需要完美的结合:一个聪明且能从不同角度看世界的伙伴。
论文表明,通常制造新机器人的方法无法通过这项测试。然而,他们发现了一个巧妙的技巧,叫做“参数隔离专家”(Parameter-Isolated Experts)。想象一下,主机器人大脑是一个巨大的图书馆。他们没有为每个新任务重写整个图书馆(这会让每个人思考方式趋同),而是在图书馆内为每位新专家建造了微小的、独立的、低秩的“秘密房间”。这些房间允许专家学习特定的技巧,而不会干扰主图书馆或抄袭彼此的笔记。这种方法保持了专家们思考方式的多样性(显示预测相关性为0.91,这比0.98好得多),同时也保持了他们极高的智能水平。
通过使用这个技巧,该团队在竞赛的验证测试中取得了1.6949的分数,相比于0.45的基准分数有了巨大的飞跃。当他们加入了一些更精巧的调整,比如针对特定肌肉运动校准机器人的置信度时,分数攀升到了更高的1.7259。论文总结道,虽然这种方法取得了巨大的进步,但存在一个极限:一旦你拥有了几个既聪明又思维迥异的专家,想要找到更多这样的专家就会变得非常困难。下一个巨大的飞跃将不再来自于对更多同类事物的简单平均,而是来自于为机器人寻找一种全新的观察世界的方式。
技术摘要:基于参数隔离专家模型的强度-对等集成用于多任务情感识别
问题定义
本文针对第11届情感行为分析(ABUW)竞赛中的多任务学习(MTL)挑战进行了研究。其目标是从单张不受限的人脸中联合估计三种不同的情感属性:连续的效价-唤醒度(valence–arousal)、8分类表情(categorical expression)以及12分类动作单元(AU)检测。该任务受到三个特定约束的复杂影响:
- 部分且不平衡的标签: 这三类标签在重叠但规模不等的数据子集上进行标注,且单个类别呈现长尾分布。
- 目标数据无预训练限制: 竞赛禁止在 Aff-Wild2 语料库上进行预训练,要求模型必须从外部数据集进行迁移适配。
- 集成效率低下: 虽然领先的参赛方案依赖于重度集成,但对于在已有强力集成基础上,哪些额外的成员能带来提升,其标准很少被明确阐述。标准的差异化方法(例如在同一骨干网络上使用不同的重新随机种子或不同的微调课程)往往会失败,因为它们会重新收敛到近乎相同的预测结果,从而无法提供可供平均的差异性。
方法论
所提出的系统构建于一个基础架构之上,该架构包含两个冻结的、经过情感监督的 ViT-B/16 骨干网络(一个经 FSFM 初始化,另一个经 MAE-Face 初始化)以及一个通过边缘化缺失标签来处理各任务解码器的共享情感潜变量(Shared Affect-Latent, SAL)。其核心创新在于**强度-对等规则(Strength-Parity Rule)**以及满足该规则的机制。
强度-对等规则:
作者提出了一个具体的集成成员准入标准。只有当一个新成员同时满足以下两个条件时,它才能提升集成性能:
- 去相关性(Decorrelation): 它必须与当前的集成成员保持去相关(即低预测相关性)。
- 近等强度(Near-Peer Strength): 它必须具备个体准确性,表现水平与现有成员相当。
论文证明了标准方法无法满足此规则:在同一骨干网络上通过重新随机种子或运行不同的监督课程产生的预测,其相关性高达 0.98,这意味着尽管个体准确性很高,但实际上并未提供任何差异性。
参数隔离专家(Parameter-Isolated Experts):
为了生成既能满足强度-对等规则,又无需承担训练全新骨干网络成本的成员,作者采用了参数隔离适配技术。
- 使用单一的共享骨干网络并将其冻结。
- 使用不同的情感语料库(如 AffectNet, FSFM, MAE)通过不相交的低秩子空间(LoRA)来适配该骨干网络。
- 每个专家通过低秩矩阵(W=W0+αBA,秩为 16)修改冻结的投影权重(W0)。
- 结果: 这种约束防止了全量微调中出现的“重新收敛”现象。在同一骨干网络上的专家保持了 0.91 的预测相关性(显著低于 0.98),同时保留了高水平的个体准确性。其中最强的专家(由 AffectNet 适配)在表情识别任务上的 Macro-F1 达到 0.4762,优于基础骨干网络。
系统组装:
最终系统对各任务最强成员的预测结果进行平均。
- 效价-唤醒度与 AU: 使用两个骨干网络专家的平均值。
- 表情: 将两个基础 SAL 成员与参数隔离的 LoRA 专家进行平均。
- 校准: 在验证集上拟合每个 AU 的决策阈值以最大化 F1 分数。
- 副产物池化(Byproduct Pooling): 将作为共享潜变量表情头副产物生成的效价-唤醒度预测,作为额外的近等成员池化到 VA 集成中。
关键结果
系统在 s-Aff-Wild2 MTL 验证集(与训练集视频不相交)上进行了评估。
- 基线(Baseline): 主办方的 ConvNeXt 基线得分为 0.45。
- 基础系统: 双骨干网络共享潜变量系统达到了 1.6669。
- 主要结果: 加入 AffectNet 参数隔离专家后,表情得分和总验证得分提升至 1.6949。
- 最强配置: 通过添加更多 LoRA 专家、应用每 AU 校准以及池化共享潜变量 VA 副产物,系统达到了 1.7259 的峰值验证得分。
- 统计显著性: 增益通过对 50 个验证视频进行配对自助法(paired bootstrap)测量。将 VA 副产物加入 VA 集成的提升具有统计学显著性(p=0.005),而其他增益被标注为“在噪声范围内的正向提升”。
意义与主张
论文声称其有三个主要贡献:
- 一种实用的集成规则: 它确立了“强度-对等”规则,明确指出只有当新增成员既具备去相关性又是近等强度时,才会有益。它强调了廉价的差异化来源(如重新随机种子)往往会失败,因为它们缺乏去相关性。
- 一种差异化机制: 它证明了在单个骨干网络上进行参数隔离(LoRA)可以成功制造出去相关的近等强度成员,解决了全量微调中的重新收敛问题,且无需多个预训练的骨干网络。
- 性能表现: 它为第 11 届 ABAW MTL 赛道设定了新的验证基准,显著超越了基线水平。
作者也谦虚地指出了其方法的局限性:一旦池中包含了若干个去相关的近等强度成员,得分就会进入平台期,因为进一步增加的成员要么是高度相关的,要么是较弱的。要填补剩余的差距,需要“真正不同的近等强度表示”,而非仅仅是新的平均策略。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。