← 最新论文
⚡ electrical engineering

Simple Features and Honest Calibration for Ambivalence and Hesitancy Recognition in Video

本文提出了一种用于识别视频面试中矛盾与犹豫情绪的系统,该系统利用了 ASR 消减时间特征(ASR-erased time features)和情感特化多模态融合技术,并证明了在 ABAW 2026 BAH 挑战赛中,简单的 AP 加权集成配合诚实校准(honest calibration)优于复杂的架构和过拟合的验证策略。

原作者: Vikas Kumar, Aditya Mishra, Haroon R. Lone

发布于 2026-07-14
📖 1 分钟阅读☕ 轻松阅读

原作者: Vikas Kumar, Aditya Mishra, Haroon R. Lone

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你是一名正在试图破解谜团的侦探:这个人是在两种选择之间犹豫不决,还是仅仅在迟疑? 线索隐藏在一个关于某人回答面试问题的短视频中。这篇论文是侦探关于如何使用一套新工具破解此案的报告,更重要的是,它记录了哪些方法没有奏效

巨大的谜团:寻找“摇摆”

目标是识别矛盾与迟疑(Ambivalence and Hesitancy, A/H)——即那种内心“我不确定”的感觉,即一个人被两种力量拉扯的状态。团队在名为 BAH 的数据集上测试了他们的侦探技巧,该数据集包含来自 300 名不同人士的 1,427 段视频。他们必须猜测视频中的人是否表现出了犹豫不决的迹象。

“神奇”线索:转录文本中的“幽灵”

最大的惊喜在于?团队发现了一个没人关注过的“幽灵”信号。

想象一个语音转文本机器人(ASR)正在聆听视频。它的任务是记录下单词。为了让文本变得干净,机器人会删除“嗯”、“啊”以及长久的停顿。但诀窍在于:它无法删除这些声音所占据的时间。

团队意识到,尽管“嗯”之类的词消失了,但它们曾经存在的空白空间在时间戳中依然存在。他们开发了一个名为**“ASR 擦除时间”(ASR-erased time)**的新工具。它测量剩余单词之间的间隙。

  • 为什么很酷: 这个测量间隙的工具被证明是他们发现的最强的非言语线索。它的 AP 为 0.718(衡量线索好坏的指标)。
  • 独立性: 它非常独特,与其他任何线索几乎都没有相关性(相关性仅为 0.11–0.36)。这就像是发现了一个其他侦探从未见过的指纹。

“文本”是主角,“面部”是配角

团队测试了三类主要的线索:文本(他们说了什么)、音频(他们听起来如何)和视频(他们的脸看起来如何)。

  1. 文本是王者: 人们使用的词汇是最好的线索。当他们使用一种专门针对情绪训练的特殊文本模型时,得分达到了 AP 0.811。即使是一个简单的“迟疑标记”列表(例如统计某人说了多少次“但是”或“也许”),其表现也几乎一样出色(AP 0.800)。
  2. 音频是亚军: 如果音频模型是专门针对情绪(而非仅仅是语音)进行训练的,它会很有帮助(AP 0.764)。但如果使用的是通用的语音模型,它几乎毫无用处。
  3. 视频是挣扎的配角: 这是一个残酷的事实。无论他们如何尝试——使用高级的面部扫描模型、追踪眼球运动或观察眉毛的抽动——视频线索始终很弱。它们的 AP 维持在 0.63 到 0.67 之间。论文指出,由于只有 778 个训练视频,计算机无法学会捕捉犹豫不决的细微面部特征。面部提供的信息量显然不足。

“冲突”陷阱:什么没有奏效

许多之前的侦探认为,解决这个问题的关键在于寻找不同通道之间的冲突。他们认为:“如果文本说‘是’,但脸部看起来像是在说‘不’,那就是犹豫!”

团队通过构建一个寻找这些分歧的“冲突机器”来测试了这个想法。

  • 结果: 没有帮助。无论是寻找冲突、忽略冲突,还是以不同的方式拆分数据,结果几乎没有变化(变化小于 0.05)。论文明确排除了“冲突设计”作为秘密武器的可能性。信号并不在通道之间的冲突中,而是在文本和那些间隙之中。

“过拟合”陷阱:不要在测试中作弊

这是关于他们如何获胜的最重要教训。

团队有一个由 124 段视频组成的练习组(验证集)和一个由 525 段视频组成的大型真实测试组。

  • 错误做法: 如果你试图专门针对练习集来调整你的“旋钮”(权重和阈值)以获得最高分,你就是在作弊。团队尝试了这种方法,他们在练习集上的得分高达 0.741,但当他们进行真实测试时,分数跌落到了 0.690。这被称为过拟合(overfitting)——即死记硬背练习题而不是学习知识本身。
  • 解决方法: 他们停止了调整旋钮。相反,他们使用了一个简单的固定规则:0.5(50/50 的猜测线),并根据线索在历史上表现出的准确性进行加权(AP 加权)。
  • 胜利: 通过坚持这种简单、诚实的规则,他们在真实测试上的得分跃升至 0.731。这击败了之前的获胜者(得分 0.694)。

最终计分板

团队将六个不同的“侦探”(模型)组合成了一个团队。

  • 结果: 他们的最终系统在公开测试中取得了 0.731 的 Macro-F1 分数。
  • 他们有多确定? 他们进行了统计检查(“自助法/bootstrap”),发现有 97% 的概率他们的得分确实高于之前获胜者的 0.694。这是一个强有力的领先,但并非绝对锁定。

总结

论文得出结论:要识别犹豫,要倾听文字及其间的沉默,而不是看脸。

  • 不要试图强迫计算机去寻找眼睛和嘴巴之间的“冲突”;这并不奏效。
  • 信任文本以及语音识别留下的“幽灵”时间间隙。
  • 在测试中保持诚实:不要为了在练习测试中表现出色而微调设置,否则你在真实测试中会失败。

该团队的系统是一个简单的单命令脚本,它证明了有时解决谜团最好的方式并不是依靠超级复杂的机器,而是通过对故事间隙进行简单、诚实的观察。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →