← 最新论文
🤖 AI

Knowledge-Guided Multimodal Reasoning over Interacting Streams for Video-Level Ambivalence and Hesitancy Recognition

该论文介绍了 PRISM-AH,这是一个通过对跨模态不一致性进行时序建模并融合来自大语言模型的结构化证据,从而识别视频级矛盾与犹豫情绪的知识引导型多模态框架,在公开测试集上实现了 0.6133 的宏 F1 值。

原作者: Podakanti Satyajith Chary, Barath Parthiban, Pranesh Velmurugan, Adeeba Khan, Nagarajan Ganapathy

发布于 2026-07-29
📖 1 分钟阅读☕ 轻松阅读

原作者: Podakanti Satyajith Chary, Barath Parthiban, Pranesh Velmurugan, Adeeba Khan, Nagarajan Ganapathy

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图仅通过观看一段某人说话的短视频来猜测对方的情绪。这不仅仅是捕捉一个微笑或皱眉;而是要捕捉那些微妙且矛盾的时刻——比如一个人说着“我完全没事!”,但同时声音却在颤抖,眼神在闪躲,并且不停地焦虑地摆弄着手指。科学家们称这种状态为“矛盾心理”(ambivalence)或“犹豫不决”(hesitancy)。这是处于“是”与“否”之间的那种令人困惑的中间地带,也是人们为何经常在尝试改变健康习惯(如戒烟或开始节食)时半途而废的重要原因。对于计算机而言,挑战在于这些混合信号就像是散落在一个人面部、声音和言语中的微小且转瞬即逝的火花。如果你只是将所有这些数据揉成一大堆,计算机就会感到困惑,从而错过正在实时发生的微妙戏剧性。

于是有了 PRISM-AH,一种教计算机识别这些复杂情绪的新方法。研究人员并没有采用将视频、音频和文本数据简单粘合在一起并听天由命的做法,而是构建了一个更像“侦探”而非“计算器”的系统。首先,一个轻量级的“侦察兵”会扫描视频,寻找那个人脸部、声音和言语产生分歧的精确瞬间。随后,它会针对这些时刻写一份简短且结构化的报告,重点标注出冲突之处。接着,一个强大的“侦探”(大型语言模型)会阅读这份报告。但其中的玄机在于:这位侦探并不只是凭直觉猜测,它会遵循一套由人类心理学家提供的特定“专家线索”规则手册。通过将侦察兵的原始数据与侦探的专家推理相结合,该系统能更出色地捕捉到犹豫不决的情绪。

结果令人印象深刻。在包含 152 个隐藏视频的标准测试中,这种新方法取得了 0.6324 的得分(以一个名为宏观 F1 的指标衡量)。为了让你有个直观的概念,之前的最佳尝试(仅使用没有这种特殊侦探逻辑的标准人工智能)得分仅为 0.2827。这意味着新方法比旧基准提高了 2.24 倍

然而,论文也谨慎地指出了一些行不通的方法。研究人员明确排除了“仅仅增加更复杂的特征”或“尝试让 AI 适应特定人群(如了解其年龄或性别)会有所帮助”这一观点。事实上,他们发现,如果让系统基于参与者的属性进行调节,在面对未曾见过的新人时,表现反而会变差。他们还发现了一个关于系统如何处理缺失信息的有趣现象:虽然系统使用了视频、音频和文本,但“文本”(即这个人实际在说什么)是这个谜题中最关键的一块拼图。如果移除语言信息,性能会显著下降。但转折在于:移除音频并不会降低性能,这表明在目前的特定设置下,音频对于决策过程并非必不可少。

这项研究表明,成功的秘诀不在于拥有更多的数据,而在于拥有正确的推理方式。系统的“侦探”部分只有在获得特定的专家线索规则手册时才有效;如果没有这些知识,系统的表现就会跌回基础模型的水平。作者总结道,虽然目前的系统是一个重大的进步,但未来改进最广阔的路径在于增强语言理解能力,因为言语是决策的主要驱动力。他们并未声称已经彻底解决了读取人类情感的问题,但他们证明了,一种结构化的、由知识引导的方法远优于将一切资料丢进搅拌机里的做法。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →