← 最新论文
💻 computer science

Not All Modalities Are Equal: Instruction-Aware Gating for Multimodal Videos

本文介绍了 UniMVU,这是一个统一的多模态视频理解框架,它在模态内部和模态层面均采用指令感知门控机制,以动态平衡多样化的输入流并减轻干扰,从而相较于静态融合基线在六个基准测试中实现了显著的性能提升。

原作者: Bonan Ding, Umair Nawaz, Ufaq Khan, Abdelrahman M. Shaker, Muhammad Haris Khan, Jiale Cao, Jin Xie, Fahad Shahbaz Khan

发布于 2026-05-27
📖 1 分钟阅读☕ 轻松阅读

原作者: Bonan Ding, Umair Nawaz, Ufaq Khan, Abdelrahman M. Shaker, Muhammad Haris Khan, Jiale Cao, Jin Xie, Fahad Shahbaz Khan

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在试图解开一个谜团,但你拥有一个由四位不同侦探组成的团队:一位只看图片,一位只听声音,一位只感知物体的形状(3D 深度),还有一位则观看整个事件的高速、超快回放。

在过去,当人工智能模型尝试解决视频问题时,它们会平等地对待所有这些侦探。它们只是将所有报告一股脑地堆在一起,然后让“首席”(大型语言模型)去找出答案。问题在于:如果问题关乎声音(例如,“正在演奏什么乐器?”),首席就会被图片侦探关于颜色的报告分散注意力;如果问题关乎空间(例如,“椅子在哪里?”),声音侦探关于音乐的报告就只会变成噪音。这被称为模态干扰——错误的线索淹没了正确的线索。

这篇论文介绍了一个名为UniMVU(统一多模态视频理解)的新系统,它就像这支侦探团队的智能交通指挥官指挥家

以下是它的工作原理,使用简单的类比来说明:

1. “指令感知”指挥家

核心思想是:每位侦探的重要性会根据所提出的具体问题而变化。

  • 旧方法(统一融合):指挥家让所有四位侦探以相同的音量喊出他们的线索,无论问题是什么。
  • UniMVU 方法:指挥家先阅读问题。
    • 如果问题是“狗在对什么吠叫?”,指挥家会将音频侦探的音量调至 100%,并将深度侦探的音量调低至耳语。
    • 如果问题是“房间里有多少张桌子?”,指挥家会提升3D/深度侦探的音量,并调低音频侦探的音量。

论文将这种方法称为指令感知门控。它就像为每种信息类型配备了一个智能调光开关,由你提出的具体问题来控制。

2. 两级控制

UniMVU 不仅仅是简单地调高或调低整个团队的音量;它通过两个巧妙的步骤来实现:

  • 第一级:“聚光灯”(模态内门控)
    想象一下,音频侦探有一段 10 分钟的音乐会录音。其中大部分只是背景杂音,但有 5 秒钟,有人说出了答案。
    UniMVU 的第一项任务就是在这 5 秒钟的音频上打上一道聚光灯,而忽略其余部分。它在将线索传递出去之前,先过滤掉单一种类线索内部的“噪音”。

  • 第二级:“音量旋钮”(模态级门控)
    在为每位侦探报告中的最佳部分打上聚光灯后,UniMVU 决定每位侦探相对于其他侦探应该有多大音量。它使用一个特殊的“控制令牌”(将其想象为一个情绪戒指记分牌),首席看着它来决定:“好吧,今天音频侦探最重要,所以我会先听他们的。”

3. 为什么它更好

论文在六个不同的“谜团游戏”(基准测试)上测试了该系统,这些测试涉及音乐、3D 房间和长视频。

  • 结果:UniMVU 始终比旧方法更正确地解开了更多谜题。在某些情况下,它将得分提高了巨大幅度(在特定评分指标中高达 13.5 分)。
  • 原因:论文表明,该系统实际上学会了模仿人类逻辑。当被问及声音时,它自然地专注于声音;当被问及 3D 空间时,它专注于深度。它不会被不相关的线索搞糊涂。

4. “一刀切”的厨师

通常,要想擅长音乐问题,你需要一位只接受过音乐训练的厨师;要想擅长 3D 问题,你需要另一位不同的厨师。
UniMVU 就像一位能烹饪任何菜肴的主厨。你可以给它一个带声音的视频、一个带 3D 深度的视频,或者一个只有图片的视频,它会使用相同的“门控”食谱来确定那道特定菜肴(问题)需要哪些食材(线索)。你不需要为每种类型的视频准备不同的厨师。

总结

简而言之,UniMVU是一个防止人工智能被过多信息淹没的系统。它不是强迫人工智能同时听取所有内容,而是教导人工智能根据所提出的问题,在正确的时间听取正确的内容。它过滤掉噪音,突出相关线索,并让人工智能以更高的准确度回答问题。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →