← 最新论文
💻 computer science

PRIMED: Adaptive Modality Suppression for Referring Audio-Visual Segmentation via Biased Competition

本文介绍了 PRIMED,这是一种新颖的指代性音视频分割框架,它利用偏置竞争理论,通过模态先验解码器和令牌蒸馏器自适应地抑制无关模态,并基于每个指代表达的具体需求动态调整注意力机制,从而实现了最先进的性能。

原作者: Yuchen He, Jing Zhang

发布于 2026-05-12
📖 1 分钟阅读☕ 轻松阅读

原作者: Yuchen He, Jing Zhang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是用简单语言和创造性类比对论文PRIMED的解释。

宏观图景:“三头怪兽”问题

想象一下,你正试图在一个拥挤嘈杂的房间里,根据“那个正在吹长笛的人”这样的描述,找到特定的人。

  • 你的眼睛(视觉): 你看到了许多人。有些人穿着红色衣服,有些人在跳舞,有些人拿着乐器。
  • 你的耳朵(听觉): 你听到了长笛声、鼓声和吉他声。
  • 你的大脑(文本): 你拥有“那个正在吹长笛的人”这句话。

当前人工智能系统的问题在于,它们将所有这些线索视为一杯巨大而混乱的混合果汁。它们将长笛的声音、舞者的身影以及“吹长笛”这几个字混合在一起,而没有决定哪个线索最重要。如果鼓声非常响亮,人工智能可能会分心并指向鼓手,即使文本说的是“长笛”。

PRIMED 是一个旨在解决这一问题的新人工智能系统。它就像一个聪明的侦探,知道何时倾听眼睛,何时倾听耳朵,以及何时信任书面线索。


PRIMED 如何工作:“偏向竞争”理论

该论文灵感来源于神经科学中的一个概念,称为偏向竞争(Biased Competition)

类比:才艺表演
想象一场才艺表演,舞台上同时有许多节目(一名歌手、一名魔术师、一名杂耍者)。评委(人工智能)的注意力是有限的。

  • 自下而上: 所有节目都在大声喧哗和表演(这是原始的视频和音频数据)。
  • 自上而下: 主持人宣布:“我们要找的是魔术师!”(这是文本描述)。

在旧的方法中,评委试图同等地观看所有人,结果被响亮的歌手搞得困惑不堪。
PRIMED中,评委利用主持人的公告来偏向竞争。他们主动抑制歌手和杂耍者,以便完全专注于魔术师。

PRIMED 通过三个主要步骤来实现这一点:

1. “模态先验解码器”(聪明的侦探)

在人工智能甚至开始查看视频之前,它会阅读文本描述并问道:“这项任务主要是关于我听到的、看到的,还是两者的混合?”

  • 如果文本说“响亮的鼓声”,人工智能就知道要更信任它的耳朵。
  • 如果文本说“红色的汽车”,它就知道要更信任它的眼睛。
  • 它创建一个**“模态先验”**——一个心理备注,说明“将 80% 的注意力集中在音频上,20% 集中在视频上”。这个备注作为一个过滤器,用于忽略无关的噪音。

2. "Token 蒸馏器”(全局 GPS)

有时,只看单帧画面会让人困惑。你可能看到一只手拿着长笛,但这是正确的手吗?
PRIMED 对整个视频最重要的视觉信息进行一次“快照”,并将其压缩成几个紧凑的 Token(就像一组 GPS 坐标)。

  • 这些 Token 在人工智能处理的所有阶段中共享。
  • 类比: 想象你在城市里导航。与其只盯着你站立的街角,不如手里还有一张显示整个城市的地图。这张“全局地图”帮助人工智能保持一致性,不会迷失在局部细节中。

3. “竞争”(最终对决)

现在,人工智能将文本线索、音频线索和视觉线索结合在一起。

  • 由于模态先验(步骤 1),人工智能知道哪些线索应该被赋予高权重。
  • 由于全局地图(步骤 2),它知道目标在大局中应该位于何处。
  • 它们为争夺注意力而“竞争”。不相关的线索(例如,当你寻找长笛时响亮的鼓声)会被抑制(静音),而正确的线索会被增强(放大)。

额外润色:“空间感知语义对齐”

为了确保人工智能不会意外抓取背景(例如长笛演奏者身后的墙壁),研究人员添加了一条特殊的训练规则。

  • 类比: 这就像老师告诉学生:“确保你看着的是长笛,而不是它后面的墙壁。”
  • 人工智能被训练为将“长笛”信号从“墙壁”信号中推开,使最终的画面更加清晰和准确。

他们发现了什么?

该论文在基准数据集(带有文本描述的视频集合)上测试了 PRIMED。

  • 结果: PRIMED 击败了所有先前的方法。即使在有很多干扰(如噪音或令人困惑的视觉效果)的情况下,它也更擅长找到正确的物体。
  • 成功原因: 通过明确决定信任哪种感官(视觉与听觉),而不是盲目地混合它们,人工智能变得更加稳健。它能够处理文本描述模糊或环境嘈杂的棘手情况。

总结

PRIMED 是一个不再试图成为“万事通”,而是转变为聪明战略家的人工智能。它阅读指令,决定使用哪些感官,过滤掉干扰,并利用全局地图找到确切的目标。它将声音、视觉和文字的混乱混合体转化为清晰、准确的答案。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →