← 最新论文
💻 computer science

Hear to See: Discerning Stateful Listening for Audio-Visual Instance Segmentation

本文提出了 Hear to See (H2S),一种新颖的音视频实例分割框架,该框架利用声学-语义投影器(Acoustic-Semantic Projector)来解耦混合声音,并利用异步动态调制器(Asynchronous Dynamics Modulator)来处理时间错位,在 AVISeg 基准测试上实现了最先进的性能。

原作者: Leiye Liu, Miao Zhang, Jiahong Jiang, Jingjing Li, Jialong Zhong, Kai Peng, Tingwei Liu, Wei Ji, Yongri Piao, Huchuan Lu

发布于 2026-08-05
📖 1 分钟阅读☕ 轻松阅读

原作者: Leiye Liu, Miao Zhang, Jiahong Jiang, Jingjing Li, Jialong Zhong, Kai Peng, Tingwei Liu, Wei Ji, Yongri Piao, Huchuan Lu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你正置身于一个热闹的街头集市。你的眼睛忙着扫视人群,捕捉着杂耍艺人、魔术师和街头音乐人的身影。但你的耳朵听到的却是一片混乱的交响:硬币的叮当声、吉他的嗡鸣声和人群的喧闹声,全都融合在一起,变成了一股巨大的、杂乱无章的声波。长期以来,计算机一直擅长“看”世界,但在尝试“听”世界时却显得力不从心。它们能告诉你那里“有”声音,但往往无法分辨出声音是“谁”发出的,尤其是在多个人同时说话或演奏乐器的时候。这就是“音画理解”(Audio-Visual understanding)的难题:教机器将它所看到的与它所听到的联系起来,不仅是感知一种整体的氛围,还要能够追踪特定的物体,比如某一把特定的吉他或某位特定的歌手。这就像是在嘈at的房间里试图跟进一段特定的对话,同时还要盯着说话人的样子,即便他们在说话过程中停顿了片刻。

这正是名为“听以见”(Hear to See,简称 H2S)的新型计算机模型所要解决的挑战。这项研究背后的研究人员意识到,现有的计算机在处理两个主要问题时会感到困惑。首先,当多种声音混合在一起时,计算机会丢失区分它们所需的细节。其次,声音和视觉并不总是以相同的速度发生;一个人可能在站着不动的同时停止了歌唱,或者在摄像机对焦之前就开始了歌唱。该论文提出了一种巧妙的新方法来解决这个问题,即赋予计算机两种特殊的“超能力”:一种是理顺混乱“声音汤”的能力,另一种是根据环境是混乱还是平静来改变其“聆听速度”的能力。

问题所在:嘈杂且混乱的世界

为了理解为什么这个新模型如此特别,让我们看看传统的计算机是如何尝试解决问题的。想象一名侦探试图将指纹(声音)与嫌疑人(视觉物体)进行匹配。旧的方法试图获取整个指纹,将其稍微模糊化处理以便于处理,然后猜测它属于谁。但当你面对三个同时留下指纹的嫌疑人时,将它们模糊在一起的做法会让辨别身份变得不可能。计算机最终只会猜测:“哦,这里有声音,所以一定有个在那儿的人”,但它无法分辨是“哪个人”,也无法判断声音是否已经停止。

此外,这些旧的侦探非常死板。他们以固定的时间块来观察世界,就像每秒钟检查一次时钟一样。如果一个人在这一秒的中途停止了歌唱,计算机仍然会认为他在唱歌,因为它被困在了这种僵化的日程表中。它无法适应声音消失的情况,导致计算机会对一个沉默的物体产生“幻觉”,认为它仍在发出声音。

解决方案:解开“汤”的纠缠并切换档位

“听以见”(H2S)模型通过两个主要的技巧解决了这个问题,作者称之为声学-语义投影器(Acoustic-Semantic Projector, ASP)异步动态调节器(Asynchronous Dynamics Modulator, ADM)

1. 声音解混器 (ASP)
把音频信号想象成一杯由草莓、香蕉和蓝莓搅拌在一起的巨大奶昔。旧的方法试图通过猜测奶昔的味道来推断里面有什么水果。然而,H2S 使用了一个名为声学-语义投影器的特殊工具,将奶昔重新分离回原始的水果。它将那段混乱、混合的声音拆分为不同的流:一段属于吉他,一段属于尤克里里,一段属于歌手。

在分离声音之后,模型不仅仅是观察音频,它还在“声音的含义”与“物体的位置”之间建立了一座桥梁。这就像是将吉他声音的“概念”与视频中吉他的“形状”相匹配。通过先分离声音,再分步骤将其与视觉世界进行匹配,计算机终于可以宣布:“那个声音属于那把特定的吉他”,即使同时有三把吉他在演奏。

2. 智能速度控制器 (ADM)
第二个技巧关乎时机。想象你在开车。当你行驶在一条笔直、空旷的路上时,你会一路巡航,欣赏前方的风景。但当你遇到一个突发的坑洼或者一个小孩冲进街道时,你会猛踩刹车,全身心地关注眼前的危险。

**异步动态调节器(ADM)**对计算机的“大脑”也起到了同样的作用。它使用一种特殊的记忆系统(基于一种被称为 Mamba 的技术),这种系统可以改变其运行速度。

  • 当情况混乱时: 如果声音突然开始或停止(例如有人大喊或门砰地一声关上),模型会感知到这种变化并加快注意力。它会高度专注于“当前时刻”,以捕捉突发的变化,确保不会错过新声音,也不会持续追踪一个已经沉默的物体。
  • 当情况平静时: 如果场景很稳定且声音很连贯,模型就会放慢速度,回顾历史。它会记住刚才看到了什么,以保持追踪的平滑与稳定。

这种在“快速反应”与“稳定记忆”之间切换的能力,使计算机能够处理现实生活中那种异步的特性——即声音与视觉并不总是完美同步的。

研究发现

研究人员在名为 AVISeg 的数据集上测试了他们的模型,该数据集包含数百个具有复杂声音和视觉场景的视频。他们将“听以见”模型与现有的最先进方法进行了对比。

结果非常令人印象深刻。使用标准的相机骨干网络(在大型数据集 COCO 上训练的 ResNet50),他们的模型达到了 48.54 mAP(衡量检测和追踪物体能力的指标)。这是一个显著的飞跃,比之前的最优方法高出了 7.8%

当他们专门针对最困难的场景进行测试时——即声音是异步(在奇怪的时间点开始或停止)且混合在一起的情况——他们的模型表现得更加出色。在一个专门的“异步子集”数据上,他们的模型得分高达 46.75 mAP,而之前的最优方法仅能达到 32.66 mAP。这是一个高达 14.09 mAP 的巨大提升,证明了模型通过调整速度和解开声音纠缠的能力在混乱环境下表现极其优异。

为什么这很重要

这篇论文表明,通过赋予计算机“解混”声音和根据世界运动情况“切换档位”的能力,我们可以让它们更出色地理解视频。计算机不再仅仅看到一片活动的模糊影像,而是可以区分出是沉默的吉他还是正在演奏的吉他,或者在歌手中途停止歌唱时依然能精准追踪。

作者指出,虽然这种方法在观看录制好的视频(离线模式)方面效果极佳,但尚未在实时(在线)场景中进行测试,因为在实时场景下,计算机无法通过“向后看”来预知接下来会发生什么。但就目前而言,“听以见”证明了,凭借正确的声学分离与智能时机控制,机器终于可以像看世界一样清晰地“听”世界。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →