← 最新论文
💻 computer science

LightAVSeg: Lightweight Audio-Visual Segmentation

LightAVSeg 是一个轻量级的音视频分割框架,它通过将计算代价高昂的密集跨模态注意力机制替换为具有线性成本的解耦设计(用于语义过滤和空间定位),并辅以辅助对齐损失以增强训练一致性,从而实现了最先进的效率与性能。

原作者: Qing Zhong, Guodong Ding, Lingqiao Liu, Zaiwen Feng, Lin Yuanbo Wu, Angela Yao

发布于 2026-05-12
📖 1 分钟阅读☕ 轻松阅读

原作者: Qing Zhong, Guodong Ding, Lingqiao Liu, Zaiwen Feng, Lin Yuanbo Wu, Angela Yao

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你正身处一个热闹的派对。许多人正在交谈,音乐在播放,酒杯在碰撞。你的目标是将摄像机对准正在说话的具体人物,在屏幕上突出显示他们,同时忽略其他人。这正是**视听分割(AVS)**试图完成的任务:它在视频中找出“发声物体”,并为其勾勒出精确的轮廓。

问题在于,目前执行此任务的最佳计算机就像庞大而沉重的超级计算机。它们试图一次性将视频中的每一个像素与每一个声波进行比较。这就像试图与房间里每个人同时交谈,以弄清楚谁在说话。这消耗了过多的算力和时间,导致无法在普通智能手机上运行。

LightAVSeg 是一种全新的轻量级解决方案,旨在解决这一问题。以下是其工作原理,使用简单的类比进行说明:

1. 旧方法:“巨型网格”

以前的模型试图构建一个巨大的网格,在其中检查声音与图像像素之间的每一种可能连接。

  • 比喻:想象一下,试图在人群中找一位朋友,方法是询问房间里每一个人:“你在说话吗?”,然后将这些回答与房间里每一张脸进行交叉比对。这很准确,但既令人疲惫又缓慢。
  • 结果:这些模型对于手机来说过于沉重。

2. LightAVSeg 方法:“智能过滤器”

作者意识到,你不需要将每一个像素与每一个声音进行比对。你可以将工作分为两个更简单的步骤:什么在发出声音,以及它在哪里

步骤 A:“语义过滤器”(是什么)

LightAVSeg 不使用巨型网格,而是采用互惠视听编码器。你可以将其想象为派对上的智能保安

  • 保安聆听音频(声音)。
  • 保安瞥一眼视频(视觉场景)。
  • 如果视频显示一只狗在吠叫,保安会说:“好的,我在听狗叫。”如果视频显示一辆车,保安会说:“好的,我在听车声。”
  • 神奇之处:保安不需要检查每一个像素。他们只需根据所见内容过滤他们正在寻找的声音类型。这被称为语义过滤。因为它是对物体类型进行简单的“是/否”检查,而不是构建每个位置的复杂地图,所以速度很快。

步骤 B:“空间定位”(在哪里)

一旦保安知道了要找什么跨模态融合解码器就会像聚光灯一样发挥作用。

  • 它接收“是什么”(例如,“狗”),并在视频上投射聚光灯,以精确定位狗在哪里
  • 它不是构建复杂的地图,而是简单地在视频层中添加一个“提示”,说:“嘿,在这里找狗。”
  • 神奇之处:这一步是线性的,意味着如果视频变大,工作量只会略微增加,而不是呈指数级增长。这就像在房间里走动去找狗,而不是检查地板的每一寸。

3. “训练作弊表”(辅助损失)

论文提到了一种仅在计算机学习(训练)期间使用的特殊技巧,称为多尺度视听对齐损失

  • 比喻:想象一位老师帮助学生学会找狗。老师指着狗说:“看?声音就在这里。”
  • 这帮助学生快速建立声音与位置之间的联系。
  • 关键点:一旦学生(AI)学会了课程,老师(额外的损失函数)就会被送回家。在实际测试期间,学生不需要老师。这意味着最终应用程序的运行速度与老师从未存在时一样快,但学生却聪明得多。

结果:快速且准确

论文声称,LightAVSeg 是移动设备的游戏规则改变者:

  • 体积:它非常小。其大小约为以前最佳模型(如 AVSegFormer)的1/7
  • 速度:在高端手机芯片(骁龙 8 Elite)上,其运行时间约为163 毫秒。这比重型模型快约8 倍
  • 准确性:尽管体积小且速度快,但在复杂测试中,它的准确性实际上高于重型模型。它成功地将发声物体的定位精度(mIoU)提升至50.4,击败了重型竞争对手。

总结

简而言之,LightAVSeg 停止试图一次性完成所有事情。它不再进行庞大而缓慢的计算,而是采用两步流程:首先,使用智能过滤器决定要听什么声音;其次,使用简单的聚光灯找到它在哪里。它在练习时有老师指导,但在正式比赛中则独立运行,使其成为第一个功能强大到足以在你的手机上流畅运行,并能精确定位发声源模型的模型。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →