← 最新论文
💻 computer science

Liquid Fusion of Heterogeneous Representations Towards General Salient Object Detection

本文提出了 LFNet,这是一个利用液体融合机制动态整合来自 CNN 和状态空间模型(State Space Model)骨干网络的互补光谱表示的新型框架,在多种通用显著性目标检测任务中实现了最先进的性能。

原作者: Ke Chen, Ling Zhou, Guangqi Jiang, Gengshen Wu, Yi Liu, Shoukun Xu

发布于 2026-06-26
📖 1 分钟阅读☕ 轻松阅读

原作者: Ke Chen, Ling Zhou, Guangqi Jiang, Gengshen Wu, Yi Liu, Shoukun Xu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图在一个凌乱的房间里寻找一个特定的、闪闪发光的玩具。为了做好这件事,你需要两种不同的观察世界的方式:

  1. “大局观”观察者(The "Big Picture" Gazer): 这个人会退后一步,观察整个房间,以了解大致的布局和物体可能出现的位置。他们擅长观察整体流向和大形状,但可能会忽略像玩具上的划痕这样微小的细节。
  2. “细节”侦探(The "Detail" Detective): 这个人会凑得非常近。他们擅长捕捉微小的边缘、纹理和锐利的线条,但可能会因为过于专注于细枝末节而忘记了玩具在房间中的实际位置。

长期以来,计算机科学家一直试图构建一种能够完美胜任这两个工作的单一“超级眼”。他们尝试让“大局观”观察者看近一点,或者让“细节”侦探退后一点,但事实证明,这两种思维方式在本质上是不同的。一种就像是在聆听一段流畅、连续的旋律(状态空间模型,或称 SSMs),而另一种则像是分析一组独立的音符网格(卷积神经网络,或称 CNNs)。

问题所在:
本文作者注意到,试图强迫一种类型的“眼睛”去做所有的工作会产生盲点。如果只使用“旋律”风格,就会错过锐利的边缘;如果只使用“网格”风格,就会失去宏观语境。他们意识到,这两种风格实际上是互补的——就像花生酱和果冻,在一起比分开更好吃。

解决方案:“液体融合”(Liquid Fusion, LFNet)
团队构建了一个名为 LFNet(液体融合网络)的新系统。他们并没有强迫两种风格合并为一,而是创建了一个受**液体神经网络(Liquid Neural Networks)**启发的特殊“搅拌碗”。

把这个搅拌碗想象成一位聪明的调酒师:

  • “大局观”观察者(VMamba)是饮料的记忆。它保持着信息的连续流动。
  • “细节”侦探(ConvNeXt)是正在加入的刺激物或新鲜原料。
  • 液体融合(Liquid Fusion)是门控机制。它扮演着智能阀门的角色,决定在每一瞬间注入多少“新鲜原料”。
    • 如果场景需要更多语境,阀门就会打开,让“记忆”流过。
    • 如果场景需要锐利的边缘,阀门就会打开,让“新鲜原料”(细节)混合进来。

这种过程是动态发生的,这意味着系统会随着观察图像的不同部分而瞬间改变想法。它不是一种静态的混合,而是一种根据所见内容进行实时调整的、有生命力的、呼吸着的融合。

“抛光”步骤:显著性引导的上采样(Saliency-Guided Upsampling)
一旦系统完成了大局与细节的混合,它就需要再次放大以展示最终结果。通常情况下,当计算机放大或拉伸图像时,图像会变得模糊或出现像素化(就像低分辨率的照片)。

作者添加了一个名为**显著性引导上采样(SGU)**的特殊工具。想象一下,这是一个高科技的照片编辑器,它不仅仅是拉伸图像,它还会同时观察“频率”(图像的节奏)和“形状”。它确保在图像变大时,边缘依然锐利,物体看起来不会模糊或破碎。它在让物体变得足够大的同时,保留了物体的“灵魂”。

他们测试了什么?
他们不仅仅是在简单的图片上进行测试。他们在五种不同类型的“侦探任务”中进行了测试:

  1. 标准照片 (RGB): 在普通照片中寻找物体。
  2. 3D 照片 (RGB-D): 使用深度传感器(如 3D 摄像头)来寻找物体。
  3. 热成像照片 (RGB-T): 使用热成像摄像头在黑暗中寻找物体。
  4. 视频 (VSOD): 在视频流中寻找移动的物体。
  5. 三模态 (VDT): 同时使用可见光、深度和热成像。

结果:
在每一次测试中,他们的“液体融合”系统都击败了现有的最优方法。它能更准确地发现物体,绘制出更清晰的边界,并且实现这一切时,其使用的“大脑”(参数量)比以前那些沉重且复杂的系统更小、更高效。

总结:
本文声称,通过承认不同的计算机视觉风格拥有不同的“超能力”,并创造了一种智能的、类似液体的实时混合方式,他们构建了一种更好、更快、更准确的计算机识别各类场景中重要物体的方法。他们称之为“液体融合网络”。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →