← 最新论文
💻 computer science

A Self-Supervised Approach for Minimal-Annotation Hydroacoustic Data Exploration

本文提出了一种利用掩码自编码器(Masked AutoEncoders)和聚类算法的自监督流水线,用以高效地探索和分类大规模、极少标注的水声数据,并成功识别了来自马约特岛(Mayotte Island)多年期数据集中的多种海洋及人为信号。

原作者: Pierre-Yves Raumer, Axel Marmoret, Dorian Cazau, Anatole Gros-Martial, Richard Dreo, Maelle Torterotot, Sara Bazin, Flore Samaran, Jean-Yves Royer

发布于 2026-07-10
📖 1 分钟阅读☕ 轻松阅读

原作者: Pierre-Yves Raumer, Axel Marmoret, Dorian Cazau, Anatole Gros-Martial, Richard Dreo, Maelle Torterotot, Sara Bazin, Flore Samaran, Jean-Yves Royer

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你是一名正在一个永不停歇地说话的房间里破案的侦探。这个房间就是深海,而所谓的“说话”是鲸鱼、火山、船只和地震发出的巨大且持续的录音。问题在于?这段录音如此庞大且嘈杂,人类侦探需要听上几个世纪才能找到其中有趣的片段。通常情况下,科学家们必须手动标记他们听到的每一种声音,这就像是在徒手整理一座乱七八糟的乐高积木山。

这篇论文介绍了一种全新的、超级聪明的机器人侦探,它不需要说明书就能开始工作。它使用了一种“自监督”方法,这就像是给机器人一盒乱七八糟的乐高积木,然后对它说:“通过尝试重建缺失的部分,来弄清楚这些零件是如何组合在一起的。”

机器人的训练:“填空”游戏
这个被称为掩码自编码器(Masked AutoEncoder,简称 MAE)的机器人,首先开始玩一场“填空”游戏。科学家们拍摄了一张声音的图像(称为频谱图,看起来像是一张随时间变化的频率彩色地图),然后用黑色遮罩盖住了其中 50% 的部分。机器人的任务是观察可见的部分,并猜出隐藏的部分看起来是什么样子的。为了做到这一点,它必须学习海洋的秘密模式:鲸鱼的鸣叫看起来是什么样的,船只引擎的轰鸣声是什么样的,以及地震的震动声是什么样的。它在来自印度洋的大规模数据集上进行了练习,这些数据涵盖了从 2009 年到 2024 年、分布在 34 个不同地点的录音。

大招:整理混乱的房间
在这里,这篇论文做出了一个关键举措。许多其他方法试图一次性观察整个房间并说:“这整个小时的声音听起来都像是一头鲸鱼。”但在海洋中,声音经常重叠——当一艘船经过时,一头鲸鱼可能正在歌唱。如果你观察整个房间,你只会得到一团混乱的混合物。

这篇论文认为,观察整个房间是个坏主意。相反,他们的机器人将声音图谱分解成微小的 16x16 块(patches)。它单独观察每一个小块。如果一个小块只是背景噪声(比如静电噪音),机器人就会忽略它。如果一个小块包含某种声音,机器人就会将附近的“声音块”组合成一个单一的“事件”。这就像是在尝试搭建城堡之前,先按颜色和形状对乐高进行分类。通过先将重叠的声音分离成独立的事件,即使鲸鱼和船只同时发生,机器人也能分辨出它们的区别。

发现:在混沌中寻找规律
一旦机器人从整个多年数据集里整理出所有这些微小的声音事件后,它会使用一种特殊的制图工具(称为 UMAP)和一种聚类算法(HDBSCAN)将相似的事件聚集在一起。

结果令人印象深刻。机器人发现了 317 个不同的簇。随后,一位人类专家仅花了不到 一小时 的时间观察这些组群并对其进行标注。他们发现了:

  • 已知信号: 南极蓝鲸、细纹鲸、小须鲸,甚至还有稀有的奥穆拉鲸。他们还发现了来自 Fani Maoré 火山的地震信号以及船只噪音。
  • 未知信号: 机器人发现了 五种 人类尚未完全表征过的声音类型,包括一种神秘的“8 秒脉冲”和一个“42 Hz 信号”。

论文指出,这种方法在发现季节性模式方面非常有效。例如,它准确地捕捉到了细纹鲸的鸣叫在某些年份(2021、2024 和 2025 年)消失的情况,以及地震活动随时间减少的情况,正如科学家所预期的那样。

效果如何?(现实检验)
研究人员并没有仅仅说“它有效”;他们还对这个机器人进行了测试。他们将机器人与两个现有的专门检测器(一个基于鲸鱼鸣叫模式,另一个是基于名为 YOLO 的监督式 AI 模型)进行了对比。

  • 结论: 机器人的表现与这些现有检测器相当。它在寻找鲸鱼和地震方面的准确度达到了类似水平。
  • 注意点: 论文谨慎地指出,虽然机器人非常擅长寻找模式季节性趋势,但它并不能以 100% 的精确度识别出每一个声音。它是一个“探索工具”,而不是一个能瞬间解决一切问题的魔杖。
  • 排除项: 论文明确反对那些在不先将其分解为独立事件的情况下,试图分析整个音频窗口的方法。他们发现,如果简单地将所有的声音块平均化,机器人的表现会变得差得多。他们还发现,跳过初始的“预训练”阶段(即在大型数据集上进行预训练)会显著降低机器人的准确性,这证明了“填空”式的练习是必不可少的。

核心总结
这篇论文表明,我们不需要花费数年时间手动标注海洋声音来理解它们。通过教计算机玩“填空”游戏,并让它将声音分类成一个个小堆,我们可以快速揭开海洋的秘密。机器人找到了已知的鲸鱼,追踪了火山喷发,甚至发现了人类尚未完全理解的新奇、神秘的声音——而这一切仅仅依靠人类的一小时帮助。这是一种强大的新方式来倾听海洋,将一座噪音之山转化为清晰的生命与地质图谱。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →