← 最新论文
🧬 biology

YAPAT — An Open-Source Platform for Active and Weakly Supervised Annotation of Passive Acoustic Monitoring Data

YAPAT 是一个开源的基于 Web 的平台,它通过整合基于本体的标注、多标签主动学习以及双重冷启动机制,简化了被动声学监测数据的规模化标注流程,旨在减少专家工作量并生成高质量、具有互操作性的数据集。

原作者: Thiago S. Gouvêa, Rida Saghir, Prathmesh P. Doddanawar, Novruz Mammadli, Pratik P. Sitapara, Hannes Kath, Daniel Sonntag

发布于 2026-07-31
📖 1 分钟阅读☕ 轻松阅读

原作者: Thiago S. Gouvêa, Rida Saghir, Prathmesh P. Doddanawar, Novruz Mammadli, Pratik P. Sitapara, Hannes Kath, Daniel Sonntag

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 ⚕️ 这是一篇未经同行评审的预印本的AI生成解释。这不是医疗建议。请勿根据此内容做出健康决定。 阅读完整免责声明

想象一下,大自然是一个永不停歇、24小时不间断广播的巨型电台。它播放的不是音乐,而是青蛙、鸟类、昆虫和鲸鱼的歌声。科学家们使用一种被称为被动声学监测(PAM)单元的特殊麦克风,来录制这些声音,时长可以达数天、数周甚至数年。这对于理解自然而言是一种“超能力”,因为它让研究人员无需踏入自然环境,也不必惊扰动物,就能聆听整个生态系统。然而,这里存在一个巨大的问题:这些麦克风录制的音频量如此之大,以至于文件堆积成了一座人类无法听完并记录下来的大山。这就像是试图读完一座城市规模图书馆里的每一本书,只不过这些书是由声音组成的。

为了解决这个问题,科学家们使用计算机来协助“聆听”。但计算机只有在接受了示例教学后才会变得聪明。为了教会计算机识别某种特定的青蛙叫声,人类专家必须先聆听并标记数千条录音,说明“是的,这是青蛙”或者“不,这只是风声”。这个过程既缓慢、枯燥又昂贵。如果专家们忙于标记数据,计算机就无法学习,而那些音频数据大山也只能成为无用的堆积物。这个领域的核心问题是:我们如何让计算机从这些海量的音频档案中学习,而不需要人类先去聆听其中的每一秒钟?

这就是名为 YAPAT(又一个 PAM 注释工具,Yet Another PAM Annotation Tool)的新型工具登场的地方。把 YAPAT 想象成一个针对自然界声音的高科技、互动式侦探游戏。它并不强迫人类逐一聆听每一条录音,而是利用巧妙的计算机技巧来承担繁重的工作。它首先将长音频文件切分成微小的 3 秒片段。然后,它使用一个预训练的“大脑”(称为 BirdNET)将每个片段转化为一个独特的数字指纹。

YAPT 的魔力在于它如何帮助人类专家。想象一下,你正在观察一张由所有声音指纹组成的巨大地图。YAPAT 不仅仅是向你展示一个随机列表;它更像是一个智能向导。即使你最初没有任何已标记的数据,它也有三种主要方式可以带你入门:

  1. “相似物”搜索: 如果你有一段特定动物的清晰录音,你可以上传它。YAPAT 会瞬间在你的海量档案中找到所有听起来相似的 3 秒片段,让你能够一次性标记一大批数据。
  2. “文件级”猜测: 如果你有一个文件夹的录音,你只知道里面有哪种动物(但不知道具体在什么时候),YAPAT 可以使用一种称为“弱监督”的技术来猜测该动物在文件中的具体位置。这就像是在看一张派对的照片,根据人群的能量来猜测谁在跳舞,即使你并没有直接拍摄舞池的特写。
  3. “智能分类”: 一旦计算机开始学习,它就不再展示随机的片段。相反,它会使用一种特殊的评分系统,向你展示它最困惑的片段,或者是那些与它已知知识最不相似的片段。这确保了人类专家只把时间花在那些能给计算机带来最多教益的片段上,而不是浪费在简单或乏味的例子上。

YAPAT 还将这些声音标签与官方科学词典(本体论)相连接,确保当科学家说“树蛙”时,全世界的人理解的意思都是完全一样的,从而使数据在未来的研究中具有可重用性。

论文将 YAPAT 描述为一个将所有这些功能整合在一起的网络平台。作者在名为 AnuraSet 的真实数据集上测试了该系统,该数据集包含超过 30,000 个青蛙的声音片段。他们发现该系统运行速度极快,具备交互性。例如,即使在拥有数千个片段的情况下,搜索相似声音也只需不到一秒钟。训练计算机识别新模式在标准计算机上仅需几秒钟,在功能强大的计算机上则更快。该系统设计为开源,这意味着任何人都可以下载它,在自己的服务器上进行设置,并开始组织自己的声音档案。

作者谨慎地指出,虽然 YAPAT 是一个强大的工具,但它并不是解决一切问题的“魔杖”。它依赖于“BirdNET”这个大脑,而 BirdNET 最初是针对鸟类训练的,因此在没有额外调整的情况下,它在处理其他类型的动物(如蝙蝠或鲸鱼)时可能并不完美。此外,该系统目前将声音切分为固定的 3 秒块,这意味着如果声音恰好落在切割边缘,它无法精确到毫秒级的起始或结束。然而,通过结合智能搜索、弱监督和主动学习,YAPAT 成功地架起了连接海量、难以管理的音频档案与高质量、已标记数据之间的桥梁,助力科学家理解生物多样性。它将“聆听一切”这一不可能完成的任务,变成了一个人类与计算机协同工作的、可管理的协作游戏,共同解码自然的旋律。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →