← 最新论文
⚡ electrical engineering

Assessing AI-generated music detection in real-world broadcast monitoring

本文引入了 BAMM,一个包含 40 小时电视录制内容的真实世界数据集,旨在证明与洁净或合成环境相比,现有的基于 CNN 的 AI 生成音乐检测器在应用于实际广播监测条件时,存在性能严重下降和可靠性不足的问题。

原作者: David López-Ayala, Fernando García de la Cruz, Pablo Zinemanas, Emilio Molina, Martín Rocamora

发布于 2026-08-10
📖 1 分钟阅读☕ 轻松阅读

原作者: David López-Ayala, Fernando García de la Cruz, Pablo Zinemanas, Emilio Molina, Martín Rocamora

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你是一名正在嘈杂拥挤的房间里破解谜题的音乐侦探。在这个房间里,有两种类型的歌手:真实的真人以及一种能够通过学习数百万首歌曲来完美歌唱的新型机器人。你的任务是识破那个机器人歌手。在安静的工作室里,这很容易;机器人的声音带有一种只有拥有超常听力的侦探才能捕捉到的微小、隐形的“瑕疵”。但如果这个机器人试图在人群的呐喊、警笛的鸣叫以及通过廉价且带有杂音的收音机传输声音时进行演唱,情况会变成怎样?这就是广播监测的世界——它是研究电视和广播上实际播放内容的科学,而在那里,音乐很少是独自存在的。音乐通常很短,隐藏在对话背后,或者被低劣的信号质量所掩盖。随着 AI 音乐变得越来越普遍,公司和政府需要知道:当房间陷入混乱时,我们现有的“侦探”是否仍能找到那些机器人歌手,还是会因此感到困惑并彻底错过它们?

这篇题为《评估现实世界广播监测中的 AI 生成音乐检测》的论文,是对这些侦探的一次现实检验。作者们来自一个音乐技术实验室和一个版权许可公司,他们意识到以往的大多数测试就像是在风暴来临前,站在一个空气调节良好的宁静房间里进行练习。他们构建了一个名为 BAMM(广播 AI 音乐监测)的新工具,这是一个包含 40 小时真实电视录音的海量库。这不是计算机模拟;它是真实的电视片段,其中 AI 音乐和人类音乐在新闻、广告和节目背景中播放,正如它们在现实世界中发生的那样。

研究人员对两种不同类型的“侦探”计算机进行了测试。第一种是 CNN Clean,它仅在安静工作室中的高质量完美音乐上进行了训练。第二种是 CNN Broadcast,它是在听起来像电视那样杂乱、混合的音频上进行训练的。他们针对三个难度等级对它们进行了测试:

  1. 安静工作室:完美、清晰的音乐。
  2. 伪电视:在受控的计算机模拟中,将音乐与语音混合。
  3. 真实电视:来自 BAMM 数据集的实际 40 小时真实广播片段。

以下是他们的发现。在安静的工作室里,两名侦探几乎都是完美的,捕捉到机器人歌手的成功率接近 100%。但一旦进入“伪电视”场景,仅在安静音乐上训练的侦探(CNN Clean)就完全迷失了方向,其成功率降至仅 34%。在杂乱音频上训练的侦探(CNN Broadcast)表现稍好,达到了 66%,证明了在杂乱数据上进行训练是有帮助的。然而,当他们转向真实电视场景——即真实电视广播中那种未经剧本编写的混乱场面时——两名侦探都表现得非常糟糕。受“干净”训练的侦探成功率降至 18%,即使是受过“广播”训练的侦探也仅达到了 47%。

最令人担忧的发现是,在真实的电视世界中,人类音乐和 AI 音乐的分数开始变得完全一样。侦探们再也无法区分它们了。论文指出,计算机在安静工作室中寻找的那些“瑕疵”,在音乐变短、与说话声混合或被压缩进低质量信号时,会被完全冲刷掉或隐藏起来。虽然在杂乱数据上进行训练能让检测器变得更强韧一些,但这还不足以解决问题。作者得出结论:我们目前的方法尚未准备好在电视和广播的现实世界中可靠地识别 AI 音乐,我们需要更聪明的侦探来应对这些噪音。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →