← 最新论文
💻 computer science

Quality-Diversity Search in Sound Generation: Investigating Innovation Engines for Audio Exploration

本文提出了一种新颖的声音生成系统,该系统结合了质量-多样性算法(具体为 MAP-Elites)、专门的组合模式生成网络(CPPNs)以及数字信号处理(DSP)图,旨在自动化地发掘跨越各种时间与上下文维度的多样且创新的合成声音,从而弥合理论上的声音可能性与实际音乐可及性之间的鸿沟。

原作者: Björn {\TH}ór Jónsson, Çağrı Erdem, Stefano Fasciani, Kyrre Glette

发布于 2026-06-09
📖 1 分钟阅读☕ 轻松阅读

原作者: Björn {\TH}ór Jónsson, Çağrı Erdem, Stefano Fasciani, Kyrre Glette

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你是一名音效设计师,正试图为一个电影场景寻找完美的音效,但你并不确切知道那个声音应该是怎样的。你可能会想:“我需要一个听起来像机器人哭泣的声音”,但最好的声音也许是你从未想象过的东西。这就是作者们所解决的问题:你如何找到一个你甚至还不知道其存在的音效?

这篇论文描述了一个数字实验,它就像一场寻找新声音的创意寻宝游戏。与其让一个人去聆听成千上万个随机噪音并从中挑选出最好的一个(这会非常累且缓慢),他们构建了一个计算机系统来替人类进行探索。

以下是他们的“创新引擎”是如何运作的,通过简单的概念进行了拆解:

1. 两个主角:作曲家与评论家

该系统使用了两个协同工作的数字工具:

  • 作曲家(“基因组”): 这是一个由两部分组成的数字配方。

    • 模式生成器 (CPPN): 可以把它想象成一位绘制波浪线的音乐艺术家。这些线条不仅仅是图像;它们是关于声音随时间如何变化的指令。
    • 声音工厂 (DSP 图谱): 这是一个模块化合成器。它接收来自艺术家的波浪线并将其转化为实际的音频,同时添加回声、滤波器或混合不同音调等效果。
    • 类比: 想象模式生成器是一位正在编写食谱的厨师,而声音工厂则是烹饪食物所需的厨房设备。
  • 评论家(“分类器”): 这是一个经过预训练的 AI(称为 YAMNet),它已经聆听了数百万个 YouTube 视频。它知道什么是“狗吠”、“雨声”或“爵士乐”。它并不评判一个声音是否具有“艺术性”,它只判断这个新声音与特定类别的匹配程度。

2. 游戏规则:MAP-Elites

该系统在玩一个名为 MAP-Elites 的游戏。想象一个巨大的地板网格,上面有 521 个方格,每个方格都贴着不同的声音类别标签(如“鼓”、“口哨”、“爆炸”)。

  • 系统生成一个随机的声音配方。
  • 它“烹饪”出这个声音并播放给评论家听。
  • 评论家说:“这听起来有 80% 像‘口哨声’。”
  • 系统尝试将这个声音放入“口哨”方格中。如果它是目前为止发现的最好的“口哨声”,它就会留在那里。如果它是最好的“爆炸声”,它就会被放到那里。
  • 目标不仅仅是找到最好的口哨声,而是尽可能填满网格中的更多方格,并用独特的、高质量的声音填充它们。

3. 寻宝过程中的关键发现

团队协作的力量(作曲家 + 工厂)
研究人员发现,当模式生成器和声音工厂共同进化时,会产生最好的声音。

  • 如果让他们让模式生成器单独工作,声音往往过于简单或古怪。
  • 当他们作为团队协作时,模式生成器可以专注于创造有趣的节奏,而声音工厂则负责处理复杂的纹理。这就像一个爵士乐双人组,一个人演奏旋律,另一个人负责和声;两者结合创造出的东西比任何一方单独创作的都要丰富。

专业化的工作者(“大脑”类比)
研究人员通过一个巧妙的转折,尝试给模式生成器分配专门的工作。他们没有使用一个庞大的全能型模式生成器,而是使用了几个较小的模式生成器,每个都致力于特定的频率范围(例如,一个低音专家和一个高音专家)。

  • 结果: 这提高了系统的效率。这些“工作者”变得更简单、更不容易产生混乱,但它们生产的声音与复杂的全能版本一样出色。这就像雇佣一个专家团队而不是一个过度劳累的通才。

“踏脚石”效应
其中一个最有趣的发现是系统是如何从“噪音”演变为“音乐”的。

  • 系统并没有直接跳跃到完美的小提琴声。它经常走一些奇怪、不太可能的路径。一个声音可能始于“风声”,演变成“金属撞击声”,然后变成“小提琴声”。
  • 类比: 想象攀登一座山。你不会直接瞬间移动到顶峰。你必须穿过山谷,跨越奇特的桥梁。系统证明了有时你必须制造出一种“坏”声音(比如奇怪的机械噪音),才能最终发现一种“好”声音(比如乐器声)。这些奇怪的声音就是“踏脚石”。

时间的重要性
研究人员还测试了声音的时长。他们发现,如果播放 0.5 秒,声音听起来像“鼓”;但如果播放 10 秒,它听起来可能像“静电噪音”。

  • 系统学习到了声音是随时间专业化的。一个在 0.5 秒时是冠军的声音,在 5 秒时往往会变成另一个领域的冠军。系统必须学会为不同的持续时间创建不同“版本”的声音。

4. 结果:一个新的声音库

该系统不仅制作了一个声音,而是创建了一个包含数千个独特合成声音的海量库。

  • 有些听起来像熟悉的乐器(小提琴、鼓)。
  • 有些听起来像自然界(风、水)。
  • 还有一些听起来像是现实世界中不存在的东西。

作者将这些声音发布在网上,以便音乐家和艺术家可以聆听并在自己的创作中使用它们。他们甚至展示了如何利用这些声音来创建自动化的音乐序列。

总结

这篇论文关于构建一个数字探索者,利用进化算法在广袤且未知的可能声音海洋中漫游。通过使用“评论家”来引导搜索,并使用“作曲家”来生成噪音,该系统发现:

  1. 协作(简单部分之间的协作)能创造复杂且高质量的结果。
  2. 专业化使系统更加高效。
  3. 奇特的绕路(踏脚石)对于到达最佳发现是必要的。
  4. 时间会改变声音的身份。

最终目标并不是取代人类作曲家,而是为他们提供一套全新的工具和全新的视角,帮助他们发现那些可能永远无法靠自己找到的声音。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →