LeVo 2: Stable and Melodious Song Generation via Hierarchical Representation Modeling and Progressive Post-Training
LeVo 2 是一个混合了 LLM 与 Diffusion 的框架,它通过采用分层建模方法以及一种渐进式的、以美学为引导的后训练调度方案,解决了全局语义规划与单曲级声学精细化之间的权衡问题,从而实现了稳定、悦耳且可控的全长歌曲生成。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
核心理念:教机器人写出一首热门单曲
想象一下,你想教一个机器人从零开始创作一首完整的歌曲。这个机器人需要同时完成三件极其困难的事情:
- 规划歌曲: 决定旋律、节奏,以及人声与乐器如何配合。
- 编写细节: 确保歌手听起来像真人,吉他声清晰有力,而不是充满机械感。
- 遵循指令: 如果你要求一首“关于雨水的忧伤民谣”,它必须真的听起来像那样,而不是一首欢快的摇滚乐。
之前的 AI 模型之所以表现不佳,是因为它们试图在一个庞大且混乱的步骤中完成所有这些工作。它们要么能把整体规划做好但音质很差,要么音质很好但歌曲逻辑混乱。
LeVo 2 是一个全新的系统,它通过让一个指挥家和一支专业的乐手团队协同工作来解决这个问题。
1. 架构:指挥家与乐手
LeVo 2 并没有让一个大脑尝试做所有事情,而是将任务拆分为两个层级,就像一位将军和一支特种部队。
- 将军(混合语义语言模型/Mixed Semantic LM): 这部分负责全局观。它现在还不必担心吉他弦的微小细节,而是规划歌曲的“骨架”:旋律、节奏以及副歌的位置。它创造了一个“混合”计划,以确保人声和乐器能够和谐共处。
- 特种部队(特定轨道语言模型/Track-Specific LM): 一旦将军制定了计划,这支团队就会接管工作。他们观察计划并填充高清晰度的细节。一组专门专注于让人声听起来完美,另一组则专注于让乐器听起来完美。他们并行工作,因此不会互相干扰。
- 音响工程师(音乐编解码器/Music Codec): 最后,第三个组件接收来自将军和特种部队的指令,并将它们转化为你可以聆听的、高质量的实际音频波形。
类比: 想象建造一座房子。将军绘制蓝图(墙在哪里)。特种部队是油漆匠和电工,负责添加精细细节(油漆的颜色、布线)。音响工程师是施工队,负责真正把房子盖好,让你能够居住其中。
2. 训练:音乐家的三阶段学校
作者意识到,你不能直接把一个机器人扔进录音室就指望它立刻变优秀。他们创建了一个由“自动化音乐评委”引导的三阶段训练学校。
第一阶段:音乐理论课(预训练)
机器人聆听成千上万首歌。但不仅仅是听任何歌——它使用一个自动化系统对歌曲进行评分。它首先从“前 5%”的歌曲中学习。它学习音乐规则(旋律、节奏),并建立起对“好音乐”的感知。这就像通过向学生展示历史上最伟大的经典作品来教学。第二阶段:纪律训练(渐进式后训练)
现在机器人懂得了音乐理论,但它可能仍会犯错,比如唱错词或忽略你的指令。- 首先,它进行监督式微调(SFT):它只在最顶尖的歌曲上进行练习,以提高质量。
- 接着,它进行 离线 DPO:这就像一位严厉的教练。机器人生成许多版本的歌曲,教练从中挑选出最符合歌词且最符合提示词(Prompt)的版本。机器人由此学会停止“幻觉”(编造虚假词汇)并开始听从指令。
- 最后,它进行 半在线 DPO:机器人开始生成自己的新歌,并从自身的改进中学习,在不丢失纪律的前提下提升艺术创造力。
第三阶段:大师班(模块化扩展)
此时,将军(规划者)已经趋于完美并被“冻结”(不再改变)。特种部队(细节团队)接受额外的训练。他们练习如何将一个粗略的草图转化为晶莹剔透、高保真的录音。这确保了人声和乐器听起来既丰富又细腻。
3. “审美指南”
本文的一个关键创新是 自动化音乐审美评估框架。想象一个机器人评委,它听完一首歌后会给其“音乐性”打分:
- 在训练期间,这个评委会为歌曲贴上“音乐性等级”标签(例如:“顶级”、“平均”、“低级”)。
- 机器人学习到,当它看到“顶级”标签时,它应该尝试生成令人惊叹的作品。
- 这有助于机器人理解为什么有些歌曲比其他的更好,而不仅仅是盲目地模仿。
4. 结果:它有多强?
作者将 LeVo 2 与其他开源模型以及一些著名的商业系统(如 Suno 和 Mureka)进行了对比测试。
- 优于开源模型: LeVo 2 在几乎所有类别中都击败了其他开源模型,包括旋律、编排和音质。
- 媲美专业选手: 它非常接近顶尖商业系统的表现,而这些系统通常对其技术细节高度保密。
- 指令遵循能力: 它在演唱正确歌词和匹配情绪方面表现出色,显著减少了 AI 编造无意义词汇的“幻觉”现象。
总结
LeVo 2 是一种全新的 AI 音乐生成方式。它没有让一个大脑尝试同时处理所有事务,而是使用了一个层级化团队(一个规划者和若干细节专家)以及一个循序渐进的训练学校,教会 AI 先理解音乐理论,再学习遵守规则,最后润色音质达到完美。其结果是一个能够生成完整、连贯且高质量,且听起来非常接近真人的歌曲系统。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。