← 最新の論文
💻 computer science

LeVo 2: Stable and Melodious Song Generation via Hierarchical Representation Modeling and Progressive Post-Training

LeVo 2は、階層的なモデリング手法と、グローバルな意味論的プランニングとトラック固有の音響的精緻化との間のトレードオフを解決するための漸進的な美学ガイド付きポストトレーニング・スケジュールの採用により、安定し、旋律的で、制御可能なフルレングスの楽曲生成を実現するハイブリッドLLM-Diffusionフレームワークである。

原著者: Shun Lei, Huaicheng Zhang, Dapeng Wu, Yaoxun Xu, Lishi Zuo, Wei Tan, Hangting Chen, Guangzheng Li, Jianwei Yu, Zhiyong Wu, Dong Yu

公開日 2026-06-30
📖 1 分で読めます☕ さくっと読める

原著者: Shun Lei, Huaicheng Zhang, Dapeng Wu, Yaoxun Xu, Lishi Zuo, Wei Tan, Hangting Chen, Guangzheng Li, Jianwei Yu, Zhiyong Wu, Dong Yu

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

ビッグピクチャー:ロボットにヒット曲を書かせる方法

想像してみてください。あなたはロボットに、ゼロからフルレングスの楽曲を作らせる方法を教えようとしています。ロボットは一度に3つの難しいことをこなさなければなりません。

  1. 曲の構成を計画する: メロディ、リズム、そしてボーカルと楽器がどのように調和するかを決定します。
  2. 細部を書き込む: シンガーが人間らしく聞こえ、ギターの音がロボット的ではなく、鮮明に響くようにします。
  3. 指示に従う: もしあなたが「雨についての悲しいフォークソング」を求めたなら、それは明るいロック曲ではなく、実際にその通りの音でなければなりません。

従来のAIモデルは、これらすべてを一つの巨大で混沌としたステップで行おうとしたため、苦戦していました。計画は合っているけれど音質が低かったり、音は素晴らしいけれど曲として意味をなしていなかったりしたのです。

LeVo 2 は、**熟練の指揮者と専門家チーム(ミュージシャン)**が協力し合う仕組みによって、この問題を解決する新しいシステムです。


1. アーキテクチャ:指揮者とミュージシャン

一つの脳がすべてをやろうとするのではなく、LeVo 2 は役割を二つの層に分割しています。これは、**将軍(ジェネラル)と特殊部隊(スペシャルフォース)**の関係に似ています。

  • 将軍 (Mixed Semantic LM): この部分は全体像を見ます。まだギターの弦の細かなディテールには関心を持ちません。代わりに、曲の「骨組み」を計画します。メロディ、テンポ、そしてどこでサビが来るのかといったことです。ボーカルと楽器がうまく調和するように、「混合された」計画を作成します。
  • 特殊部隊 (Track-Specific LM): 将軍が計画を立てたら、次は彼らの出番です。このチームは計画に基づき、高精細なディテールを書き込んでいきます。あるグループはボーカルを完璧にすることだけに集中し、別のグループは楽器の音を完璧にすることに集中します。彼らは並行して作業するため、互いの邪魔をすることはありません。
  • サウンドエンジニア (Music Codec): 最後に、第三のコンポーネントが将軍と特殊部隊からの指示を受け取り、実際に耳で聴くことができる高品質なオーディオ波形へと変換します。

比喩: 家を建てる工程を考えてみてください。将軍は設計図(壁をどこに置くか)を描きます。特殊部隊は、塗装屋や電気技師であり、細かなディテール(塗料の色や配線)を加えます。そしてサウンドエンジニアは、実際に住める状態にするための建設作業員です。

2. トレーニング:ミュージシャンのための3段階の学校

著者たちは、ロボットをいきなり音楽スタジオに放り込んでも、すぐに上手になるとは限らないことに気づきました。そこで、**「自動音楽判定器」に導かれた「3段階のトレーニング・スクール」**を作り上げました。

  • ステージ1:音楽理論のクラス(事前学習)
    ロボットは何千もの楽曲を聴きます。しかし、ただ聴くだけではありません。自動化されたシステムを使用して、楽曲を採点します。まず「上位5%」の楽曲から学びます。これにより、ロボлоトは音楽のルール(メロディやリズム)を学び、何が「良い音」なのかという感覚を掴みます。これは、学生に教える際に、歴史上の名曲だけを見せて教えるようなものです。

  • ステージ2:規律の訓練(段階的な事後学習)
    これでロボットは音楽理論を知りましたが、歌詞を間違えたり、指示を無視したりといったミスをまだ犯すことがあります。

    • まず、教師あり微調整 (SFT) を行います。品質を高めるために、最高級の楽曲のみを使って練習します。
    • 次に、オフラインDPO を行います。これは厳しいコーチのようなものです。ロボットが多くのバージョンの曲を生成し、コーチが「歌詞に最も忠実なもの」と「プロンプトに最も近いもの」を選び出します。これにより、ロボットは「幻覚(歌詞をデタラメに作り出すこと)」を抑え、指示を聞くことを学びます。
    • 最後に、セミオンラインDPO を行います。ロボットは自ら新しい曲を生成し始め、自分自身の改善から学びます。これにより、規律を失うことなく、芸術的な創造性を高めていきます。
  • ステージ3:マスタークラス(モジュール拡張)
    将軍(プランナー)は完璧になり、固定(フリーズ)されます。次に、特殊部隊(ディテール担当チーム)が追加のトレーニングを受けます。彼らは、ラフなスケッチをクリスタルクリアで高忠実度なレコーディングへと変える練習をします。これにより、ボーカルや楽器が豊かで詳細な音になることが保証されます。

3. 「審美的ガイド」

この論文の重要な革新は、自動音楽審美評価フレームワークです。これは、曲を聴いて「音楽性」のスコアをつけるロボットの審判を想像してください。

  • 学習中、この審判は楽曲に「音楽性のティア(階層)」(例:「トップティア」「平均」「低ランク」)をタグ付けします。
  • ロボットは、「トップティア」というタグを見たとき、驚くほど素晴らしいものを生成すべきであることを学びます。
  • これにより、ロボットは単に盲目的に模倣するのではなく、「なぜ一部の曲が他の曲よりも優れているのか」を理解できるようになります。

4. 結果:どれほど優れているのか?

著者たちは、LeVo 2 を他のオープンソースモデルや、有名な商用システム(SunoやMurekaなど)と比較検証しました。

  • オープンソースより優れた性能: LeVo 2 は、メロディ、アレンジ、音質のほぼすべてのカテゴリーにおいて、他のすべてのオープンソースモデルを打ち負かしました。
  • プロに匹敵: 秘密が公開されていないトップクラスの商用システムにも、非常に近いパフォーマンスを示しました。
  • 指示への忠実度: 正しい歌詞を歌い、要求されたムード(感情)に合わせる能力が非常に高く、AIがデタラメな言葉を作り出す「幻覚」を大幅に減少させました。

まとめ

LeVo 2 は、新しいAI音楽生成の手法です。一つの脳がすべてを同時にこなそうとするのではなく、階層的なチーム(プランナーと詳細のスペシャリスト)と、段階的なトレーニング・スクールを使用しています。この学校では、AIにまず音楽理論を理解させ、次にルールに従うことを教え、最後に音を完璧に磨き上げるよう指導します。その結果、驚くほど人間らしく、一貫性のある高品質なフルレングスの楽曲を生成できるシステムが誕生しました。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →