← 最新の論文
⚡ electrical engineering

SLEEPING-DISCO 9M: A large-scale pre-training dataset for generative music modeling

本論文は、生成音楽モデリングにおける既存の合成データや非代表的なデータセットの限界を克服するために設計された、実際の人気楽曲や世界的に有名なアーティストで構成される新しい大規模なオープンソースデータセットであるSleeping-DISCO 9Mを紹介する。

原著者: Tawsif Ahmed, Andrej Radonjic, Gollam Rabby

公開日 2026-06-24
📖 1 分で読めます☕ さくっと読める

原著者: Tawsif Ahmed, Andrej Radonjic, Gollam Rabby

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

想像してみてください。あなたはロボットに、人間のように歌う方法を教えようとしています。そのためには、膨大な楽曲、歌詞、そして音楽に関する物語のライブラリをロボットに読み込ませる必要があります。長い間、「ビッグテック」企業(Jukeboxの開発元など)は、自分たちの秘密のライブラリを金庫の中に閉じ込めたままにしていました。その一方で、小規模な研究者たちは、ごくわずかな自家製のコレクションや、偽物の音楽で何とかやりくりしなければなりませんでした。

Sleeping-DISCO 9M は、著者たちが構築し、誰もが利用できるように公開した、新しい大規模なライブラリです。以下に、日常的な比喩を用いて、彼らが何を行い、なぜそれが重要なのかを簡単に解説します。

1. 問題点:「空っぽのパントリー」対「秘密の金庫」

音楽のAI研究の世界を、新しいレシピを考案しようとしているシェフたちのグループだと考えてみてください。

  • 大物シェフ(ビッグテック): 彼らは、世界で最も有名な食材(有名アーティストによるヒット曲)が詰まった秘密のパントリーを持っていますが、他の誰にもそれを見せようとしません。
  • 小さなシェフ(研究者): 彼らは、小さな人工的な食材(合成音楽)や、非常に限定的なコレクション(例えば、中国のポップスだけを集めたものなど)を使って料理をしようとしてきました。
  • 「ランダムな」ライブラリ: 他にも大規模なライブラリ(DISCO-10Mなど)は存在していましたが、それらはラベルのない箱が詰まった倉庫のようなものでした。中に音楽が入っていることは分かりますが、それが「誰」が歌ったのか、「何の」曲なのか、あるいは音楽が本物なのか単なるランダムなクリップなのかさえ分かりませんでした。それらはあまりにも乱雑で、本格的な料理(研究)には使い物になりませんでした。

2. 解決策:「超整理された」音楽百科事典

著者たちは Sleeping-DISCO 9M を作成しました。これは単なるMP3ファイルの山ではなく、大規模で完璧に整理された音楽百科事典だと考えてください。

  • 規模: 64万8,000人以上の異なるアーティストによる、約900万曲が含まれています。これは、過去10年間のほぼすべてのヒット曲を収蔵する図書館を持っているようなものです。
  • 品質: 前述の乱雑な倉庫とは異なり、このライブラリは整理されています。すべての曲には詳細な「IDカード」(メタデータ)が付いています。アーティスト、アルバム、リリース年、さらには特定のジャンルによって曲を検索することができます。
  • 多様性: 単なる英語のポップスではありません。英語や日本語から、スワヒリ語やハウサ語に至るまで、169の言語をカバーするグローバルなミックスです。それは、一つのデータセットの中に凝縮されたワールドツアーのようなものです。

3. どのように構築したか:「デジタル司書」

チームは単にランダムなファイルをダウンロードしたわけではありません。彼らは、歌詞や音楽の事実に関する有名なサイトである Genius を訪れる デジタル・ロボット司書(Pythonスクレイパー)を構築しました。

  • ロボットは、何百万ものページを注意深く読み込み、曲のタイトル、アーティスト名、アルバムの詳細、そして歌詞をコピーしました。
  • その後、ロボットはYouTubeへと探しに行き、動画のタイトルが探している曲と実際に一致するかを確認する「スマートマッチ」システムを使用して、実際のビデオリンクを見つけ出しました。
  • 注意点: 著作権の関係で、実際の歌詞や深い「アノテーション」(Geniusのエディターが書いた面白い豆知識)を共有することはできませんでした。しかし、彼らは曲へのリンクや、歌詞の「指紋」(エンベディング)は共有しました。これにより、生のテキストを必要とせずに、コンピュータがその意味を理解できるようになります。

4. なぜこれが大きなニュースなのか

これまで、もし研究者が現実世界の音楽を理解するAIを訓練したいと考えた場合、自分自身で乱雑なコレクションを構築するか、非常に小さく限定的なものを使用しなければなりませんでした。

  • Sleeping-DISCO は、これほどの規模と品質(Maroon 5やShakiraのような実在の有名アーティストを含む)を備えたデータセットが オープンソース として提供された初めての事例です。
  • これは、ビッグ企業の「秘密の金庫」と、独立した研究者の「小さなキッチン」との間の溝を埋めるものです。

5. ライブラリのルール

著者たちは、このライブラリを特定のルール(CC-BY-NC-ND 4.0)の下で共有しています。

  • あなたは、これを研究したり、独自の音楽モデルを構築したりするために使用できます
  • このデータセット自体を販売したり、お金を稼いだりすることはできません
  • データセットを変更して、自分のものだと主張することはできません
  • 歌詞: 曲の実際のテキストは、依然としてロックされています(著作権のため)。しかし、著者たちは、厳格に科学目的で使用することを約束する大学や研究者に対しては、それを共有します。

要約すると: 著者たちは、巨大で、清潔で、多様性に富んだ音楽ライブラリを構築しました。これにより、研究者たちは、AIに現実の音楽を理解させ、生成させる方法を教えるために、ようやく活用できるようになったのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →