Musical Agent Systems: MACAT and MACataRT
本論文は、倫理的な関与と芸術的な誠実さを優先したパーソナライズされた小規模データセットによる学習を通じて、リアルタイムの音楽演奏と協調的な即興演奏を強化するために設計された、2つのヒューマン・イン・ザ・ループ型生成AIシステムであるMACATおよびMACataRTを紹介するものである。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
あなたのコンピュータが、単にダウンロードした曲を再生するだけでなく、あなたと一緒にジャムセッション(即興演奏)することを学習する世界を想像してみてください。これは、コンピュータを使って人間の創造性をシミュレートすることを指す、「ミュージカル・メタクリエイション(音楽的メタ創造)」という洗練された言葉の世界です。この分野の中核にあるのは、「ミュージカル・エージェント」です。これは、音楽的なパートナーとして機能するように設計されたソフトウェアプログラムです。これらは、あなたが演奏しているものを聞き、あなたのスタイルを学び、そしてリアルタイムで独自のパートを即興演奏することができます。これらは、決して疲れず、リズムを外さず、あなたの気分に瞬時に適応できるデジタルなバンドメンバーだと考えてください。
長い間、これらのデジタル・バンドメンバーは、あらゆるジャンルから想像しうる何千もの楽曲を含む、膨大なデータの山で訓練されてきました。その手法は強力ではありますが、ジャズの曲を聴いて学ぶために、これまでに録音されたすべての音源を聴こうとするようなものです。全体の雰囲気は掴めるかもしれませんが、決して「あなた自身」のような音にはなれないのです。研究者たちが投げかけている大きな問いは、「特定のアーティスト独自の声を真に反映させるために、少量のパーソナルな音のコレクションから学習するAIを構築できるか?」ということです。本論文はこの問いを掘り下げ、AIを単なる汎用的なパターン・マシンではなく、倫理的で透明性が高く、深くパーソナルなものにするための方法を探求しています。
デジタル・ジャムセッションへようこそ:MACATとMACataRT
本論文において、研究者の Keon Ju M. Lee と Philippe Pasquier は、2つの新しいミュージカル・エージェント、MACAT と MACataRT を紹介しています。これらは、ミュージシャンが即興で音楽を創造するのを助けるために設計された、2種類の異なるデジタル・サイドキック(相棒)と考えることができます。インターネット全体で学習するのではなく、これらのエージェントは「スモールデータ(小規模データ)」の哲学に基づいて構築されています。犬に芸を教える際、他の犬の動画を100万本見せるのではなく、数個のおやつと自分の声を使って練習する様子を想像してみてください。それがこれらのシステムが行っていることです。彼らは、アーティストが提供した少量の精選されたオーディオ・クリップから学習し、そのアーティスト独自のスタイルを完璧に模倣することができます。
AIバンドメンバーの2つの個性
本論文では、これらのシステムを、バンドにおける2種類の異なるミュージシャンのように、異なる「個性」と働き方を持つものとして提示しています。
1. MACAT:自己聴取型のソロイスト
MACATは、AIが主導権を握ったり、パフォーマンスを牽引したりする必要がある状況のために設計されています。それは、演奏しながら常に自分自身の音を聴いているミュージシャンのように機能します。
- 仕組み: 「自己組織化マップ」を使用しています。これは、似たような音をグループ化するメンタル・マップのようなものです。音が鳴ると、それは結果を聴き、自身のメンタル・マップを確認し、アーティスト自身の録音に見られるパターンに基づいて次に何を演奏するかを決定します。
- 魔法: 「ファクター・オラクル(因子神託)」と呼ばれるツールを使用して、音のシーケンス(連続性)の中にあるパターンを特定します。もしアーティストが速いドラムロールの後に静かなハミングを演奏した場合、MACATはそのシーケンスを学習します。ライブ演奏中、それは自身の最近の「思考」(直前に演奏した音)を見て、新しいアイデアへと進むか、あるいはクールな瞬間を繰り返すために戻るかを判断できます。
- 雰囲気: ソロ・パフォーマンスや、人間側のミュージシャンがAIに音楽のメイン・ドライバー(推進役)をさせたい場合に適しており、ダイナミックで進化し続ける、生命感のあるサウンドスケープを作り出します。
2. MACataRT:協調的なモザイク・アーティスト
MACataRTは、より柔軟なパートナーであり、人間とAIがアイデアを交互に交換する協調的な即興演奏のために設計されています。これは「オーディオ・モザイキング(音声モザイク化)」という概念に基づいています。
- モザイクの比喩: 何千もの小さく異なる色のタイル(オーディオ・クリップ)が入った箱を持っていると想像してください。MACataRTは、あなたが描いている絵にぴったり合うタイルを瞬時に掴み取ることができます。あなたがハイピッチな音を奏でれば、高音のタイルを掴みます。もしあなたが荒々しくスクラッチのような音を出せば、粗い質感のタイルを掴みます。
- 仕組み: これらのタイルを、音の特徴(ピッチや明るさなど)に基づいて2次元空間内に整理します。人間のミュージシャンがその空間内の特定の地点を指し示すと、AIはそのエリアから音を引き出します。
- ひねり: 前身である(オリジナルのCataRTシステムの)要素とは異なり、MACataRTには「タイムマシン」の要素が加わっています。それは、アーティストが通常どのような順番で音を奏でるのかを学習できます。したがって、適切な音を選ぶだけでなく、リズムと流れを維持するために「次の正しい音」を予測することも可能です。これには、リアクティブ(反応型)(あなたの演奏に即座に反応する)と、プロアクティブ(先読み型)(学習されたパターンに基づいて次に何が来るべきかを予測する)の2つのモードがあります。
なぜ「スモールデータ」がすべてを変えるのか
この研究の最も重要な点は、単に音楽が心地よく聞こえることではなく、それが「どのように」実現されるかという点にあります。著者らは、膨大な匿名のデータセット(インターネット全体など)でAIを訓練することはリスクがあると主張しています。それは、ゴッホを少し、ピカソを少し、そしてランダムな街路標識を少しだけコピーした画家が、無秩序で独創性のない混乱した作品を生み出すようなものです。さらに、これは倫理的な問題も提起します。AIは、トレーニングデータに含まれることに同意していないミュージシャンのスタイルを盗んでしまったのではないか、という点です。
パーソナライズされた小規模なデータセットを使用することで、これらのエージェントは両方の問題を解決します。
- 倫理と透明性: AIは特定のアーティスト自身の録音のみで訓練されているため、その音楽がどこから来たのかについて謎がありません。それは明確で誠実なコラボレーションです。アーティストは、AIが何を学んだのかを正確に把握できます。
- 真のパーソナライゼーション: AIはアーティストの鏡となります。それは単に「音楽のように」聞こえるのではなく、「その特定のミュージシャン」のように聞こえます。本論文は、これが人間と機械の間の、より深く意味のあるつながりを生み出すと示唆しています。
実世界のジャムセッション
本論文は研究室の中に留まらず、これらのシステムが実際に動いている様子を示しています。
- MACATは、中国の杭州で開催されたMusicAcousticaフェスティバルにおいて、コレクティブ「K-Phi-A」によって使用されました。そこでは、AIと人間が共に即興演奏を行い、AIがサウンドの形成において主導権を握るアンビエント・エレクトロニック・パフォーマンスの制作を支援しました。
- MACataRTは、パーカッショニストとギタリストのデュオ「KeRa」によって、『Echoes of Synthetic Forest』という楽曲の制作に使用されました。この作品は非常に素晴らしく、2024年AIミュージック・ソング・コンテストのトップ10ファイナリストに選出され、スイスのチューリッヒで演奏されました。これは、これらのスモールデータ・エージェントが、聴衆や審査員の心に響く音楽を創造できることを証明しています。
グリーンで倫理的なボーナス
これらのシステムには隠れた超能力があります。それは環境に優しいことです。大規模なAIモデルの訓練には巨大なスーパーコンピュータが必要であり、大量の電力を消費して大きなカーボンフットプリントを残します。しかし、これらのミュージカル・エージェントは、標準的なノートパソコン(Intel Core i7やApple M2チップを搭載した古いモデルでも可)で訓練することができ、強力な外部グラフィックスカードを必要としません。小規模なデータセットを使用するため、これらはより高速で、安価であり、環境負荷も低くなります。
次なるステップは?
著者らは、これは進行中の作業であることを明確にしています。現在のシステムは短いパターンの特定には優れていますが、より長期的な音楽的ストーリーを理解することについては、さらに改善できる可能性があると示唆しています。将来のバージョンでは、より長いシーケンスを記憶するためのディープラーニング(深層学習)を使用したり、AIがなぜ特定の音を選んだのかをミュージシャンが確認できる「説明可能性(explainability)」を追加したりする可能性があります。また、AIがリアルタイムで自身のミスから学習するフィードバックループを追加し、ジャムセッションをより緊密なものにする計画もあります。
要約すれば、本論文は、AI音楽の未来が、巨大で汎用的なロボットによって人間のアーティストを置き換えることではないことを示しています。それは、アーティストが自身のユニークな声を保ちながら、新しい音を探求することを助ける、カスタムメイドの、倫理的でエコフレンドリーなデジタル・パートナーを与えることです。それは、AIがあなたの「代わりに」演奏することではなく、AIがあなたと「共に」演奏することなのです。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。