MusPyExpress: Extending MusPy with Enhanced Expression Text Support
MusPyExpressは、MusicXMLデータセットから表現テキスト(テンポや強弱など)の抽出と活用を可能にすることで、記号的な音楽モデリングにおける空白を埋め、音符と表現の同時生成や表現条件付きの音楽合成といった新たな生成タスクを促進する、MusPyライブラリの拡張機能です。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
音楽には二つの異なる世界が存在します。一つは、部屋を満たす流動的な波の連なりである、私たちが耳にする「音」の世界です。もう一つは、音楽家がその音を生み出すために用いる「指示書」であり、楽譜として知られる記号の静的なページです。数十年にわたり、コンピュータはオーディオをデータへと変換する最初の世界(音)には非常に長けてきましたが、二番目の世界(楽譜)には苦戦してきました。研究者がコンピュータに音楽を理解させたり、あるいは創造させようとしたとき、彼らはMIDIと呼ばれるデジタル形式に頼ってきました。この形式は、どの音をいつ演奏するかをコンピュータに伝えることには優れており、ロボットのピアニストに対する精密な指示リストのように機能します。しかし、このリストには決定的な層が欠けています。それは、人間の演奏者にどのように感じさせるかを伝える「感情的な指示」です。
西洋の楽譜において、作曲家は音と音の間の空間を、演奏を導く言葉や記符で埋めていきます。これらは単なる提案ではありません。速度、音量、スタイルに関する具体的な命令なのです。作曲家は、ゆっくり演奏するように伝えるために「アダージョ(adagio)」と書いたり、音量が徐々に増していくことを示すために「クレッシェンド(crescendo)」と記したりします。また、鋭く切れたタッチで演奏するか、あるいは滑らかに繋がる流れで演奏するかといった指示を書き込むこともあります。これらの「表現テキスト(expression text)」として知られる指示は、音の連なりを、生き生きと呼吸する芸術作品へと変えるためのロードマップなのです。これまで、コンピュータに音楽を教えるための標準的なツールは、主にこのロードマップを無視しており、音そのものだけが重要であると考えてきました。このギャップにより、コンピュータはメロディを生成することはできても、音楽に人間らしさを感じさせる「ムード」や「緊張感」、あるいは「ダイナミックな抑揚」を容易に生成することができなかったのです。
ある研究チームは、「MusPyExpress」と呼ばれる新しいツールを開発することで、この限界に対処しました。このソフトウェアは、コンピュータ科学者が音楽データを処理するために使用している既存のライブラリをアップグレードしたものです。この新しいシステムは、古いMIDI規格よりもはるかに表現力豊かな、デジタル楽譜に使用される形式である「MusicXML」に含まれる、豊かで詳細な指示を読み取るように設計されています。この拡張機能を構築することで、研究者たちは、テンポの変化を示すテンポ指示から、音の強弱を制御するダイナミクス記号に至るまで、表現テキストの全範囲をコンピュータが抽出・理解することを可能にしました。彼らはこれらの指示を単なる注釈としてではなく、機械に感情を込めて作曲する方法を教えるために、保存・分析・活用できる不可欠なデータポイントとして扱いました。
この新しいツールが現実世界の音楽の複雑さを扱えることを証明するために、研究者たちは22万件以上のファイルを含む膨大なパブリックドメインの楽譜コレクションを用いました。彼らはMusPyExpressを使用してこのライブラリをスキャンし、これらの楽曲の大多数、つまり95パーセント以上が、これらの表現的な指示を含んでいることを発見しました。合計で、ソフトウェアはコレクション全体から350万個以上の個別の記号を特定しました。分析の結果、これらの指示はランダムに散らばっているのではなく、音楽の歴史を反映したパターンに従っていることが明らかになりました。例えば、研究者たちは、19世紀に生きたロマン派の作曲家は、それ以前のバロックや古典派の作曲家よりも、これらの表現的な記号をはるかに頻繁に使用していることを見出しました。これは、ロマン派の作曲家が演奏者を導くために具体的な感情的指示をよく書き込んだ一方で、初期の作曲家は当時の演奏慣習に依拠していたという、歴史的な慣行と一致しています。
また、この研究は、これらの指示の密度が楽曲内でどのように変化するかについても示しました。曲をセクションごとに区切るリハーサルレターのような構造的な記号は、出現頻度が低く、間隔も広く開いています。対照的に、テンポや音量に関する指示は非常に集中することがあり、メロディの即時的な流れを形作るために頻繁に現れます。研究者たちは、リストやドビュッシーのような特定の作曲家がスコアにこれらの詳細を詰め込んでいる一方で、他の作曲家はより控えめに使用していることも観察しました。この表現テキストの詳細なマッピングは、標準的なデジタル楽譜の中にどれほど多くの感情的データが隠されているかという、これまでほとんどのコンピュータモデルにとってアクセス不可能であった明確な姿を初めて描き出しました。
表現テキストを読み取り理解するこの新しい能力を用いて、研究者たちは、コンピュータがこの情報を活用できる3つの異なる方法を実証しました。第一に、人間の作曲家がスコアを書く方法を模倣するように、モデルが音と表現指示の両方を同時に生成することを学習できることを示しました。第二に、特定の感情的な指示に基づいて音楽を作成するシステムを訓練し、ユーザーが「ゆっくり、大きく、それから弱く」といった一連の言葉を提供することで、そのムードに適合するメロディをコンピュータに生成させることが可能になりました。これは、特定の物語の展開に合わせて音を変化させる必要がある映画やビデオゲームの背景音楽の作成に役立つ可能性があります。第三に、プレーンで感情のない音の連なりを受け取り、適切な表現記号を自動的に追加する、つまり生のメロディに欠けている感情的な文脈を付与するシステムをテストしました。
実験の結果、コンピュータにこれらの表現的な指示を与えると、音楽を創造する能力が向上することが示されました。音と表現テキストを同時に生成することを学習したモデル、あるいは表現テキストをガイドとして使用したモデルは、音のみを見たモデルよりも、人間の音楽パターンと一致する結果を生み出しました。研究者たちは、最も効果的なアプローチは、対応する音を生成する直前に表現指示をモデルに送り込むことで、コンピュータが音楽の感情的な方向性を予見できるようにすることであると発見しました。モデルは人間のパフォーマンスの複雑さを完全に再現できるわけではありませんが、結果は、これらのテキストによる指示を含めることが、コンピュータが楽曲の構造と感情を理解する上で極めて有効であることを示唆しています。
本研究は、人工知能が完璧な音楽を作り出すという問題を解決したと主張するものでも、機械が人間の作曲家に取って代われるようになったと示唆するものでもありません。むしろ、コンピュータが音楽のスコアとどのように相互作用するかについての新しい基礎を確立するものです。楽譜の表現的な層を解き放つことで、MusPyExpressは、研究者が組成の全コンテキストを認識できるモデルを構築することを可能にします。研究者たちは、現在これらの感情的な詳細を欠いている既存の膨大な音楽コレクションに注釈を付けるために、このツールを使用することを計画しており、それによって膨大なデジタル音楽ライブラリに新たなレベルの表現力をもたらすことを目指しています。究極の目標は、人間の手による感覚に取って代わることではなく、音の連なりを一つの物語へと変える繊細な指示を、機械が理解し再現するための語彙を与えることなのです。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。