ロボットに音楽を聴かせる方法を教えようとしている場面を想像してみてください。長い間、これらのロボットは非常に厳格な楽譜の読み手のようなものでした。もし音を鳴らせば、ロボットはその音が何の音か(例えばCやFなど)と、それがいつ始まり、いつ終わったかを正確に教えてくれました。これは「自動音楽採譜(Automatic Music Transcription)」と呼ばれ、音楽を研究するコンピュータサイエンスの世界では非常に重要なトピックです。しかし、ここに落とし穴があります。現実の音楽は、単なる音符のリストではありません。音楽には感情、質感、そして細かなディテールが詰まっています。バイオリンを例に考えてみましょう。バイオリニストは、全く同じ音を何十通りもの異なる方法で奏でることができます。指で弾いたり、速く弓を動かしたり、ゆっくり弓を動かしたり、あるいは幽霊のような口笛のような音を出す特別な技法を使ったり。これらは「奏法(playing techniques)」と呼ばれます。これまで、ほとんどの音楽を読むロボットは、こうした詳細を無視し、穏やかな指弾きと鋭い弓のストロークを同じものとして扱ってきました。この論文は、大きな問いを投げかけています。「ロボットに、単に音を聞き取るだけでなく、その音がどのように演奏されているかという『スタイル』や『感情』まで理解させることはできるだろうか?」
ソニーコンピュータサイエンス研究所と共に研究を行っている研究者たちは、「イエス、ただし少しひねりがあります」と答えています。彼らは、VioPTT(Violin Playing Technique-aware Transcription)と呼ばれる、二部構成の探偵のように機能する新しいシステムを構築しました。第一の部分はオーディオを聴いて音符を見つけ出し、第二の部分は音楽評論家のように振る舞い、バイオリニストがそれぞれの音をどのように演奏したのか(例えば、指で弾く「ピッツィカート」や、弓を跳ねさせる「スピッカート」など)を正確に推測します。難しい点は、人間が一つ一つの奏法を丁寧にラベル付けした実世界の録音データが十分に存在しないことです。そのため、専門家が何千時間もの音楽にラベルを付けるのを待つ代わりに、チームは膨大な**合成データ(synthetic data)**のライブラリを作成しました。彼らはコンピュータプログラムを使用して、コンピュータ自身がどの奏法を用いたかをすべての音に対して把握している、何千時間もの「偽の」バイオリン音楽を生成しました。
手法 著者らは、ピッチ、オンセット(音の立ち上がり)、オフセット(音の立ち下がり)、および奏法を共同で予測するように設計された軽量なカスケードモデルであるVioPTT(Violin Playing Technique-aware Transcription)を提案する。そのアーキテクチャは、主に2つのコンポーネントで構成される。
合成パイプライン: DAWDreamerフレームワークとSynchron Solo Violin I VSTインストゥルメントを使用し、76時間のオーディオとMIDIのペアを合成する。このパイプラインは、デタシェ(détaché)、フラジオレット(flageolet)、スピッカート(spiccato)、ピッツィカート(pizzicato)の演奏をレンダリングするために、キー・スイッチとコンティニュアス・コントローラー(CC)を自動的に制御する。