Genre Classification of Saint Yared Qum Zema Using a Convolutional Neural Network
本研究は、1,555個の音声セグメントをスペクトログラム画像に変換することで、聖ヤレドのエチオピア聖歌(クム・ゼマ)の3つのジャンルを分類し、ResNet、VGGNet、AlexNetといった既存のアーキテクチャを凌駕する88%のテスト精度を達成したカスタム畳み込みニューラルネットワークモデルを提示する。
原論文は CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
音楽は常に単なる音以上の存在であり、何世紀にもわたって歴史、信仰、そしてアイデンティティを運ぶ器としての役割を果たしてきました。現代科学の領域では、研究者たちがコンピュータに「聴かせる」方法を開発しており、これは「音楽情報検索(Music Information Retrieval)」として知られる分野です。この学問は、人間が自然に行うこと、すなわちパターンの認識、楽器の特定、そしてジャズ、ロック、クラシックといったカテゴリーへの楽曲の分類を、機械に要求するものです。コンピュータは西洋音楽の膨大なライブラリを分析することには非常に長けてきましたが、人間の声のみに依存する独特で伝統的な形式に対しては、しばしば苦戦を強いられます。これらの古来の伝統は、楽譜や楽器なしに世代を超えて受け継がれてきたものであり、その音は繊細で、その差異は微細であり、また、それを教えることができる人々の数が減少していることから、その保存は急務となっています。
エチオピアでは、エチオピア・テワヒド・正教会が「ゼマ(Zema)」として知られる神聖な音楽の伝統を守っています。これは6世紀に、当時の音楽の教授職として崇敬される学者である聖ヤレドによって構成された精神的な詠唱の一形態です。聖ヤレドは、これらの詠唱を「ゲエズ(Geez)」、「エジル(Ezil)」、「アラライ(Araray)」という3つの異なるスタイルに整理しました。これらの詠唱が楽器を用いず、人間の声のみで行われるとき、それらは「クム・ゼマ(Qum Zema)」と呼ばれます。何世紀もの間、これら3つのスタイルの違いを見分ける知識は、教会の学校における少数の専門家たちの心の中に生き続けてきました。しかし、これらの専門家の数が減少し、一般の人々がスタイルの違いを判別することが困難になっている中で、この繊細な芸術が失われたり、誤解されたりするリスクが生じています。研究者たちが直面した問いは、現代のテクノロジーが、熟練した学者のようにこれらの違いを明確に聞き取ることができるかどうかという点でした。
デブレ・マルコス大学の研究チームは、聖ヤレドのクム・ゼマの3つのジャンルを特定するために特別に設計されたコンピュータモデルを構築することで、この問いに答えるべく取り組みました。彼らは、特定の音符やリズムといった音楽のルールを手動でリストアップしてコンピュータに教えようとはしませんでした。代わりに、彼らは「畳み込みニューラルネットワーク(convolutional neural network)」と呼ばれる人工知能の一種を使用しました。これは、画像を見ることで学習するように設計されたシステムです。これを機能させるために、研究者たちはまず、詠唱の音をコンピュータが「見える」ものへと変換する必要がありました。彼らは歌唱の録音を、短い10秒間のクリップに分解しました。それぞれのクリップは、その後「スペクトログラム」へと変換されました。スペクトログラムとは、音のピッチ(音高)とボリューム(音量)が時間の経過とともにどのように変化するかを示す視覚的なマップです。このマップにおいて、水平軸は時間を、垂直軸はピッチを表し、色の明るさは、ある瞬間における音の大きさを表しています。
研究者たちは、伝統的な教会の学校の学者たちから、合計1,555個のこれら10秒間のオーディオクリップを集めました。彼らは背景ノイズを取り除くことで録音をクリアにし、すべてのクリップをスペクトログラム画像へと変換しました。これらの画像のコレクションが、彼らの新しいモデルである「聖ヤレドのクム・ゼマ分類器(Saint Yared's Qum Zema Classifier)」の学習データとなりました。システムにはこれらの画像が入力され、ゲエズ、エジル、アラライの各スタイルに対応する視覚的パターンを学習するように求められました。システムが本当に学習しているかどうかをテストするために、研究者たちはデータを分割し、70パーセントの画像をモデルの学習に使用し、残りの30パーセントを、モデルが一度も見聞きしたことのない音楽に対してどのように機能するかを確認するために保持しました。
結果は、コンピュータが確かにこれらの古代の歌唱スタイルを区別することを学習できることを示しました。モデルが未知のオーディオクリップに対してテストされた際、88パーセントの確率でジャンルを正しく特定しました。これは、3つのスタイルが互いに非常に似通っており、聴き手を導くための楽器の助けなしに歌われることを考慮すると、大きな成果でした。研究者たちは、自作のカスタムモデルを、ResNet、VGGNet、AlexNetといった、画像認識のために設計された他の有名なコンピュータシステムと比較しました。それらのシステムはより大規模で、より多くの計算能力を必要としましたが、この特定のタスクにおいては、それほど高い性能を発揮しませんでした。カスタムモデルは、他のモデルよりもはるかに小さく、高速に動作しながら、より高い精度を達成しました。
この研究ではまた、コンピュータモデル内の異なる設定が学習能力にどのように影響するかについても調査されました。彼らは、「ReLU活性化関数」として知られる特定の情報処理方法が、他の手法よりも効果的にモデルにパターンを学習させるのに役立つことを見出しました。プロセス全体は、音を画像に変換することによって、人間がルールを説明することなく、コンピュータが各音楽スタイルの独自の「指紋」を見つけ出すというアイデアに基づいています。研究者たちは、データセットが非常に類似性の高い音声のみを含んでいたため、タスク自体が本質的に困難であったことがモデルの性能を制限したと指摘しましたが、88パーセントの成功率は、ディープラーニングが無形の文化的至宝を保護するための強力なツールになり得ることを証明しました。
この研究は、聖ヤレドの音楽遺産を保護するための実用的な道筋を提示しています。これらの詠唱を自動的に分類できるツールを作成することで、研究者たちは新しい学者の教育を支援し、ゲエズ、エジル、アラライの区別が時と共に失われないようにする方法を提供しました。この研究は、タスクが複雑である一方で、伝統的な知識と現代の機械学習の組み合わせが、過去と未来の架け橋となり得ることを示唆しています。研究者たちは、さらなるデータを収集し、システムをより正確にする方法を探求することで、この研究を継続する計画ですが、初期の成功は、コンピュータが新しい種類の理解をもって、エチオピアの神聖な歌を聴くように教えられることを証明しています。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。