Genre Classification of Saint Yared Qum Zema Using a Convolutional Neural Network
Deze studie presenteert een op maat gemaakt Convolutional Neural Network-model dat een testnauwkeurigheid van 88% bereikt bij het classificeren van de drie genres van de Ethiopische heilige muziek van Sint Yared (Qum Zema) door 1.555 audiofragmenten om te zetten in spectrogram-afbeeldingen, waarmee het gevestigde architecturen zoals ResNet, VGGNet en AlexNet overtreft.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Muziek is altijd meer geweest dan alleen geluid; eeuwenlang heeft het gediend als een voertuig voor geschiedenis, geloof en identiteit. In de wereld van de moderne wetenschap hebben onderzoekers manieren ontwikkeld om computers te leren luisteren, een veld dat bekend staat als Music Information Retrieval. Deze discipline vraagt machines om te doen wat menselijke oren van nature doen: patronen herkennen, instrumenten identificeren en liedjes sorteren in categorieën zoals jazz, rock of klassiek. Hoewel computers behoorlijk goed zijn geworden in het analyseren van de enorme bibliotheken van westerse muziek, hebben ze vaak moeite met unieke, traditionele vormen die uitsluitend op de menselijke stem vertrouwen. Deze oude tradities, die van generatie op generatie zijn doorgegeven zonder geschreven partituren of instrumenten, vormen een speciale uitdaging. Hun klanken zijn subtiel, hun variaties zijn fijnmazig en hun bewaring is urgent, aangezien het aantal mensen dat hen kan onderwijzen krimpt.
In Ethiopië bewaakt de Ethiopisch-Orthodoxe Tewahedo Kerk een heilige muzikale traditie genaamd Zema. Dit is een vorm van spirituele gezangen samengesteld in de zesde eeuw door Sint Yared, een geleerde die wordt vereerd als de hoofdleraar van muziek voor zijn tijd. Sint Yared organiseerde deze gezangen in drie verschillende stijlen: Geez, Ezil en Araray. Wanneer deze gezangen worden uitgevoerd zonder enige muziekinstrumenten, met enkel de menselijke stem, worden ze Qum Zema genoemd. Eeuwenlang heeft de kennis van hoe men tussen deze drie stijlen onderscheid maakt, geleefd in de geesten van enkele gespecialiseerde geleerden binnen kerk scholen. Echter, naarmate het aantal van deze experts afneemt en het algemene publiek het moeilijk vindt om de stijlen uit elkaar te houden, bestaat het risico dat deze subtiele kunst verloren kan gaan of verkeerd begrepen kan worden. De vraag die onderzoekers bezighield, was of moderne technologie deze verschillen net zo duidelijk kon horen als een ervaren geleerde.
Een team van onderzoekers van de Debre Markos Universiteit zette zich in om deze vraag te beantwoorden door een computermodel te bouwen dat specifiek is ontworpen om de drie genres van de Qum Zema van Sint Yared te herkennen. Ze probeerden de computer niet te onderwijzen door handmatig regels van de muziek op te sommen, zoals specifieke noten of ritmes. In plaats daarvan gebruikten ze een type kunstmatige intelligentie genaamd een convolutioneel neuraal netwerk, een systeem dat is ontworpen om te leren door naar afbeeldingen te kijken. Om dit werkend te krijgen, moesten de onderzoekers eerst het geluid van de gezangen vertalen naar iets wat de computer kon zien. Ze namen opnames van de vocale prestaties en braken deze af in korte clips van tien seconden. Elke clip werd vervolgens getransformeerd in een spectrogram, wat een visuele kaart is die laat zien hoe de toonhoogte en het volume van het geluid in de loop van de tijd veranderen. In deze kaart vertegenwoordigt de horizontale as de tijd, de verticale as de toonhoogte, en de helderheid van de kleuren geeft aan hoe hard het geluid op elk gegeven moment is.
De onderzoekers verzamelden in totaal 1.555 van deze tien-seconden audiofragmenten van geleerden bij traditionele kerk scholen. Ze zorgden ervoor dat de opnames schoon waren door achtergrondruis te verwijderen en zetten vervolgens elke clip om in een spectrogram-afbeelding. Deze collectie afbeeldingen werd de trainingsdata voor hun nieuwe model, dat zij de Saint Yared's Qum Zema Classifier noemden. De afbeeldingen werden aan het systeem gevoed en het systeem kreeg de opdracht om de visuele patronen te leren die overeenkomen met de Geez, Ezil en Araray stijlen. Om te testen of het systeem werkelijk leerde, splitsten de onderzoekers hun data: ze gebruikten 70 procent van de afbeeldingen om het model te onderwijzen en hielden de resterende 30 procent achter om te zien hoe goed het presteerde op muziek die het nog nooit eerder had gezien.
De resultaten toonden aan dat de computer inderdaad kon leren om tussen deze oude vocale stijlen te onderscheiden. Wanneer het model werd getest op de ongeziene audiofragmenten, identificeerde het het genre in 88 procent van de gevallen correct. Dit was een aanzienlijke prestatie, vooral gezien het feit dat de drie stijlen zeer veel op elkaar lijken en zonder instrumentale hulp worden gezongen om de luisteraar te begeleiden. De onderzoekers vergeleken hun op maat gemaakte model met verschillende andere bekende computersystemen ontworpen voor beeldherkenning, zoals ResNet, VGGNet en AlexNet. Hoewel die andere systemen groter waren en meer rekenkracht vereisten, presteerden ze minder goed op deze specifieke taak. Het op maat gemaakte model behaalde een hogere nauwkeurigheid dan de anderen, terwijl het veel kleiner en sneller was in gebruik.
De studie onderzocht ook hoe verschillende instellingen binnen het computermodel de bekwaamheid van het model om te leren beïnvloedden. Ze ontdekten dat een specifieke manier van informatieverwerking, bekend als de ReLU-activatiefunctie, het model hielp om patronen effectiever te leren dan andere methoden. Het hele proces was gebaseerd op het idee dat door geluid in plaatjes te veranderen, een computer de unieke "vingerafdruk" van elke muzikale stijl kon vinden zonder dat een mens de regels hoefde uit te leggen. De onderzoekers merkten op dat de prestaties van het model werden beperkt door het feit dat de dataset slechts vocale geluiden met hoge mate van gelijkenis bevatte, waardoor de taak inherent moeilijk was, maar de 88 procent succesrate bewees dat deep learning een krachtig hulpmiddel kan zijn voor het behoud van immaterieel cultureel erfgoed.
Dit werk biedt een praktisch pad vooruit voor het beschermen en onderwijzen van het muzikale erfgoed van Sint Yared. Door een hulpmiddel te creëren dat deze gezangen automatisch kan sorteren, hebben de onderzoekers een manier geboden om het onderwijs van nieuwe geleerden te ondersteunen en te waarborgen dat de onderscheiden tussen Geez, Ezil en Araray niet verloren gaan aan de tijd. De studie suggereert dat hoewel de taak complex is, de combinatie van traditionele kennis en moderne machine learning de kloof tussen het verleden en de toekomst kan overbruggen. De onderzoekers zijn van plan dit werk voort te zetten door meer data te verzamelen en manieren te verkennen om het systeem nog nauwkeuriger te maken, maar het initiële succes bewijst dat een computer kan worden geleerd om te luisteren naar de heilige liederen van Ethiopië met een nieuw soort begrip.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.