MulTTiPop: A Multitrack Transcription Dataset for Pop Music
Dit artikel introduceert MulTTiPop, een dataset bestaande uit 572 diverse popmuzieksegmenten uitgelijnd met multitrack MIDI-opnames, die wordt gebruikt om de aanzienlijke prestatiekloven in state-of-the-art automatische muziektranscriptiemodellen te evalueren en aan te tonen.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een robot probeert te leren muziek te lezen met het gehoor. Je wilt dat hij naar een volledige popsong luistert — drums, bas, gitaren, zang, allemaal gemengd door elkaar — en precies opschrijft wat elk afzonderlijk instrument speelt. Cool, toch? Maar hier is het probleem: tot nu toe hadden we geen goede "antwoordsleutel" om te controleren of de robot het wel goed deed. De meeste bestaande antwoordsleutels waren ofwel voor solo-piano (te makkelijk), werden door computers bedacht (te perfect), of bevatten alleen de hoofdmelodie en akkoorden (te simpel).
Maak kennis met MulTTiPop, een nieuwe dataset gemaakt door onderzoekers van Carnegie Mellon University om dit op te lossen. Denk aan MulTTiPop als een enorme playlist van 3,5 uur aan echte pophits van de jaren 1930 tot de jaren 2000, vergezeld door een "magische partituur" die je precies vertelt wat elk instrument doet, tot op de milliseconde nauwkeurig.
Het Grote Matchingsspel
Hoe hebben ze dit gebouwd? Het was als een spannend spelletief "Vind de Match".
- De Aanwijzingen: Ze begonnen met een gigantische lijst YouTube-video's van popsongs (uit een database genaamd TheoryTab) en een enorme bibliotheek van digitale bladmuziek (uit de Lakh MIDI Dataset).
- De Eerste Filter: Ze gebruikten computermagie om songtitels en artiestennamen te matchen. Als de namen bijna identiek waren, hielden ze de combinatie over. Dit beperkte het tot ongeveer 1.164 potentiële matches.
- De Tempo-Twist: Hier wordt het lastig. Zelfs als het dezelfde song is, kan het "ritme" in de digitale bladmuziek iets sneller of langzamer zijn dan de echte YouTube-video. Het is also't twee mensen die proberen te dansen op hetzelfde nummer, maar de één loopt net iets achter de beat aan.
- De Menselijke Touch: Om de timing op te lossen, gebruikten de onderzoekers een slimme truc. Ze vonden een specifieke "ankerbeat" (een moment waarop de muziek definitief synchroon loopt) en rekten of krompen vervolgens de digitale bladmuziek om de ritmiek van de echte video perfect te laten aansluiten. Maar computers zijn niet perfect in het kiezen van zo'n ankerbeat. Daarom vroegen ze menselijke annotatoren (studenten die van muziek en technologie houden) om de video te beluisteren en de digitale bladmuziek er direct naast te bekijken om de juiste uitlijning te kiezen.
Uiteindelijk hebben ze 572 segmenten muziek succesvol uitgelijnd. Dat is ongeveer 3,5 uur aan audio, die 374 unieke nummers van 263 verschillende artiesten beslaat.
De Realiteitstoets: Robots Moeten Nog Een Lange Weg Af te Legen
De onderzoekers hebben de dataset niet alleen gebouwd; ze hebben direct de beste robotmuzikanten op de proef gesteld. Ze vroegen twee top-AI-modellen (genaamd MT3 en YourMT3+) om naar deze MulTTiPop-fragmenten te luisteren en de noten op te schrijven.
De resultaten? De robots hadden moeite.
- Het beste model kreeg slechts ongeveer 38% van de nootaanzetten correct (een metriek genaamd "Onset F1").
- De robots raakten vaak in de war wanneer de muziek dichtbevolkt werd. Ze hoorden misschien de melodie, maar misten de bas, of ze bleven hangen bij één instrument en negeerden de rest.
- Eén model probeerde de zang te raden, maar labelde deze als een saxofoon (wat grappig is, maar fout).
Het paper suggereert dat de reden dat deze robots falen, is dat ze voornamelijk getraind zijn op nep, door computers gegenereerde muziek (zoals de Slakh2100-dataset) in plaats van op echte, rommelige, commerciële popopnames. Het is alsof je een chef leert koken door hem alleen perfecte, plastic voedselmodellen te laten zien, om hem vervolgens een echte, sissende biefstuk te geven en te verwachten dat hij weet wat hij moet doen.
Wat Deze Dataset Is (en Niet Is)
De auteurs zijn heel duidelijk over de regels van het spel:
- Het IS bedoeld voor testen: MulTTiPop is een "eindexamen" voor muziektranscriptie-AI. Het is ontworpen om ons te laten zien waar de robots falen, zodat we ze kunnen verbeteren.
- Het is NIET bedoeld voor trainen: De onderzoekers sluiten expliciet uit dat deze dataset gebruikt wordt om de robots te onderwijzen. Omdat de nummers auteursrechtelijk beschermde commerciële hits zijn en de dataset relatief klein is, zou het gebruik ervan om een model te trainen oneerlijk en juridisch wankel zijn.
- Het heeft een bias: Het paper geeft toe dat de gekozen nummers voornamelijk uit Westerse popmuziek bestaan (Amerikaanse artiesten, Westerse harmonie). Het suggereert dat als een robot goed presteert op MulTTiPop, hij goed is in Westerse pop, maar we kunnen niet zeker weten of hij ook goed zou presteren op muziek uit andere delen van de wereld of andere tradities.
De Kernboodschap
MulTTiPop is een vitale nieuwe tool die eindelijk een realistische "antwoordsleutel" geeft voor complexe popmuziek. Het bewijst dat hoewel onze AI-muziektranscribenten beter worden in eenvoudige taken, ze nog steeds een aanzienlijke ruimte voor verbetering hebben voordat ze de rommelige, prachtige chaos van een echte popband echt kunnen begrijpen. De robots halen momenteel een "C-" voor deze test, en de onderzoekers zijn hoopvol dat ze met deze nieuwe dataset kunnen helpen om hen harder te laten studeren en de volgende keer een "A" te laten halen.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.