CultureMERT: Continual Pre-Training for Cross-Cultural Music Representation Learning
Este artigo apresenta o CultureMERT-95M, um modelo de fundação musical multiculturalmente adaptado, treinado por meio de uma nova estratégia de pré-treinamento contínuo em duas etapas em diversas tradições não ocidentais, o qual melhora significativamente o desempenho de auto-etiquetagem transcultural enquanto mantém a proficiência em benchmarks ocidentais e oferece uma alternativa viável através de aritmética de tarefas.
Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo
A música é uma linguagem universal, mas os computadores que usamos para compreendê-la frequentemente falam apenas um dialeto. Durante anos, os modelos de inteligência artificial mais poderosos projetados para ouvir e categorizar música foram treinados quase exclusivamente em estilos ocidentais, como o pop, o rock e as sinfonias clássicas. Esses sistemas tornaram-se incrivelmente bons em reconhecer os padrões dessas tradições específicas, mas têm dificuldade quando confrontados com a vasta e rica diversidade das outras culturas musicais do mundo. Eles perdem as sutilezas das estruturas melódicas da música clássica indiana, os ciclos rítmicos únicos das tradições turcas ou as escalas distintas das canções folclóricas gregas. Essa limitação significa que, para bilhões de pessoas cuja herança musical cai fora do cânone ocidental, essas ferramentas digitais permanecem cegas, incapazes de preservar, recomendar ou analisar a arte que define suas comunidades.
Pesquisadores há muito buscam uma maneira de ensinar esses modelos a ouvir de forma mais ampla sem ter que reconstruí-los do zero, um processo que seria proibitivamente caro e demorado. O desafio reside em adaptar um modelo que já aprendeu um conjunto de regras para entender um conjunto de regras completamente diferente sem fazer com que ele esqueça o que já sabia. Este é o problema central abordado por um novo estudo que introduz um sistema chamado CultureMERT. Os pesquisadores visaram pegar um modelo de base que havia sido treinado em mil horas de música predominantemente ocidental e guiá-lo gentilmente para compreender as linguagens musicais do Mediterrâneo Oriental e do subcontinente indiano, garantindo ao mesmo tempo que não perdesse sua capacidade de reconhecer os estilos ocidentais para os quais foi originalmente construído.
Para alcançar isso, a equipe empregou uma estratégia conhecida como pré-treinamento contínuo. Em vez de descartar o modelo existente e começar do zero, eles o alimentaram com uma nova dieta cuidadosamente equilibrada de dados de áudio. Este novo conjunto de dados incluiu 650 horas de música extraída de quatro tradições distintas: o makam turco, o clássico hindustani, o clássico carnático e a música tradicional grega. No entanto, simplesmente alimentar o modelo com esses novos dados fez com que ele tropeçasse, um fenômeno onde o desempenho do computador em suas tarefas originais despenca conforme ele tenta aprender as novas. Para resolver isso, os pesquisadores criaram uma abordagem de dois estágios. No primeiro estágio, introduziram ao modelo uma parte menor da nova música enquanto mantinham suas camadas internas mais complexas congeladas, permitindo que apenas as partes básicas de processamento de som se ajustassem. Eles também misturaram uma pequena quantidade de música ocidental durante esta fase para lembrar o modelo de seu treinamento original. No segundo estágio, desbloquearam todo o modelo e o treinaram no conjunto completo de 650 horas de dados, permitindo que ele integrasse totalmente essas novas nuances culturais.
Os resultados foram impressionantes. Quando testado em tarefas que exigiam que o modelo identificasse instrumentos, humores ou modos musicais específicos em músicas não ocidentais, o modelo adaptado mostrou uma melhoria significativa, apresentando um aumento médio de quase cinco por cento na precisão em comparação com a versão original. Crucialmente, esse ganho não ocorreu às custas de seu conhecimento prévio; o modelo manteve sua capacidade de reconhecer a música ocidental com quase nenhuma perda de desempenho. O estudo também explorou um método diferente chamado aritmética de tarefas, que envolve combinar matematicamente o "conhecimento" de vários modelos menores, cada um treinado em uma única cultura, em um sistema unificado. Essa abordagem teve um desempenho tão bom quanto o método de treinamento direto em tarefas não ocidentais e até o superou em benchmarks ocidentais, sugerindo que fundir modelos especializados é uma alternativa poderosa para treiná-los todos de uma vez.
Os pesquisadores descobriram que a capacidade do modelo de transferir conhecimento entre culturas não era uniforme. Por exemplo, o modelo treinado na música carnática do sul da Índia mostrou uma forte capacidade de generalizar para a música hindustani do norte da Índia e até para as tradições turcas, provavelmente porque esses sistemas compartilham raízes teóricas profundas em melodia e ritmo. Em contraste, o modelo teve mais dificuldade em transferir conhecimento para a música tradicional grega, que, embora distinta, compartilhava menos semelhanças estruturais com os conjuntos de dados indianos e turcos na forma específica como o computador codifica o som. Ao analisar os "tokens" digitais que o modelo usa para representar o som, a equipe descobriu que a distância matemática entre essas tradições musicais previa quão bem o modelo as aprenderia, oferecendo uma nova maneira de planejar futuros dados de treinamento.
Em última análise, este trabalho demonstra que a inteligência artificial pode ser tornada mais inclusiva sem sacrificar suas capacidades principais. Os pesquisadores disponibilizaram seu modelo adaptado, o CultureMERT, ao público, fornecendo uma ferramenta que pode finalmente ouvir a música do mundo com um ouvido muito mais amplo. Eles reconhecem que seu modelo é um passo significativo à frente, mas não é uma solução perfeita; a tecnologia subjacente usada para converter som em tokens digitais ainda foi treinada em música ocidental, o que pode limitar o quão profundamente ela pode compreender certas sutilezas culturais. No entanto, ao mostrar que um modelo pode aprender novas linguagens musicais enquanto lembra das antigas, este estudo oferece um caminho claro para um futuro onde os sistemas de música digital sejam verdadeiramente globais, capazes de honrar todo o espectro da expressão musical humana.
Afogado em artigos na sua área?
Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.