← 최신 논문
💻 computer science

Equivariant Music Transformer

이 논문은 자기 증류(self-distillation)와 보조 정규화(auxiliary regularization)를 통해 시간 이동(time shifts)과 음높이 전이(pitch transpositions)에 대한 등변성(equivariance)을 강제함으로써, 음악의 변환 대칭성(translational symmetries)을 포착하지 못하는 표준 트랜스포머의 한계를 극복하고 우수한 생성 성능과 표현 품질을 입증하는 모델인 Equivariant Music Transformer(EMT)를 소개한다.

원저자: Zixun Guo, Simon Dixon

게시일 2026-08-05
📖 3 분 읽기☕ 가벼운 읽기

원저자: Zixun Guo, Simon Dixon

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 가장 좋아하는 노래를 듣고 있다고 상상해 보세요. 만약 누군가 그 멜로디를 몇 초 늦게 시작하거나, 가수가 모든 음을 약간 더 높은 음으로 부르더라도, 당신은 여전히 그것을 즉각적으로 같은 곡이라고 인식합니다. 당신의 뇌는 혼란을 느끼지 않습니다. 당신은 음의 정확한 시점이나 높이가 아니라, 음들 사이의 '관계'가 중요하다는 것을 이해하기 때문입니다. 이러한 변화에도 불구하고 패턴을 인식하는 능력은 인간 지각의 초능력입니다. 인공지능의 세계에서 과학자들은 컴퓨터에게도 똑같은 일을 할 수 있도록 가르치려 노력하고 있습니다. 그들은 수백만 개의 악보를 읽으며 학습하는 매우 똑똑한 디지털 작곡가와 같은 '뮤직 트랜스포머(music transformers)'를 구축하고 있습니다. 하지만 여기에는 함정이 있습니다. 이 컴퓨터들이 점점 더 커지고 똑똑해지는 동안, 오히려 이 초능력을 잊어버리고 있는 것처럼 보인다는 점입니다. 음악적 관계를 이해하는 대신, 이들은 마치 앵무새처럼 정확한 음과 타이밍을 암기하기 시작하여, 곡이 이동되었을 때 이를 인식하지 못하게 됩니다. 이 논문은 왜 그런 일이 발생하는지 파헤치고, 인간처럼 실제로 음악을 들을 줄 아는 새로운 종류의 AI를 구축합니다.

이 연구의 연구진인 릭스운 구오(Zixun Guo)와 사이먼 딕슨(Simon Dixon)은 이 음악 AI 모델들이 학습하는 방식에 대해 놀랍고도 다소 우려스러운 사실을 발견했습니다. 그들은 이러한 모델들이 더 커지고 더 오래 훈련될수록, 오히려 변형된 음악을 인식하는 능력이 더 떨어진다는 것을 발견했습니다. 이는 마치 시험 공부를 하는 학생이 개념을 배우는 대신 정답이 적힌 페이지 번호를 통째로 외우기 시작하는 것과 같습니다. 질문의 페이지가 바뀌면 학생은 낙제하게 됩니다. 저자들은 이를 '등변성(equivariance)'의 결여라고 부릅니다. 간단히 말해, 등변성이란 입력을 이동시키면(예를 들어 멜로디의 음높이를 올리면), 컴퓨터의 내부 이해도 정확히 그와 동일한 방식으로 이동해야 함을 의미합니다. 그러나 그들의 분석에 따르면, 기존의 표준 뮤직 트랜스포머들은 이러한 변형된 버전의 곡들을 서로 전혀 연결되지 않은 완전히 다른 아이디어로 매핑하고 있었습니다. 모델이 커질수록, 모델은 음악을 음악답게 만드는 공유된 구조를 포착하기보다는 절대적인 패턴을 암기하는 데 뇌 용량을 낭비하는 것처럼 보였습니다.

이를 해결하기 위해 팀은 **등변 뮤직 트랜스포머(Equivariant Music Transformer, EMT)**를 발명했습니다. 이 새로운 모델을 특별한 규칙을 가지고 공부하도록 강요받는 학생이라고 생각해보세요: "만약 네가 멜로디를 배웠다면, 그것이 변형되었을 때도 인식할 수 있어야 한다." 그들은 모델의 훈련 과정에 특별한 '숙제' 과제를 추가함으로써 이 일을 수행했습니다. 모델은 일반적인 작업인 다음 음표 예측과 병행하여, 변형된 버전의 곡을 살펴보고 그 내부 이해가 원래의 곡이 이동된 방식과 일치하는지 확인해야 했습니다. 이는 마치 아이에게 자전거 타기를 가르칠 때 단순히 직선 경로에서만 가르치는 것이 아니라, 경로가 왼쪽으로 옮겨진 길에서도 타게 하여, 단순히 길을 외우는 것이 아니라 균형 잡는 법을 이해하도록 강요하는 것과 같습니다.

결과는 인상적이었습니다. 새로운 EMT 모델은 단순히 변형된 음악을 더 잘 인식하게 된 것에 그치지 않고, 전반적으로 더 나은 작곡가가 되었습니다. 변형된 버전의 곡들을 서로 연결하도록 강제함으로써, 모델은 '뇌 용량'을 더 효율적으로 사용했습니다. 가능한 모든 음높이나 타이밍 변화에 대해 별도의 버전의 곡을 학습하는 대신, 모든 경우에 적용되는 핵심 구조를 학습한 것입니다. 연구진이 이 모델을 훨씬 더 큰 규모의 다른 최상위 모델들과 테스트했을 때, EMT가 승리했습니다. EMT는 더 매끄럽고 즐거운 음악을 만들어냈으며, 시작 프롬프트가 시간이나 음높이 면에서 변형되었을 때도 그러했습니다. 기존의 모델들은 프롬프트가 변형되면 혼란을 느껴 무질서하고 일관성 없는 음악을 생성하는 반면, EMT는 평정심을 유지하며 높은 품질을 유지했습니다.

이 연구는 단순히 AI 모델을 크게 만드는 것이 음악에 더 똑똑해지는 정답이 아님을 시사합니다. 이러한 음악적 대칭성에 대해 가르쳐주는 특정 규칙이 없다면, 모델은 단지 잘못된 것을 더 잘 암기하게 될 뿐입니다. 저자들은 자신들의 새로운 '변형 인식(shift-aware)' 훈련 방법과 데이터를 모델에 입력하는 영리한 방식(특징 공학이라 불리는)을 결합했을 때 가장 좋은 결과를 얻었다는 것을 발견했습니다. 요컨대, 그들은 진정으로 음악을 이해하는 AI를 구축하려면, 음표 그 자체가 아니라 음표 사이의 관계를 듣도록 가르쳐야 한다는 것을 증명했습니다. 이 새로운 모델의 코드와 데모는 온라인에 공개되어 있으며, 컴퓨터가 노래를 암기하는 것과 이해하는 것의 차이를 직접 들어보고 싶은 모든 이들을 초대하고 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →