← 최신 논문
⚡ electrical engineering

Musical Agent Systems: MACAT and MACataRT

이 논문은 윤리적 참여와 예술적 무결성을 우선시하는 개인화된 소규모 데이터셋 학습을 통해 실시간 음악 연주와 협업 즉흥 연주를 강화하도록 설계된 두 가지 인간 참여형 생성 AI 시스템인 MACAT와 MACataRT를 소개한다.

원저자: Keon Ju M. Lee, Philippe Pasquier

게시일 2026-08-17
📖 5 분 읽기🧠 심층 분석

원저자: Keon Ju M. Lee, Philippe Pasquier

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신의 컴퓨터가 단순히 다운로드한 곡을 재생하는 것을 넘어, 당신과 함께 즉흥 연주(jam)를 배우는 세상을 상상해 보십시오. 이것이 바로 인간의 창의성을 시뮬레이션하기 위해 컴퓨터를 사용하는 기술인 **음악적 메타크리에이션(musical metacreation)**의 영역입니다. 이 분야의 핵심에는 **음악적 에이전트(musical agents)**가 있습니다. 이는 음악적 파트너처럼 행동하도록 설계된 소프트웨어 프로그램입니다. 이들은 당신이 연주하는 것을 듣고, 당신의 스타일을 학습하며, 실시간으로 자신만의 파트를 즉흥적으로 연주할 수 있습니다. 이들을 지치지 않고, 박자를 놓치지 않으며, 당신의 기분에 즉각적으로 적응할 수 있는 디지털 밴드 멤버라고 생각하십시오.

오랫동안 이러한 디지털 밴드 멤버들은 모든 장르를 아우르는 수천 곡의 노래가 담긴 거대한 데이터의 산을 통해 훈련되었습니다. 이 방식은 매우 강력하지만, 마치 모든 재즈 녹음본을 들으며 재즈를 배우려는 것과 같습니다. 전반적인 분위기는 파악할 수 있겠지만, 결코 '당신 자신'처럼 연주할 수는 없을 것입니다. 연구자들이 던지는 핵심 질문은 이것입니다: "우리가 소량의 개인적인 사운드 컬렉션으로부터 학습하여, 특정 아티스트의 독특한 목소리를 진정으로 반영할 수 있는 AI를 구축할 수 있을까?" 이 논문은 이 질문을 탐구하며, 단순한 패턴 생성기가 아닌 윤리적이고 투명하며 깊이 개인화된 AI 음악가를 만드는 방법을 탐구합니다.


디지털 잼 세션을 만나다: MACAT과 MACataRT

이 논문에서 연구자 Keon Ju M. Lee와 Philippe Pasquier는 두 가지 새로운 음악적 에이전트인 MACATMACataRT를 소개합니다. 이들은 인간 음악가가 즉석에서 음악을 창조하도록 돕기 위해 설계된 두 가지 서로 다른 유형의 디지털 조력자라고 생각하면 됩니다. 인터넷 전체를 학습하는 대신, 이 에이전트들은 "스몰 데이터(small data)" 철학을 기반으로 구축되었습니다. 마치 개에게 수백만 개의 다른 개 영상을 보여주는 것이 아니라, 몇 가지 간식과 당신의 목소리만으로 기술을 가르치는 것과 같습니다. 이것이 이 시스템들이 작동하는 방식입니다. 이들은 아티스트가 제공한 작고 정제된 오디오 클립 컬렉션으로부터 학습하여, 해당 아티스트의 독특한 스타일을 완벽하게 모방합니다.

AI 밴드 동료의 두 가지 성격

논문은 이 두 시스템이 마치 밴드 내의 서로 다른 유형의 뮤지션처럼, 서로 다른 "성격"과 작업 방식을 가지고 있다고 제시합니다.

1. MACAT: 스스로 듣는 솔로이스트
MACAT은 AI가 주도권을 잡거나 퍼포먼스를 이끌어야 하는 상황을 위해 설계되었습니다. 이는 마치 연주하는 동안 끊임없이 자기 자신을 들으며 연주하는 음악가와 같습니다.

  • 작동 방식: MACAT은 유사한 소리들을 하나의 그룹으로 묶는 정신적 지도와 같은 "자기 조직화 지도(self-organizing map)"를 사용합니다. 소리를 재생할 때, 결과물을 듣고 자신의 정신적 지도를 확인하며, 아티스트의 자체 녹음에서 발견한 패턴을 바탕으로 다음에 무엇을 연주할지 결정합니다.
  • 마법 같은 기능: 이 시스템은 소리의 시퀀스에서 패턴을 포착하기 위해 "팩터 오라클(Factor Oracle)"이라는 도구를 사용합니다. 만약 아티스트가 빠른 드럼 롤 다음에 조용한 허밍을 연주했다면, MACAT은 그 시퀀스를 학습합니다. 라이브 공연 중에 MACAT은 최근의 "생각"(방금 연주한 소리)을 살펴보고, 새로운 아이디어로 나아갈지 아니면 멋진 순간을 반복하기 위해 뒤로 돌아갈지를 실시간으로 결정할 수 있습니다.
  • 분위기: 솔로 퍼포먼스나, 인간 음악가가 AI를 주요 드라이버로 삼아 살아있는 듯 역동적이고 진화하는 사운드스케이프를 만들고자 할 때 적합합니다.

2. MACataRT: 협업하는 모자이크 아티스트
MACataRT는 인간과 AI가 아이디어를 주고받는 협업 즉흥 연주를 위해 설계된 더 유연한 파트너입니다. 이는 "오디오 모자이싱(audio mosaicing)"이라는 개념을 기반으로 합니다.

  • 모자이크 비유: 수천 개의 작고 서로 다른 색상의 타일(오디오 클립)이 들어 있는 상자를 상상해 보십시오. MACataRT는 당신이 그리고 있는 그림에 딱 맞는 타일을 즉각적으로 집어 들 수 있습니다. 당신이 높은 음을 연주하면 높은 소리가 나는 타일을 가져오고, 거칠고 긁히는 소리를 내면 거친 느낌의 타일을 가져옵니다.
  • 작동 방식: 이 시스템은 소리의 특징(피치나 밝기 등)을 기준으로 이 타일들을 2D 공간에 배치합니다. 인간 음악가는 이 공간의 특정 지점을 가리킬 수 있고, AI는 그 영역에서 소리를 추출합니다.
  • 반전 요소: 이전 모델(원래의 CataRT 시스템)과 달리, MACataRT는 "타임 머신" 요소를 추가했습니다. 이 시스템은 아티스트가 보통 어떤 순서로 연주하는지를 학습할 수 있습니다. 따라서 단순히 적절한 소리를 고르는 것을 넘어, 리듬과 흐름을 유지하기 위해 다음에 올 적절한 소리를 예측할 수 있습니다. 여기에는 두 가지 모드가 있습니다: 반응형(Reactive) (당신이 연주하는 것에 즉각 반응) 및 선제형(Proactive) (학습된 패턴을 바탕으로 다음에 올 것을 예측).

왜 "스몰 데이터"가 모든 것을 바꾸는가

이 연구의 가장 중요한 점은 음악이 좋게 들린다는 사실뿐만 아니라, 그 음악이 어떻게 만들어졌는가에 있습니다. 저자들은 거대한 익명의 데이터셋(예: 인터넷 전체)으로 AI를 훈련시키는 것은 위험하다고 주장합니다. 이는 마치 화가가 반 고흐의 그림 조금, 피카소의 그림 조금, 그리고 길거리의 무작위 표지판을 조금씩 베껴서, 결국 독창성 없는 엉망진탕인 결과물을 만들어내는 것과 같습니다. 또한, 이는 윤리적 문제도 제기합니다: AI가 훈련 데이터에 동의하지 않은 음악가의 스타일을 훔친 것은 아닐까요?

개인화된 소규모 데이터셋을 사용함으로써, 이 에이전트들은 두 가지 문제를 모두 해결합니다:

  1. 윤리 및 투명성: AI가 오직 특정 아티스트의 자체 녹음물로만 훈련되었기 때문에, 그 음악이 어디에서 왔는지에 대한 미스터리가 없습니다. 이는 명확하고 정직한 협업입니다. 아티스트는 자신의 AI가 무엇으로부터 배웠는지 정확히 알 수 있습니다.
  2. 진정한 개인화: AI는 아티스트의 거울이 됩니다. 단순히 "음악 같은" 소리를 내는 것이 아니라, 바로 '그 특정 음악가'처럼 들립니다. 논문은 이것이 인간과 기계 사이의 더 깊고 의미 있는 연결을 만든다고 제안합니다.

실제적인 잼 세션

이 논문은 실험실에만 머물지 않고, 이러한 시스템이 실제로 작동하는 모습을 보여줍니다.

  • MACAT은 중국 항저우에서 열린 MusicAcoustica 페스티벌에서 예술가 집단 K-Phi-A에 의해 사용되었습니다. 그곳에서 MACAT은 앰비언트 일렉트로닉 퍼포먼스를 만드는 데 도움을 주었으며, AI와 인간이 함께 즉흥 연주를 펼치는 가운데 AI가 사운드를 형성하는 주도적인 역할을 수행했습니다.
  • MACataRT는 퍼커셔니스트와 기타리스트 듀오인 KeRa에 의해 Echoes of Synthetic Forest라는 곡을 만드는 데 사용되었습니다. 이 작품은 매우 뛰어난 성과를 거두어 2024년 AI 뮤직 송 콘테스트의 Top 10 파이널리스트에 올랐으며, 스위스 취리히에서 공연되었습니다. 이는 이러한 소규모 데이터 에이전트가 관객과 심사위원의 공감을 불러일으키는 음악을 만들 수 있음을 증명합니다.

친환경적이고 윤리적인 보너스

이 시스템들에는 숨겨진 초능력이 있습니다: 바로 친환경적이라는 점입니다. 거대한 AI 모델을 훈련시키는 데는 엄청난 슈퍼컴퓨터가 필요하며 많은 전력을 소비하여 큰 탄소 발자국을 남깁니다. 그러나 이 음악적 에이전트들은 표준 노트북(심지어 Intel Core i7이나 Apple M2 칩이 탑재된 구형 모델에서도)으로 훈련될 수 있으며, 강력한 외부 그래픽 카드를 필요로 하지 않습니다. 소규모 데이터셋을 사용하기 때문에 더 빠르고, 저렴하며, 실행 시 환경 친화적입니다.

향れて의 과제

저자들은 이것이 여전히 진행 중인 작업임을 분명히 합니다. 현재 시스템은 짧은 패턴을 포착하는 데는 뛰어나지만, 더 긴 음악적 서사를 이해하는 데는 개선의 여지가 있다고 제안합니다. 미래 버전은 더 깊은 학습(deep learning)을 사용하여 더 긴 시퀀스를 기억하고, 음악가가 AI가 왜 특정 음을 선택했는지 정확히 알 수 있도록 "설명 가능성(explainability)"을 추가할 수 있습니다. 또한 AI가 실시간으로 자신의 실수를 학습하는 피드백 루프를 추가하여 잼 세션을 더욱 긴밀하게 만들 계획입니다.

요약하자면, 이 논문은 AI 음악의 미래가 거대하고 일반적인 로봇으로 인간 예술가를 대체하는 것이 아님을 보여줍니다. 그것은 모든 음악가에게 자신의 독특한 목소리를 유지하면서 새로운 소리를 탐구할 수 있도록 돕는, 맞춤형의 윤리적이고 친환경적인 디지털 파트너를 제공하는 것입니다. 이는 AI가 당신을 '대신해서' 연주하는 것이 아니라, 당신과 '함께' 연주하는 것에 관한 이야기입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →