← 최신 논문
⚡ electrical engineering

Exploring LLMs for South Asian Music Understanding and Generation

이 논문은 거대 언어 모델을 남아시아 고전 음악에 대해 최초로 체계적으로 평가하여, 최첨단 모델들이 라가(raga) 기반 이론을 이해하는 데는 높은 정확도를 달달성하지만 양식적으로 충실한 출력을 생성하는 데는 어려움을 겪고 있음을 밝힘으로써, 문화적으로 근거한 음악 모델링의 상당한 격차를 강조한다.

원저자: Faria Binte Kader, Mohtasim Hadi Rafi, Shah Wasif Sajjad, Santu Karmaker

게시일 2026-06-05
📖 4 분 읽기☕ 가벼운 읽기

원저자: Faria Binte Kader, Mohtasim Hadi Rafi, Shah Wasif Sajjad, Santu Karmaker

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

상상해 보세요. 수년간 책을 읽고, 코드를 작성하고, 이야기를 지어내며 숙련된 매우 똑똑하고 박식한 로봇들(대규모 언어 모델, 즉 LLM)이 있습니다. 이 로봇들은 서양 음악의 전문가입니다. 베토벤의 피아노 소나타부터 라디오에서 들리는 팝송까지 말이죠. 이들은 서양식 설계도를 사용하여 집을 짓는 법을 알고 있습니다. 여기서 벽은 '화성'(위로 쌓아 올린 코드)으로 만들어집니다.

하지만 만약 당신이 이 똑같은 로봇들에게 남아시아 고전 음악의 설계도를 사용하여 집을 지으라고 요청한다면 어떻게 될까요?

이 논문은 엄격한 검사 보고서와 같습니다. 연구진은 다음과 같이 물었습니다: 이 로봇들이 실제로 남아시아의 전통, 특히 인도와 방글라데시의 복잡한 체계에 기반하여 음악을 이해하고 구축할 수 있는가?

다음은 그들의 연구 결과를 쉬운 비유를 들어 정리한 내용입니다:

1. 도전 과제: 두 가지 서로 다른 건축 양식

서양 음악은 특정하고 미리 정의된 패턴으로 끼워 맞춰지는 레고 블록으로 집을 짓는 것과 같습니다(화성과 코드).
반면 남아시아 음악(힌두스탄 클래식, 라빈드라 상기트, 나즈룰 상기트 등)은 태피스트리를 짜는 것과 같습니다. 이는 다음과 것에 의존합니다:

  • 라가(Raga): 특정 '실'(음표)의 집합과 그 음들이 어떻게 움직여야 하는지에 대한 규칙이며, 이를 통해 특정한 분위기를 만들어냅니다.
  • 탈라(Tala): 반복되는 루프 형태의 심장 박동과 같은 리듬 주기입니다.
  • 장식음(Ornamentation): 음과 음 사이에서 일어나는 아주 작고 섬세한 꾸밈 요소들(마치 자수와 같은)입니다.

연구진은 레고에 익숙한 로봇들이 갑자기 숙련된 직공이 될 수 있는지 확인하고 싶었습니다.

2. 테스트: 504문항의 시험

로봇들의 "음악적 IQ"를 테스트하기 위해 연구진은 504개의 질문으로 구성된 거대한 시험을 만들었습니다. 이것은 단순히 찍기 게임이 아니었습니다. 다음 세 가지를 테스트했습니다:

  • 이론: 문법을 알고 있는가? (예: "이 특정 라가에 속하는 음은 무엇인가?")
  • 문화: 역사를 알고 있는 있는가? (예: "이 유명한 노래를 작곡한 사람은 누구인가?" 또는 "어떤 악기가 사용되었는가?")
  • 연속성: 만약 노래의 첫 몇 마디를 준다면, 문장을 올바르게 완성할 수 있는가?

결과:

  • 최우수 학생: 가장 발전된 로봇(Gemini 2.5 Pro)은 약 **90%**의 점수를 받으며 시험을 통과했습니다. 이 로봇은 실제로 남아시아 음악에 관한 책들을 '읽은' 것처럼 보였습니다.
  • 학급 평균: 대부분의 오픈 소스 로봇(무료로 제공되는 커뮤니티 구축 모델)은 23%에서 40% 사이의 점수를 기록했습니다. 이들은 대부분 추측을 하고 있었습니다.
  • 전문가: 흥서롭게도, 서양 음악만을 위해 특별히 훈련된 로봇(ChatMusician)은 처참하게 실패하며 가장 낮은 점수를 기록했습니다. 이것은 마치 숙련된 목수에게 시계를 고쳐보라고 하는 것과 같습니다. 그들의 특정 기술은 전이되지 않았습니다.

3. 창작: 노래를 쓸 수 있는가?

다음으로 연구진은 로봇들에게 "ABC 표기법"(음악을 위한 텍득적인 텍스트 레시피라고 생각하면 됩니다)이라는 텍스트 기반 음악 형식을 사용하여 새로운 곡을 작곡하도록 요청했습니다. 그들은 로봇에게 가사를 주고 라빈드라 상기트(타고르의 노래)나 나즈룰 상기트(나즈룰 이슬람의 노래)처럼 들리는 멜로디를 만들라고 했습니다.

그들은 단계별로 상세함이 증가하는 "5단계 프롬프트" 시스템을 사용했습니다:

  • 1단계: "노래를 써라."
  • 5단계: "이 특정 음계, 이 리듬, 이 감정을 담아, 이 악기들을 사용하여 라빈드라 상기트를 써라."

결과:
가장 뛰어난 로봇(Gemini 2.5 Pro)조차 한계에 부딪혔습니다.

  • 구조적 타당성(Structural Validity): 로봇은 음악처럼 보이는 것(종이 위에 적힌 올바른 음표와 리듬)을 써낼 수 있었습니다.
  • 양식적 충실도(Stylistic Faithfulness): 하지만 인간이 들어보았을 때, 그것이 실제로 라빈드라 상기트처럼 들리는 경우는 단 **40%**뿐이었습니다. 나머지 60%는 일반적인 음악이나 전혀 다른 스타일처럼 들렸습니다 much.

비유: 로봇에게 특정 인물의 초상화를 그려달라고 요청한다고 상상해 보세요. 로봇은 색상과 캔버스는 제대로 맞출 수 있겠지만(구조적 타당성), 얼굴은 낯선 사람처럼 보일 것입니다(양식적 충실도 부족).

4. 함정: "가짜" 지표들

연구진은 우리가 보통 AI 음악을 테스트하는 방식에서 큰 문제를 발견했습니다.

  • 기존 방식: 우리는 음표가 수학적으로 정확한지, 그리고 노래가 음계의 규칙을 따르는지 확인합니다.
  • 현실: 로봇들은 이러한 수학적 테스트를 완벽하게 통과할 수 있으며(100점), 그러면서도 인간 전문가에게는 완전히 틀리게 들리는 음악을 만들어낼 수 있습니다.

이것은 학생이 시의 모든 단어 철자를 외웠지만, 정작 그것을 올바른 감정이나 리듬으로 읽는 법은 전혀 모르는 것과 같습니다. 컴퓨터는 "잘했습니다, 철자를 모두 맞혔습니다!"라고 말하지만, 인간은 "이건 정말 엉망이네요"라고 말하는 상황입니다.

5. 결론

이 논문은 가장 똑똑한 AI 모델들이 남아시아 음악의 규칙을 이해하기 시작하고는 있지만, 여로 그 영혼을 포착하는 데는 여전히 서툴다고 결론짓습니다.

  • 이해: 최상위 모델들은 이론(문법)에 대해서는 잘 파악하고 있습니다.
  • 생성: 하지만 이들은 여전히 문화적으로 특정되고 본질적인 느낌을 주는 음악을 만드는 데 어려움을 겪고 있습니다.
  • 미래: 우리는 이 로봇들을 테스트하는 더 나은 방법을 찾아야 합니다. 단순히 음표가 "맞는지"를 확인하는 것이 아니라, 그 음악이 그 문화를 아는 사람에게 "옳게" 느껴지는지를 확인해야 합니다.

요약하자면, 로봇들은 남아시아 음악의 어휘를 배우고 있지만, 아직 그 언어를 모국어 사용자처럼 구사하는 법은 배우지 못했습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →