← 최신 논문
🤖 AI

TMD-Bench: A Multi-Level Evaluation Paradigm for Music-Dance Co-Generation

본 논문은 물리적 지표와 지각적 판단을 결합하여 리듬 정합성과 생성 품질을 평가하는 텍스트 기반 음악-댄스 공동 생성을 위한 포괄적인 다수준 평가 패러다임인 TMD-Bench 를 소개하며, 이를 통해 기존 상용 모델의 한계와 새로운 리듬 정합 기준선의 효과성을 모두 규명합니다.

원저자: Xiaoda Yang, Majun Zhang, Changhao Pan, Nick Huang, Yang Yuguang, Fan Zhuo, Pengfei Zhou, Jin Zhou, Sizhe Shan, Shan Yang, Miles Yang, Yang You, Zhou Zhao

게시일 2026-05-06
📖 3 분 읽기☕ 가벼운 읽기

원저자: Xiaoda Yang, Majun Zhang, Changhao Pan, Nick Huang, Yang Yuguang, Fan Zhuo, Pengfei Zhou, Jin Zhou, Sizhe Shan, Shan Yang, Miles Yang, Yang You, Zhou Zhao

원본 논문은 CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/)에 따라 공공 도메인에 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

로봇에게 동시에 DJ 와 댄서 역할을 하도록 가르치려 한다고 상상해 보세요. "브레이킹 춤을 추는 댄서가 포함된 고에너지 힙합 트랙을 만들어라"와 같은 텍스트 프롬프트를 로봇에게 제공합니다.

문제는 로봇이 음악을 만들거나 비디오를 만드는 데는 매우 능숙해졌지만, 댄서의 동작이 박자에 완벽하게 맞춰지도록 두 가지를 동시에 수행하게 하는 것은 매우 어렵다는 점입니다. 이는 지휘자 없이 드러머와 댄서가 함께 연습하게 하려는 것과 같습니다. 둘 다 individually 는 훌륭할지라도 서로의 신호를 놓치는 경우가 많습니다.

이 논문은 로봇이 이 음악과 춤의 듀오 공연을 얼마나 잘 수행하는지 평가하기 위해 특별히 설계된 새로운 "성적표"인 TMD-Bench를 소개합니다.

다음은 간단한 비유를 사용하여 이 논문이 무엇을 하는지 설명한 것입니다:

1. 문제: "박자에서 벗어난" 댄서

현재의 AI 모델들은 재능 있는 솔로 연주자와 같습니다. 훌륭한 곡을 쓰거나, 사람이 춤추는 아름다운 비디오를 만들 수는 있습니다. 하지만 둘을 동시에 하라고 요청하면 연결고리가 자주 끊어집니다.

  • 비유: 댄서가 점프하는 비디오가 있는데, 음악은 느리고 슬픈 선율을 연주하고 있다고 상상해 보세요. 댄서는 존재하지 않는 박자에 맞춰 움직이고 있습니다. 또는 음악이 빨라지는데 댄서는 여전히 느린 속도로 움직입니다.
  • 문제점: 기존 AI 평가 방식은 음악이 잘 들리는지 또는 비디오가 사실적인지만 확인했습니다. 댄서가 실제로 음악에 맞춰 춤을 추고 있는지는 확인하지 않았습니다.

2. 해결책: 새로운 "성적표" (TMD-Bench)

저자들은 TMD-Bench라는 새로운 테스트 시스템을 구축했습니다. 음악이나 비디오를 따로 보는 대신, 이 시스템은 둘 사이의 "화합"을 평가합니다.

이 시스템은 이중 층 평가 방식을 사용합니다:

  • 1 층: 로봇 심판 (물리적 지표): 이는 스톱워치와 자와 같습니다. 음악이 "박자"를 칠 때와 댄서의 발이 바닥에 닿는 시점을 정확히 계산합니다. 두 사건이 동시에 발생하는지 계산합니다.
  • 2 층: 인간과 같은 심판 (지각): 이는 인간 비평가처럼 행동하는 스마트한 AI(대규모 언어 모델) 를 사용합니다. 비디오를 보고 음악을 들어보며 그것이 느낌상 옳은지 확인합니다. 댄서가 리듬을 진정으로 느끼는 것처럼 보일까요? 에너지가 맞을까요?

성적표는 세 가지를 확인합니다:

  1. 품질: 음악은 좋은가? 비디오는 선명한가?
  2. 지시 따르기: 로봇이 요청한 대로 (예: "힙합"과 "브레이킹") 수행했는가?
  3. 리듬 연결: 이것이 가장 중요한 부분입니다. 댄서가 음악이 지시한 때에 정확히 움직였는가?

3. 새로운 모델: RhyJAM

이 새로운 성적표를 테스트하기 위해 저자들은 RhyJAM이라는 자체 AI 모델을 구축했습니다.

  • 비유: 다른 모델들을 두 명의 별개 작업자로 생각하세요. 한 명은 음악을 쓰고, 다른 한 명은 음악을 보며 댄서가 움직이도록 시도합니다. 그들은 서로 메모를 주고받아야 하므로 지연과 실수가 발생합니다.
  • RhyJAM 의 접근법: RhyJAM 은 음악과 춤을 동시에 통제하는 단일 뇌와 같습니다. 이 둘을 함께 학습하므로 연결은 처음부터 내재되어 있습니다.

4. 발견한 내용

이 논문은 TMD-Bench 를 사용하여 현재 이용 가능한 최고의 AI 모델 (Sora 와 Veo 와 같은 대형 상용 모델 포함) 과 큰 경쟁을 벌였습니다.

  • 좋은 소식: 새로운 모델인 RhyJAM은 훌륭한 성과를 거두었습니다. 가장 비싸고 폐쇄 소스인 상용 모델과 거의 비슷하게 댄서를 박자에 완벽하게 동기화할 수 있었습니다.
  • 나쁜 소식: 심지어 "슈퍼스타"급 상용 모델 (Sora 2 또는 Veo 3 등) 도 리듬 부분에서 어려움을 겪었습니다. 그들은 아름다운 비디오와 훌륭한 음악을 만들었지만, 댄서는 종종 재생 중인 곡이 아닌 다른 곡에 맞춰 춤추는 것처럼 보였습니다. 그들은 "박자에서 벗어난" 상태였습니다.
  • 격차: 오픈 소스 모델 (무료 사용) 과 상용 모델 사이에는 여전히 큰 차이가 있습니다. 상용 모델은 더 보기 좋은 비디오를 만들지만, RhyJAM 은 통합된 모델이 까다로운 "리듬" 부분에서 따라잡을 수 있음을 증명했습니다.

요약

간단히 말해, 이 논문은 다음과 같습니다: "우리는 AI 가 자신의 음악 박자에 맞춰 춤출 수 있는지 확인하기 위한 새로운 테스트를 구축했습니다. 우리는 최고의 AI 들조차 이 부분에서 여전히 다소 어색하다는 것을 발견했습니다. 그러나 우리의 새로운 모델인 RhyJAM은 음악과 춤을 별개의 두 가지가 아닌 하나의 단일 작업으로 취급함으로써 완벽한 타이밍으로 춤추는 법을 배웠습니다."

이 작업의 목표는 미래의 AI 모델들이 실제 음악가와 댄서처럼 음악과 움직임이 깊이 연결되어 있음을 더 잘 이해하도록 돕는 것입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →