← 최신 논문
💻 computer science

MultiRef-Compass: Towards Comprehensive Evaluation of Multi-Reference-to-Audio-Video Generation

이 논문은 다중 참조를 오디오-비디오 콘텐츠로 생성하는 시스템의 보존, 결합 및 다중 참조를 일관되고 동기화된 콘텐츠로 구성하는 능력을 종합적으로 평가하기 위해 설계된, 350개의 엄선된 샘플과 14개의 하위 지표를 갖춘 4차원 평가 프로토콜로 구성된 통합 벤치마크인 MultiRef-Compass를 소개한다.

원저자: Xiaohan Zhang, Yuqing Wen, Junlin Chen, Yuqi Tang, Yiting He, Lizhuo Shao, Weiming Zhu, Tengfei Liu, Yang Shi, Jialu Chen, Yuanxing Zhang, Huaxiong Li

게시일 2026-07-17
📖 3 분 읽기☕ 가벼운 읽기

원저자: Xiaohan Zhang, Yuqing Wen, Junlin Chen, Yuqi Tang, Yiting He, Lizhuo Shao, Weiming Zhu, Tengfei Liu, Yang Shi, Jialu Chen, Yuanxing Zhang, Huaxiong Li

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 영화 장면을 촬영하려는 감독이라고 상상해 보세요. 과거의 AI 비디오 시대에는 컴퓨터에 "고양이 영상을 만들어줘"라는 단순한 대본만 줄 수 있었습니다. 그러면 AI는 고양이가 어떻게 생겼는지, 어디에 있는지, 어떤 소리를 내는지 스스로 추측했습니다. 하지만 이제 창작자들은 더 많은 통제권을 원합니다. 그들은 "내 강아지의 얼굴은 특정 사진을 사용하고, 옆모습은 다른 사진을 사용하며, 그가 가장 좋아하는 장난감은 세 번째 사진을 사용하면서, 특정 소리에 맞춰 짖게 해줘"라고 말하고 싶어 합니다. 이것이 바로 다중 참조 오디오-비디오(Multi-Reference-to-Audio-Video, MR2AV) 생성의 세계입니다. 이는 마치 AI에게 단순히 요리를 하는 것을 넘어, 세 개의 서로 다른 병에서 특정 재료를 꺼내 쓰고, 사진에 보이는 모습 그대로 접시에 배치하며, 요리하는 동작과 지글거리는 소리가 완벽하게 일치하도록 만드는 마스터 셰프가 되라고 요구하는 것과 같습니다. 문제는 우리가 AI가 이 복잡한 춤을 얼마나 잘 추고 있는지 평가할 좋은 방법이 없었다는 점입니다. 단순한 레시피에 대한 테스트는 있었지만, 이 다중 재료, 다중 감각적인 도전 과제를 위한 것은 없었습니다.

여기에 연구자들이 바로 이 기술을 테스트하기 위해 설계한 새로운 "성적표"인 MultiRef-Compass가 등장했습니다. 이것은 AI 비디오 제작자들을 위한 엄격한 '맛 테스트'라고 생각하면 됩니다. 연구팀은 350개의 정교하게 제작된 시나리오로 구성된 특별한 데이터셋을 구축했습니다. 예를 들어, 모든 참가자가 사람, 신발, 식사하는 사람의 사진 세 장을 똑같이 받고, "사람이 신발을 신어보며 사이즈가 맞는지 묻는다"라는 대본을 받는 요리 쇼 챌린지와 같은 방식입니다. 그런 다음 Kling, Seedance, Gemini와 같은 유명한 모델들을 포함한 8개의 서로 다른 AI 모델에게 영상을 생성하도록 요청했습니다.

연구진은 단순히 영상이 "보기 좋은지"만 본 것이 아닙니다. 그들은 채점 기준을 다음과 같이 네 가지 구체적인 카테키토리로 세분화했습니다:

  1. 기본 품질: 영상이 선명하고 소리가 좋은지, 아니면 흐릿하고 지지직거리는지 확인합니다.
  2. 참조 일관성: AI가 실제로 제공된 사진들을 사용했는지 확인합니다. 사람의 얼굴을 그대로 유지했나요, 아니면 실수로 낯선 사람으로 바꿨나요? 신발을 발에 제대로 붙였나요, 아니면 화면에 신발 스티커를 그냥 붙여놓았나요?
  3. 오디오-비디오 일관성: 영상 속 사람이 말할 때 입술이 움직이나요? 발로 바닥을 밟을 때 발소리가 들리나요?
  4. 지시 이행: AI가 대본이 요구한 것을 정확히 수행했나요, 아니면 신발에 대한 부분을 무시하고 그냥 걷는 모습만 보여주었나요?

이를 채점하기 위해 그들은 컴퓨터 도구와 함께, 영화 평론가처럼 행동하는 "초지능 AI 심사위원"(대규모 멀티모달 모델)을 혼합하여 사용했습니다. 또한 AI 비평가가 너무 엄격하거나 너무 관대하지 않도록, 즉 점수가 공정하도록 하기 위해 특별한 "재심사" 단계를 추가했습니다.

결과는 현실을 직시하게 해주었습니다. 일부 모델은 보기 좋은 결과물을 만드는 데 매우 능숙해지고 있지만, 어려운 작업에서는 여전히 고전하고 있습니다. 논문은 현재의 모델들이 결합(binding) 문제에서 자주 실패한다고 지적합니다. 즉, 사진 속의 얼굴은 인식할지 몰라도 그것을 몸에 연결하는 것을 잊어버리거나, 누가 말하고 있는지 혼동할 수 있다는 것입니다. Seedance 2.0 모델은 네 가지 카테고리 모두에서 우수한 성적을 거두며 가장 균형 잡힌 모습을 보여주어 종합 1위를 차지했습니다. 그러나 최고의 모델조차도 "개선할 여지가 상당함"을 보여주었습니다. 연구진은 AI에게 여러 참조 자료와 복잡한 지시를 동시에 다루도록 요청할 때, AI가 종종 실수를 하여 캐릭터가 컷아웃(종이 인형)처럼 보이거나, 목소리가 화자와 일치하지 않거나, 이야기가 뒤섞이는 영상을 만들어낸다는 것을 발견했습니다.

요약하자면, MultiRef-Compass는 AI 비디오가 인상적이긴 하지만, 아직 복잡한 다중 참조 이야기를 담아내는 신뢰할 수 있는 감독이 되기에는 준비가 덜 되었음을 보여줍니다. 이는 여러 단서를 하나의 일관되고 자연스러운 장면으로 엮어내는 법을 배우기 위해 더 많은 훈련이 필요한 도구입니다. 이 벤치마크는 이제 모두에게 공개되어, 미래의 AI 모델들이 이 특유의 까다로운 창의적 작업을 더 잘 수행할 수 있도록 돕는 토대로 활용될 것입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →