← 최신 논문
💻 computer science

MuseBench: Benchmarking Intent-Level Audiovisual Arts Understanding in MLLMs

이 논문은 다양한 시청각 예술 분야에 걸쳐 전문가의 검증을 거친 4,000개 이상의 문항으로 구성되어 멀티모달 거대 언어 모델의 의도 수준 추론 능력을 평가하도록 설계된 종합 벤치마크인 MuseBench를 소개하며, 현재의 AI 시스템과 창의적인 예술적 의도를 이해하는 인간 전문가 사이의 상당한 성능 격차를 드러낸다.

원저자: Yuxuan Fan, Gyusik Seo, Jing Hao, Jaemin Cho, Mohit Bansal, Jaehong Yoon

게시일 2026-06-30
📖 3 분 읽기☕ 가벼운 읽기

원저자: Yuxuan Fan, Gyusik Seo, Jing Hao, Jaemin Cho, Mohit Bansal, Jaehong Yoon

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 영화를 보고 있다고 상상해 보세요. 일반적인 비디오 AI는 "어두운 방 안에서 한 남자가 울고 있습니다"라고 말할 것입니다. 그것은 픽셀을 보고 사물을 인식하는 것이죠.

하지만 MuseBench는 훨씬 더 어려운 질문을 던집니다: "왜 감독은 방을 어둡게 만들고 카메라를 흔들기로 선택했을까? 이는 관객에게 갇힌 느낌을 주기 위해서일까, 아니면 캐릭터가 정신을 잃어가고 있음을 보여주기 위해서일까?"

이 논문은 AI가 단순히 표면적인 세부 사항을 넘어 **예술적 영혼(artistic soul)**을 이해할 수 있는지 테스트하기 위해 설계된 새로운 "시험"인 MuseBench를 소개합니다. 이 기술이 어떻게 작동하는지 간단히 설명하면 다음과 같습니다.

1. 문제점: AI는 "비평가"가 아니라 "스포일러"이다

현재의 AI 모델은 사물을 찾아내는 것(예: "개" 또는 "자동차")에는 뛰어납니다. 하지만 예술(영화, 회화, 연극, 비디오 게임)에 있어서는 그 의도를 이해하는 데 어려움을 겪습니다.

  • 비유: 극 전체의 대본을 통째로 암기할 수는 있지만, 배우가 왜 말을 하기 전 3초 동안 멈췄는지 이해하지 못하는 학생을 상상해 보세요. 그들은 무엇이 일어났는지는 알지만, 그런 방식으로 행해졌는지는 모릅니다.
  • 격차: 기존의 테스트들은 "무슨 일이 일어나고 있는가?"만을 묻습니다. MuseBench는 "예술가가 당신에게 무엇을 느끼게 하려 했으며, 그것을 어떻게 구현했는가?"를 묻습니다.

2. 해결책: "비디오 에세이" 라이브러리

이 테스트를 구축하기 위해 연구진은 단순히 무작위 클립을 가져오지 않았습니다. 그들은 인터넷(YouTube, Bilibili, TikTok)을 뒤져 **10,000개 이상의 "비디오 에세이"**를 수집했습니다.

  • 비디오 에세이란 무엇인가? 특정 조명 선택이 어떻게 공포감을 조성하는지, 혹은 특정 카메라 각도가 어떻게 캐릭터를 강력해 보이게 만드는지를 클립 위로 짚어가며 설명하는 영화 평론가의 이야기라고 생각하면 됩니다.
  • 과정: 연구진은 AI를 사용하여 이러한 전문가들의 비평을 시험 문제로 변환했습니다. 그들은 다음 네 가지 주요 예술 영역을 아우르는 4,016개의 질문을 만들었습니다:
    1. 영화 (영화/TV 시리즈)
    2. 정적 시각 예술 (회화/사진)
    3. 무대 공연 (연극/무용)
    4. 게임 아트 (비디오 게임)

3. 시험 형식: 단순한 "A, B, C, D"가 아니다

진정한 예술은 종종 해석의 여지가 있습니다. 어떤 그림은 "외로움"인 동시에 "평온함"일 수도 있습니다.

  • 기존 방식: 대부분의 AI 테스트는 하나의 정답만을 고르도록 강요합니다 (마치 객관식 퀴즈처럼).
  • MuseBench 방식: 이들은 단일 선택형(최선의 답 하나 선택)과 다중 선택형(유효한 모든 해석 선택)을 혼합하여 사용합니다.
    • 비유: 만약 당신에게 "이 노래는 무엇에 관한 것인가?"라고 묻는 단순한 테스트라면 "슬픔" 하나만 고르게 할 것입니다. 하지만 MuseBench는 영상에서 뒷받침된다면 "슬픔"과 "희망"을 모두 고를 수 있게 합니다. 이는 AI가 인간 예술의 복잡성을 다룰 수 있는지 테스트합니다.

4. 결과: AI는 여전히 "초보자" 수준이다

연구진은 오늘날 가장 똑똑한 28개의 AI 모델(GPT-4, Claude, Gemini와 같은 유명 모델 포함)을 대상으로 이 시험을 치렀습니다.

  • 점수: 가장 뛰어난 AI조차 정답률이 약 **48%**에 불과했습니다.
  • 인간 점수: 예술 전문가들은 **87%**의 정답률을 기록했습니다.
  • 시사점: AI는 질문의 절반 정도를 추측하고 있는 셈입니다. 아직 예술의 "언어"를 배우지 못했습니다.

5. 어디에서 실패하는가?

논문은 AI가 실패하는 몇 가지 재미있고 구체적인 패턴을 발견했습니다:

  • "게임"에 대한 사각지대: AI는 비디오 게임을 이해하는 데 매우 형편없는 모습을 보였습니다. AI는 많은 영화 대본을 읽었을지 모르지만, 게임 디자인이 어떻게 감정을 만들어내는지 이해할 만큼 충분히 "플레이"해보지 못한 것으로 보입니다.
  • "첫 번째 옵션" 편향: AI는 답을 모를 때, 인간보다 더 자주 첫 번째 옵션(Option A)을 선택하는 이상한 습관을 보였습니다.
  • "현저성(Salient)"의 함정: 여러 개의 정답이 있는 질문에서, AI는 대개 가장 명백한 답은 찾아내지만 미묘한 답은 놓쳤습니다. 이는 큰 나무는 보되 숲은 보지 못하는 것과 같습니다.

요약

MuseBench는 AI에 대한 현실 점검입니다. 이는 AI가 영상을 묘사할 수는 있지만, 그 이면에 담긴 창의적 선택을 이해하는 데는 여전히 매우 서투르다는 것을 증명합니다. 더 나아지기 위해서 AI는 단순히 픽셀을 "보는" 것을 넘어, 예술가, 감독, 게임 디자이너들의 "어휘"를 배우기 시작해야 합니다.

핵심 결론: 우리는 그림을 설명할 수 있는 AI를 가지고 있지만, 아직 그것을 진정으로 감상할 수 있는 AI는 가지고 있지 않습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →