← 최신 논문
💻 computer science

Beyond Time Shifts: Adapting Omni-LLM as a Reference-Free Evaluator for Generative Audio-Visual Models

이 논문은 생성적 실패 사례 데이터셋, 변형된 Omni-LLM, 그리고 실수치 그룹 상대 정책 최적화(Real-Valued Group Relative Policy Optimization)를 활용하여 교차 모달 동기화 평가에 대한 인간의 선호도와 최첨단 정렬을 달성함으로써, 상대적인 인간의 지각과 절대적인 자동화 지표 사이의 역설을 해결하는 생성적 오디오-비주얼 모델을 위한 참조 없는 평가 프레임워크를 소개한다.

원저자: Yijie Qian, Juncheng Wang, Chao Xu, Huihan Wang, Yuxiang Feng, Yang Liu, Baigui Sun, Yong Liu, Shujun Wang

게시일 2026-07-13
📖 5 분 읽기🧠 심층 분석

원저자: Yijie Qian, Juncheng Wang, Chao Xu, Huihan Wang, Yuxiang Feng, Yang Liu, Baigui Sun, Yong Liu, Shujun Wang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 영화를 보고 있다고 상상해 보세요. 개가 짖고 있는데 소리는 장난감 삑삑이 소리처럼 들리거나, 유리가 깨지는데 소리는 물풍선이 터지는 소리가 납니다. AI의 세계에서 이러한 "월드 시뮬레이터(world simulators)"들은 영상과 소리를 놀라울 정도로 잘 만들어내고 있지만, 종종 물리 법칙을 틀리곤 합니다. 동작과 맞지 않는 소리를 만들거나, 아예 소리를 만드는 것을 잊어버리기도 하죠.

오랫동안 과학자들은 이 AI 영화들이 "싱크가 맞는지" 확인하기 위해 "지연 시간 찾기"라는 단순한 게임을 수행하려 했습니다. 완벽한 소리를 가져와서 아주 미세하게 왼쪽이나 오른쪽으로 밀어본 뒤, 컴퓨터가 그 차이를 찾아낼 수 있는지 보는 방식이었죠. 하지만 이 논문의 저자들은 말합니다: 그만두세요! 그것은 마치 소금과 설탕이 같은 병에 들어있을 때, 두 물질의 차이를 구별할 수 있는지로 요리사를 평가하려는 것과 같습니다. 현대의 AI는 단순히 타이밍을 틀리는 것이 아니라, 이야기 자체를 틀리기 때문에 그런 방식은 효과가 없습니다. AI는 일어나지도 않은 일을 위한 소리를 지어내거나, 마땅히 있어야 할 소리를 놓치기도 합니다.

핵심적인 문제: "상대적" 대 "절대적"의 역설

여기서 저자들이 해결해야 했던 까richt한 문제가 있습니다. 인간은 두 개의 형편없는 AI 영상을 볼 때, "영상 A가 영상 B보다 낫다"라고 말하는 것은 매우 쉽습니다. 우리는 비교하는 데 능숙하니까요. 하지만 만약 우리에게 다른 것과 비교할 대상 없이 영상 A에 대해 100점 만점에 몇 점인지 점수를 매기라고 한다면, 우리는 혼란에 빠집니다. 어떤 날은 "70점"이라고 했다가, 다음 날은 "85점"이라고 할 수도 있죠.

하지만 인터넷에서 작동할 수 있는 로봇 심판을 만들기 위해서는 절대적 점수가 필요합니다. 어떤 다른 영상이 존재하든 상관없이 "이 영상은 72.4점이다"라고 말해줄 수 있는 숫자가 필요합니다. 논문은 우리가 인간에게 숫자 하나를 달라고 요청하는 것만으로는 부족하며, 우리의 "더 나음/더 못함"이라는 느낌을 어떻게 "72.4"라는 숫자로 바꿀 것인지를 기계에게 가르쳐야 한다고 주장합니다.

해결책: 새로운 종류의 로봇 심판

연구팀은 Beyond Time Shifts라고 불리는 세 단계의 시스템을 구축하여 이 문제를 해결했습니다.

1. "SynthSync" 놀이터 (데이터셋)
소리를 밀어서 오류를 흉내 내는 대신, 그들은 SynthSync라는 놀이터를 만들었습니다. 실제 영상을 가져와 10가지의 최상급 AI 사운드 생성기를 통과시켰습니다. 이를 통해 "진정한 실패 사례"들의 더미를 만들었습니다.

  • 비유: 10명의 서로 다른 요리사에게 같은 레시피로 수프를 만들라고 요청한다고 상상해 보세요. 어떤 요리사는 마늘을 태우고, 어떤 요리사는 소금을 잊어버리고, 어떤 요리사는 후추를 너무 많이 넣습니다. 저자들은 단순히 수프를 본 것이 아니라, 전문가들에게 두 그릇을 한 번에 맛보게 하고 "요리사 A가 요리사 B보다 낫다"라고 말하게 했습니다. 이 과정을 306,000번 반복하여 누가 누구보다 나은지에 대한 거대한 지도를 구축했습니다.

2. 새로운 뇌를 가진 "Omni-LLM"
그들은 Omni-LLM(구체적으로는 Qwen2.5-Omni-3B 모델)이라는 초지능 AI를 가져와 새로운 직무를 부여했습니다. 보통 이 AI는 "좋음" 또는 "나쁨"과 같은 단어로 말하지만, 저자들은 그 단어 생성기를 뽑아내고 그 자리에 연속적인 슬라이더를 설치했습니다.

  • 비유: AI가 "좋다!" 혹은 "나쁘다!"라고 외치는 대신, 이제는 슬라이더 위의 하나의 매끄러운 숫자를 출력합니다. 그들은 SynthSync 놀이터에서 얻은 "더 나음/더 못함" 데이터를 사용하여 AI를 훈련시켰습니다. 또한 Bradley-Terry-Luce라는 수학적 기법을 사용하여, AI가 A가 B보다 낫다고 생각한다면 A의 점수가 B보다 높아야 한다는 것을 가르쳤습니다.

3. "R-GRPO" 마법 (강화 학습)
이것이 바로 비법입니다. 단순히 "A가 B보다 낫다"는 것을 아는 것만으로는 부족합니다. AI는 전체 그룹을 이해해야 합니다. 만약 요리사 A가 최고이고, B는 중간이며, C가 최악이라면, 점수는 반드시 그 순서를 따라야 합니다.

  • 비유: AI가 시험을 치르는 학생이라고 상상해 보세요. 선생님(R-GRPO 알고리즘)은 학생이 문제를 맞혔는지 하나하나 체크하는 대신, 전체 답안 목록을 봅니다. 선생님은 "가우시안 정책(Gaussian policy, 즉 탐색을 위해 약간의 무작위 노이즈를 추가하는 방식)"을 사용하여, AI가 한꺼번에 전체 요리사들의 완벽한 순위를 찾아낼 수 있는지 확인합니다.
  • 결과: 이 방법을 사용함으로써, AI는 인간 전문가의 판단과 놀라울 정도로 일치하는 점수를 주는 법을 배웠습니다.

무엇을 발견했는가 (숫자들)

저자들은 자신들의 새로운 로봇 심판을 기존의 방식들(AV-Align, JavisScore, DeSync)과 테스트했습니다.

  • 기존 방식: 기존의 지표들은 고장 난 자와 같았습니다. 소리가 제때 발생하더라도 내용이 엉망이라면, 그들은 실제로는 엉터리인 영상에 높은 점수를 주곤 했습니다.
  • 새로운 방식: SynthSync 데이터셋으로 훈련되고 R-GRPO로 미세 조정된 이 새로운 지표는 **쌍체 정확도(Pairwise Accuracy) 72.38%**를 달 дости했습니다. 이는 두 영상을 비교했을 때 인간 전문가와 **72.38%**의 일치율을 보였음을 의미합니다.
  • 비교: 테스트한 방법 중 그다음으로 뛰어난 방법은 **69.36%**의 정확도만을 기록했습니다.
  • 리더보드: 그들은 이 새로운 심판을 사용하여 6개의 유명한 AI 비디오 모델(Sora-2, Veo-3.1, LTX-2 포함)의 순위를 매겼습니다. 그들의 심판은 Sora-2Veo-3.1이 물리 법칙을 이해하는 데 가장 뛰어나며, 다른 모델들은 어려움을 겪고 있다는 것을 명확히 보여주었습니다.

이 논문이 명시적으로 배제한 것들

논문은 무엇이 작동하지 않는지에 대해서도 매우 명확하게 밝히고 있습니다:

  • 시간 이동 (Time Shifts): 저자들은 현대 AI에게 단순히 오디오를 앞뒤로 미는 방식(기존 표준)은 구조적 환각(invented sounds, 지어낸 소리)을 잡아낼 수 없기 때문에 무용지물이라고 주장합니다.
  • 이산적 단어 (Discrete Words): AI가 "좋음" 또는 "나쁨"과 같은 단어를 출력하게 하는 것(텍xt 생성 방식)은 좋지 않은 아이디어임을 발견했습니다. 이는 "양자화 아티팩트(quantization artifacts)"를 만들어내어 점수가 너무 들쭉날쭉하고 매끄럽지 못하게 만들기 때문입니다.
  • 단순 회귀 (Simple Regression): 그들은 숫자를 직접 예측하도록 AI를 훈련시키는 단순 회귀를 시도했으나 실패했습니다. 이 방식의 Kendall's τ0.1628에 불과했습니다(순위가 현실과 얼마나 일치하는지를 나타내는 척도). 반면 그들의 새로운 방식은 0.4899를 기록했습니다.

얼마나 확신하는가?

저자들은 단순히 추측한 것이 아니라 측정했기 때문에 결과에 매우 자신감이 있습니다.

  • 그들은 185개의 프롬프트("나무 켜기", "비", "오토바이" 등)로 구성된 표준화된 벤치마크인 SyncBench를 구축했습니다.
  • 그들은 이 지표를 "보상 신호(reward signal, AI가 스스로 개선되도록 알려주는 방식)"로서 테스트했습니다. 후보군 중에서 최고의 AI 영상을 고를 때, 이 지표를 사용하면 교차 지표 테스트에서 무작위 추측보다 5.0589배 더 잘 작동했습니다.
  • 그들은 R-GRPO 훈련 단계를 제거했을 때 점수가 크게 떨어짐(72.38%에서 71.07%로)을 보여줌으로써, 자신들의 방법론이 필수적임을 증명했습니다.

요약하자면, 이 논문은 AI 영화를 심판하기 위해서는 단순히 지연 시간을 찾는 것이 아니라, 소리의 이야기를 이해하는 심판이 필요하다고 제안합니다. 인간의 "더 나음/더 못함"이라는 느낌을 매끄럽고 연속적인 숫자로 변환함으로써, 그들은 마침내 우리가 세상을 보는 방식 그대로를 포착하는 도구를 만들어냈습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →