← 최신 논문
💻 computer science

WBench: A Comprehensive Multi-turn Benchmark for Interactive Video World Model Evaluation

본 논문은 289 개의 테스트 사례와 검증된 자동 평가 지표를 활용하여 비디오 품질, 배경 준수, 상호작용 준수, 일관성, 물리 법칙 준수라는 다섯 가지 핵심 차원에서 대화형 비디오 세계 모델을 체계적으로 평가하기 위해 고안된 포괄적인 다회차 벤치마크인 WBench 를 소개하며, 이를 통해 현재 최첨단 모델 중 어느 것도 모든 영역에서 탁월한 성과를 내지 못함을 규명한다.

원저자: Kaining Ying, Hengrui Hu, Siyu Ren, Jiamu Li, Fengjiao Chen, Ziwen Wang, Xuezhi Cao, Xunliang Cai, Henghui Ding

게시일 2026-05-26
📖 3 분 읽기☕ 가벼운 읽기

원저자: Kaining Ying, Hengrui Hu, Siyu Ren, Jiamu Li, Fengjiao Chen, Ziwen Wang, Xuezhi Cao, Xunliang Cai, Henghui Ding

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

비디오 게임 엔진을 구축한다고 상상해 보세요. 하지만 규칙을 코딩하는 대신, AI 에게 세상을 "꿈꾸게" 하여 존재하게 합니다. 시작 이미지를 제공하고 "이제 앞으로 걸어가, 저 바위 위로 점프하고, 갑자기 헬리콥터가 나타나게 해줘"라고 말합니다. 그럼 AI 는 당신의 명령에 따라 다음 몇 초 분량의 비디오를 생성합니다.

문제는 다음과 같습니다: 우리는 어떻게 AI 가 실제로 이 일을 잘하는지 알 수 있을까요?

현재 이러한 AI "세계 모델"을 테스트하는 다양한 방법들이 있지만, 이는 자동차의 브레이크만 테스트하거나 속도만 테스트하거나 페인트 작업만 테스트하여 자동차를 평가하려는 것과 같습니다. 한 번에 모든 것을 점검하는 단일하고 통합된 테스트는 존재하지 않습니다.

이제 WBENCH가 등장합니다. WBENCH 를 이러한 상호작용형 비디오 AI 를 위한 궁극적인 **"운전면허 시험"**으로 생각하세요.

핵심 아이디어: "세계 시뮬레이터" 테스트

연구진은 WBENCH라는 포괄적인 테스트 세트를 개발했습니다. 단순히 AI 에게 예쁜 비디오를 만들게 하는 대신, 사용자와의 다중 턴 대화를 처리해야 하는 가상 운전 학교에 AI 를 배치했습니다.

다음은 다섯 가지 간단한 범주로 나눈 테스트 작동 방식입니다:

  1. 외관 (비디오 품질): 비디오가 매끄럽고 예쁜지, 아니면 깜빡이고 흐릿한지 확인합니다. 이는 자동차의 페인트가 반짝이는지, 타이어가 둥근지 확인하는 것과 같습니다.
  2. 기억 (설정 준수): AI 에게 "빨간 로봇이 있는 눈 덮인 산"이라고 말했을 때, 전체 비디오 내내 눈과 빨간 로봇을 유지합니까? 아니면 로봇이 갑자기 파란색으로 변하고 눈이 녹아내립니까? 이는 AI 가 자신이 창조한 세계의 규칙을 기억하는지 테스트합니다.
  3. 복종 (상호작용 준수): "왼쪽으로 돌아라"라고 말하면 카메라가 실제로 왼쪽으로 돌아갑니까? "로봇이 점프한다"고 말하면 로봇이 점프합니까? 이는 "스티어링 휠" 테스트입니다. 논문은 일부 AI 가 예쁜 이미지를 만드는 데는 뛰어나지만 사용자의 명령을 실제로 듣는 데는 형편없음을 발견했습니다.
  4. 안정성 (일관성): 카메라가 원형으로 회전하여 다시 시작점으로 돌아왔을 때, 세계가 이전과 정확히 동일하게 보입니까? 아니면 건물이 이동하거나 로봇이 사라졌습니까? 이는 AI 가 세계 배치에 대한 안정적인 "기억"을 가지고 있는지 테스트합니다.
  5. 물리 법칙 (물리적 준수): 공이 떨어지면 아래로 떨어집니까? 자동차가 충돌하면 찌그러집니까? 아니면 공이 하늘로 떠오르고 자동차가 유령처럼 벽을 통과합니까? 이는 AI 가 실제 세계 (또는 판타지 세계) 가 어떻게 작동하는지 이해하는지 테스트합니다.

시험 주행: 그들이 한 일

연구진은 **289 개의 서로 다른 "시나리오"(눈 덮인 산, 붐비는 도시, 판타지 성 등) 의 데이터셋을 구축했습니다. 각 시나리오에 대해 **1,058 개의 지시 (턴) 시퀀스를 생성했습니다.

그들은 20 개의 서로 다른 AI 모델(Kling, Wan, Genie 3 등 주요 이름 포함) 을 테스트했습니다. 이들에게 다음과 같은 지시를 따르도록 요청했습니다:

  • "앞으로 걸어라."
  • "점프하라."
  • "캐릭터 뒤에서 캐릭터의 시점으로 시점을 전환하라."
  • "비를 내리게 해라."

결과: 완벽한 운전자는 없다

테스트를 실행한 후, 논문은 몇 가지 놀라운 사실을 발견했습니다:

  • 아직 "슈퍼 AI"는 존재하지 않습니다: 어떤 자동차도 동시에 가장 빠르고, 가장 안전하며, 가장 연비가 좋은 것은 아니듯이, 어떤 단일 AI 모델도 테스트의 모든 부분을 통과하지 못했습니다. 일부는 예쁜 비디오를 만드는 데는 뛰어나지만 지시를 따르는 데는 형편없었습니다. 다른 일부는 항해에는 뛰어나지만 몇 초 후 세계가 어떻게 생겼는지 잊어버렸습니다.
  • 항해는 까다롭습니다: 카메라를 움직이는 것 (걷거나 회전하는 것) 은 실제로 비디오를 예쁘게 만드는 것과 별개의 기술입니다. AI 는 아름다운 영화를 만들 수 있지만 요청 시 카메라를 움직이는 데 실패할 수 있습니다.
  • "장기전"은 어렵습니다: 대화가 길어질수록 (더 많은 턴을 취할수록) AI 는 실수를 더 많이 하기 시작합니다. 복잡한 이야기를 기억하려는 인간과 같습니다. 시간이 지나면 세부 사항을 혼동하기 시작합니다.
  • 오픈 소스가 따라잡고 있습니다: 누구나 사용할 수 있는 일부 모델은 특정 작업에서 비싸고 폐쇄형 소스 모델만큼 잘하거나 심지어 더 잘 수행했습니다.

결론

WBENCH 는 상호작용형 비디오 AI 를 측정하는 새로운 표준 자입니다. 이 모델들이 영화 제작에는 점점 더 능숙해지고 있지만, 일관되게 지시를 따르고 과거를 기억하며 장기간 물리 법칙을 준수하는 신뢰할 수 있는 "세계 시뮬레이터"가 되는 데는 여전히 어려움을 겪고 있음을 증명합니다.

이 논문은 이러한 모델이 인간 게임 디자이너를 대체하거나 자율주행차를 운행할 준비가 되었다고 말하지 않습니다. 대신 다음과 같이 말합니다: "정확히 어디에서 실패하는지 보여줍니다. 따라서 개발자들은 다음에 무엇을 고쳐야 할지 알 수 있습니다." 이는 다음 세대 AI 가 진정한 상호작용을 하도록 돕는 진단 도구입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →