← 최신 논문
💻 computer science

WorldMark: A Unified Benchmark Suite for Interactive Video World Models

이 논문은 다양한 상호작용 비디오 월드 모델 간의 공정한 비교를 위해 통일된 행동 매핑 계층, 계층적 테스트 스위트, 모듈형 평가 툴킷을 제공하는 최초의 벤치마크인 'WorldMark'를 소개하고, 이를 통해 모델 성능을 평가할 수 있는 온라인 플랫폼 'World Model Arena'도 함께 출시한다고 설명합니다.

원저자: Xiaojie Xu, Zhengyuan Lin, Kang He, Yukang Feng, Xiaofeng Mao, Yuanyang Yin, Kaipeng Zhang, Yongtao Ge

게시일 2026-04-24
📖 3 분 읽기☕ 가벼운 읽기

원저자: Xiaojie Xu, Zhengyuan Lin, Kang He, Yukang Feng, Xiaofeng Mao, Yuanyang Yin, Kaipeng Zhang, Yongtao Ge

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

🎮 비유: "각자 다른 규칙으로 하는 게임 대회"

지금까지 AI 영상 생성 기술 (세계 모델) 은 마치 각자 다른 규칙으로 게임을 하는 선수들과 같았습니다.

  • YUME는 "앞으로 가"라고 말로 지시하면 움직입니다.
  • Genie는 게임 패드 버튼을 누르면 움직입니다.
  • Matrix-Game은 복잡한 수학 코드를 입력해야 움직입니다.

문제는 이 선수들이 **각자 자기네가 만든 전용 경기장 (비공개 데이터)**에서만 경기를 했다는 점입니다. A 선수가 자기 경기장에서 100 점, B 선수가 자기 경기장에서 90 점을 받았다고 해서, 누가 진짜로 더 뛰어난지 알 수 없죠. "A 가 이긴 게 아니라, 경기장이 A 에게 유리했을 뿐일 수도 있으니까요."

🌟 해결책: "WorldMark(월드마크)"라는 통일된 경기장

이 논문은 **"이제부터는 모두 같은 경기장에서, 같은 규칙으로 경기를 하자!"**라고 제안합니다. 이것이 바로 WorldMark입니다.

1. 통일된 언어 (WASD 키보드) 🎹

모든 AI 모델이 서로 다른 언어를 쓴다는 게 문제였죠? WorldMark 는 모든 AI 에게 'WASD 키보드'라는 공통 언어를 가르칩니다.

  • **W(앞으로), S(뒤로), A(왼쪽), D(오른쪽)**를 누르면, 이 명령을 각 AI 가 알아듣는 형식 (말, 코드, 버튼 신호 등) 으로 자동으로 번역해 줍니다.
  • 마치 통역사가 모든 선수에게 "앞으로 10 미터 가라"는 같은 지시를 전달하는 것과 같습니다.

2. 500 개의 미션 (시험 문제) 📝

단순히 "앞으로 가라"만 시키는 게 아닙니다.

  • 난이도: 20 초 (쉬움) ~ 60 초 (어려움) 까지 단계별로 테스트합니다.
  • 장르: 실사 (리얼한 풍경) 와 만화/게임 스타일 (스타일라이즈드) 을 모두 포함합니다.
  • 시점: 1 인칭 (내가 보는 시점) 과 3 인칭 (등 뒤에서 보는 시점) 을 모두 테스트합니다.
  • 500 개의 미션을 통해 AI 가 얼마나 오랫동안, 얼마나 정확하게 세상을 유지하는지 봅니다.

3. 공정한 심판 (평가 기준) ⚖️

단순히 "예쁘게 나왔나?"만 보는 게 아니라 세 가지 관점에서 심판합니다.

  • 화질 (Visual Quality): 그림이 선명하고 예쁜가?
  • 명령 수행 (Control Alignment): "오른쪽으로 돌아"라고 했을 때, 정말 오른쪽으로 돌아갔는가? (AI 가 명령을 무시하고 제멋대로 움직이면 감점!)
  • 세상 일관성 (World Consistency): 1 분 동안 이동해도 배경이 갑자기 사라지거나, 벽이 뚫리거나, 물체가 변하지 않는가? (이 부분이 가장 중요합니다.)

🔍 놀라운 발견: "예쁜 그림"과 "튼튼한 세상"은 다릅니다!

WorldMark 로 6 개의 주요 AI 모델을 테스트한 결과, 매우 흥미로운 사실이 드러났습니다.

  1. 예쁜 그림 ≠ 튼튼한 세상:

    • YUME라는 모델은 그림이 가장 예쁘고 예술적이었습니다. 하지만 명령을 받으면 배경이 흐트러지거나 물체가 사라지는 등 '세상의 논리'가 무너졌습니다.
    • Genie 3라는 모델은 그림이 YUME 만큼 화려하지는 않았지만, 세상의 물리 법칙과 공간감이 가장 일관성 있게 유지되었습니다.
    • 교훈: "화려한 외관"과 "튼튼한 내부 구조"는 별개의 능력입니다.
  2. 명령을 잘 따르는 것 ≠ 좋은 AI:

    • 어떤 모델은 명령을 100% 정확히 따르지만 (오른쪽으로 돌아라 -> 정확히 돌아감), 그 결과로 나오는 영상이 매우 추하거나 엉망인 경우가 있었습니다.
  3. 3 인칭 시점의 함정:

    • 1 인칭 (내가 보는 시점) 에서는 잘하던 모델들이, 3 인칭 (등 뒤에서 보는 시점) 으로 바뀌면 완전히 망가졌습니다. 캐릭터가 움직일 때 배경이 뒤죽박죽이 되는 등, 아직 3 인칭 시점을 다루는 기술은 매우 어렵다는 것이 증명되었습니다.

🏆 결론: 이제 공정한 대회가 시작됩니다

이 논문은 단순히 점수를 매기는 것을 넘어, 전 세계 연구자들이 같은 기준 (WorldMark) 으로 AI 를 비교하고 발전시킬 수 있는 플랫폼을 만들었습니다.

  • 오프라인: 모든 데이터와 평가 코드를 공개하여 누구나 재현할 수 있게 했습니다.
  • 온라인 (World Model Arena): 일반인도 warena.ai 사이트에 접속해, 두 AI 가 같은 미션을 수행하는 영상을 나란히 보고 "어떤 게 더 나은가?" 직접 투표할 수 있는 라이브 대결 장을 열었습니다.

한 줄 요약:

"이제부터는 AI 들이 각자 자기네 경기장에서 점수를 받는 게 아니라, 모두 같은 'WASD 키보드'로 같은 미션을 수행하며, 누가 가장 튼튼하고 논리적인 가상 세상을 만드는지 공평하게 겨루는 시대가 왔습니다!"

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →