← 최신 논문
💻 computer science

WorldJen: An End-to-End Multi-Dimensional Benchmark for Generative Video Models

WorldJen 은 고해상도 리커트 척도 기반 VLM 평가를 결함 있는 이진형 VQA 를 대체하는 엔드투엔드 다차원 벤치마크를 제시하며, 적대적으로 선별된 프롬프트와 견고한 3 단계 평점 체계를 통해 인간 선호도 순위와 완벽한 정렬을 달성합니다.

원저자: Karthik Inbasekar, Guy Rom, Omer Shlomovits

게시일 2026-05-06
📖 4 분 읽기☕ 가벼운 읽기

원저자: Karthik Inbasekar, Guy Rom, Omer Shlomovits

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

거대한 고액의 요리 대회에서 심사위원장을 상상해 보세요. 하지만 음식을 맛보는 대신 인공지능이 생성한 비디오를 시청합니다. 당신의 임무는 어떤 AI 셰프가 가장 뛰어난지 결정하는 것입니다.

오랫동안 심사위원들은 잘못된 도구를 사용해 왔습니다. 그들은 이미지가 얼마나 '픽셀 단위에서 완벽'한지 측정하기 위해 자를 들이밀었습니다 (소금 알갱이의 크기가 적절한지 확인하는 것처럼) 또는 색상들이 참조 사진과 일치하는지 보기 위해 주파수 분석기를 사용했습니다. 하지만 이러한 도구들은 큰 그림을 놓쳤습니다: 셰프가 실제로 요리를 했을까요? 재료들은 논리적이었을까요? 수프가 넘쳐흘렀을까요? 아니면 셰프는 단순히 흐릿하지만 수학적으로 완벽한, 음식과 전혀 닮지 않은 혼란을 만들어냈을까요?

최근의 다른 시도들은 심사위원들에게 "물리 법칙이 올바른가?"와 같은 단순한 '예/아니오' 질문을 던지는 방식을 취했습니다. 하지만 인간 (그리고 AI 심사위원) 은 비디오가 완전히 망가져 있지 않는 한 '예'라고 말하려는 경향이 있습니다. 이로 인해 '좋은' 비디오와 '훌륭한' 비디오 사이의 차이를 구분하는 것이 불가능해졌습니다.

이제 WORLDJEN이 등장합니다. 이를 이러한 문제들을 해결하도록 설계된 완전히 새롭고 초고급 심사 시스템으로 생각하세요. 작동 원리는 다음과 같이 간단한 단계로 나뉩니다:

1. 메뉴: 선별된 프롬프트

AI 에게 "고양이 비디오를 만들어라"라고 요청하는 대신, 연구자들은 3,754 개의 복잡한 '레시피'(프롬프트) 로 구성된 구체적인 메뉴를 만들었습니다. 이러한 것들은 단순한 요청이 아닙니다. 다음과 같이 16 가지 다른 기술을 동시에 테스트하도록 설계되었습니다:

  • 동작: 캐릭터가 매끄럽게 움직이는가, 아니면 떨리는가?
  • 물리 법칙: 공이 던져지면 중력이 말하듯 떨어지는가?
  • 논리: 사람이 나무 뒤로 걸어가면 올바르게 사라졌다가 다시 나타나는가?
  • 미학: 조명과 색상이 아름다운가?

2. 인간 미각 테스트 (Ground Truth)

컴퓨터에게 심사를 맡기기 전에 연구자들은 '황금 표준'이 필요했습니다. 그들은 7 명의 인간 전문가를 고용하여 300 개의 비디오 (6 개의 서로 다른 최상위 AI 모델이 생성한 것) 를 시청하게 하고 어떤 것이 더 나은지 투표하게 했습니다.

  • 결과: 인간들은 명확한 '3 단계' 순위 합의를 이루었습니다.
    • 최상위 티어: 두 개의 모델 (Veo 3.1 과 Kling) 이 명확하게 가장 뛰어났습니다.
    • 중간 티어: 세 개의 모델은 좋았지만 서로 통계적으로 구별할 수 없었습니다.
    • 최하위 티어: 한 개의 모델이 다른 모델들보다 명확히 뒤처졌습니다.
      이 인간 순위는 모든 것이 측정되는 '진실'입니다.

3. AI 심사위원 (VLM)

이제 연구자들은 질문했습니다: "AI 심사위원 (시각 - 언어 모델) 이 인간만큼 이 일을 잘할 수 있는가?"
그들은 AI 에게 단순히 "이게 좋은가?"라고 묻지 않았습니다. 대신 그들은 모든 비디오에 대해 리커트 척도 설문지(Yelp 리뷰와 같은 1 점부터 5 점까지의 평가 시스템) 를 AI 에게 제공했습니다.

  • 비법: AI 심사위원은 비디오를 원본 해상도 전체로 봅니다 (작은 썸네일로 축소된 것이 아닙니다). 그것은 비디오당 10 개의 구체적인 질문을 스스로에게 던집니다 (예: "캐릭터의 손이 깜빡였는가?" 또는 "그림자가 올바르게 움직였는가?").
  • 점수: 그것은 각 질문에 점수를 매기고, 이를 최종 순위로 결합합니다.

4. 대폭로

AI 심사위원의 순위가 인간 미각 테스트와 비교되었을 때, 결과는 충격적이었습니다: 완벽하게 일치했습니다.

  • AI 는 최상위 티어, 중간 티어, 최하위 티어를 정확하게 식별했습니다.
  • 그것은 모델의 순서에서 인간과 100% 일치했습니다.
  • 이는 AI 심사위원이 비싼 인간 심사위원을 대신할 수 있는 신뢰성 있고 저렴하며 빠른 대안이 될 수 있음을 증명합니다.

5. 왜 이것이 VBench 보다 더 나은가

이 논문은 WORLDJEN 을 VBench 라는 기존 시스템과 비교합니다.

  • VBench는 열쇠구멍을 통해 비디오를 흐릿하게 보는 (저해상도) 심사위원과 같습니다. 그리고 색상이 대략적으로 올바른지 여부만 확인합니다. 차이점이 너무 작아 보이지 않기 때문에 종종 모두에게 '완벽한' 점수를 줍니다.
  • WORLDJEN은 전체 비디오를 살펴보는 돋보기를 가진 심사위원과 같습니다. 그것은 VBench 가 놓치는 물리 법칙의 미세한 균열과 미묘한 결함을 찾아냅니다.
  • 결과: VBench 는 인간과 비교하여 모델을 올바르게 순위 매기지 못했지만, WORLDJEN 은 올바르게 했습니다.

6. "물리 법칙 격차" 발견

이 새로운 시스템에서 나온 가장 흥미로운 발견 중 하나는 "물리 법칙 격차"입니다.
세계 최고의 AI 모델조차도 기본적인 물리 법칙을 이해하는 데 여전히 매우 서툴러 있습니다.

  • 비유: AI 셰프들이 음식을 플레이팅하는 것 (아름답게 보이게 하는 것) 과 테이블을 차리는 것 (구도) 에는 놀라울 정도로 능숙하다고 상상해 보세요. 하지만 실제로 음식을 '요리'하는 것 (공이 튀거나 물이 흐르게 하는 것) 을 요청하면, 그들은 종종 실패합니다.
  • 논문은 최상위 모델조차도 "물리 역학"과 "관성 일관성"에서 낮은 점수를 받았음을 발견했습니다. 그들은 좋아 보이지만, 아직 우주의 법칙을 완전히 따르지는 않습니다.

요약

WORLDJEN은 AI 비디오 생성기를 테스트하는 새롭고 더 지능적인 방법입니다. 그것은 AI 를 도전하기 위해 복잡한 '레시피'를 사용하고, 인간이 기준을 설정하며, 그런 다음 똑똑한 AI 심사위원이 인간만큼 좋은 평가를 할 수 있음을 증명합니다. 이는 AI 비디오가 놀랍게 보이지만, 여전히 실제 세계가 물리적으로 어떻게 작동하는지 이해하는 데 어려움을 겪고 있음을 보여줍니다.

이 논문이 주장하지 않는 것:

  • 이 시스템이 의료 진단이나 임상 사용에 준비되었다고 주장하지 않습니다.
  • 이것이 내일 할리우드에서 영화 제작 방식을 즉시 바꿀 것이라고 주장하지 않습니다.
  • AI 심사위원이 모든 단일 시나리오에서 완벽하다고 주장하지 않으며, 단지 이 특정 테스트 세트에서 인간 순위와 일치한다고 주장할 뿐입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →