← 최신 논문
💻 computer science

What-If World: A Causal Benchmark for General World Models in Embodied Scenarios

본 논문은 단일 변수 변화에 대한 물리적으로 일관되고 인과적으로 분기된 결과를 생성하는 비디오 생성 모델의 능력을 평가하는 319 개의 프롬프트 쌍으로 구성된 새로운 벤치마크인 "What-If World"를 소개하며, 이를 통해 최신 최첨단 모델이 계획 및 제어를 위한 구체적 시나리오를 신뢰할 수 있도록 시뮬레이션하는 데 크게 실패하고 있음을 밝힙니다.

원저자: Kunlin Cai, Rui Song, Jinghuai Zhang, Kaiyuan Zhang, Pranav Bodapati, Alicia Yu, Fnu Suya, Mohammad Rostami, Jiaqi Ma, Yuan Tian

게시일 2026-05-28
📖 3 분 읽기☕ 가벼운 읽기

원저자: Kunlin Cai, Rui Song, Jinghuai Zhang, Kaiyuan Zhang, Pranav Bodapati, Alicia Yu, Fnu Suya, Mohammad Rostami, Jiaqi Ma, Yuan Tian

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

상상해 보세요. 매우 재능 있는 화가가 있어 incredibly 사실적인 장면을 그릴 수 있다고요. 만약 그에게 "부드럽게 제동하는 차"를 그려달라고 하면 훌륭하게 그립니다. "강하게 제동하는 차"를 그려달라고 해도 역시 훌륭하게 그립니다. 두 그림 모두 그 자체로 완벽해 보입니다.

하지만 함정이 있습니다. What-If World는 다른 질문을 던집니다. "지시사항을'부드럽게'에서'강하게'로 바꾸었을 때, 결과가 물리학이 말하듯 실제로 변하는가?"라고 묻는 것입니다.

실제 세상에서는 강한 제동이 부드러운 제동보다 차를 훨씬 더 빨리 멈춥니다. 하지만 현재의 AI 비디오 생성기들의 세계에서는 화가가 지시사항이 완전히 달랐음에도 불구하고 두 그림의 정지 거리가 거의 동일하게 그려질 수 있습니다. AI는 차의 모습을 그리는 데는 능숙하지만, 차가 움직이는 논리를 이해하는 데는 서툴러요.

문제:"닮은꼴"함정

현재의 AI 비디오 모델 평가는 학생의 숙제를 페이지별로 개별적으로 채점하는 것과 같습니다.

  • 1 페이지: "부드럽게 제동하는 차를 그려라." (그림이 잘 그려졌다. 합격.)
  • 2 페이지: "강하게 제동하는 차를 그려라." (그림이 잘 그려졌다. 합격.)

선생님은 두 페이지를 나란히 비교해 보지 않습니다. 그래서 두 그림 모두 차가 정확히 같은 곳에서 멈추는 것을 보여주고 지시사항의 차이를 완전히 무시하더라도 AI 는 A 를 받습니다. 이를 **대조적 병목 현상 (Contrastive Bottleneck)**이라고 합니다. AI 는 무언가를 보여지는 대로 사실적으로 만들 수는 있지만, 규칙을 바꿨을 때 무언가가 다른 방식으로 행동하도록 만들 수는 없습니다.

해결책: What-If World

연구자들은 What-If World라는 새로운 테스트를 개발했습니다. 비디오 하나씩을 채점하는 대신, AI 를 동일한 시작 장면에서 출발하되 지시사항에 미세한 변화가 있는 **쌍 (pairs)**의 비디오를 생성하도록 강요합니다.

"차이를 찾아라"게임처럼 생각하되, AI 는 물리학에 기반해 스스로 그 차이를 창조해야 합니다.

설정:

  1. 앵커 (The Anchor): 차나 로봇 팔이 움직이기 직전의 실제 사진을 가져옵니다. 이것이 두 비디오 모두에게 동일하게 적용되는"얼어붙은 순간"입니다.
  2. 반전 (The Twist): AI 에게 물리적 세부 사항 하나만 다른 두 가지 프롬프트를 줍니다.
    • 프롬프트 A: "로봇 팔이 블록을 부드럽게 밀어라."
    • 프롬프트 B: "로봇 팔이 블록을 강하게 밀어라."
  3. 테스트: AI 는 두 개의 비디오를 생성해야 합니다. 연구자들 (초지능 AI 심판 사용) 은 다음을 확인합니다.
    • 로봇이 실제로 밀었는가? (준수성, Adherence)
    • 블록이 물리적으로 가능한 방식으로 움직였는가? (물리성, Physics)
    • 배경은 동일하게 유지되었는가? (환경, Environment)
    • 중요하게: "강하게 밀기"비디오가"부드럽게 밀기"비디오보다 블록이 더 멀리 또는 더 빠르게 움직이는 것을 보였는가? (결과, Outcome)

게임의 여섯 가지 규칙

테스트를 공정하고 과학적으로 만들기 위해 연구자들은 변화를 물리학의 여섯 가지 구체적인"규칙"으로 조직화했습니다. 두 가지 범주로 나뉩니다:

1. 환경 (무대):

  • 마찰력: 도로는 얼어있거나 건조한가? (차가 미끄러지는가?)
  • 재질/매체: 물체는 스펀지인가 벽돌인가? (눌려 찌그러지는가 아니면 단단한가?)
  • 장애물: 길에 원뿔이 있는가? (차가 부딪히거나 우회하는가?)

2. 행동 (배우):

  • 힘/정도: 밀거나 제동하는 힘이 얼마나 강한가?
  • 공간적 정렬: 로봇이 정확히 어디를 잡는가?
  • 시간적 순서: 로봇은 움직이기 에 잡았는가 에 잡았는가?

결과: AI 는 여전히 초보입니다

연구자들은 세계에서 가장 똑똑한 비디오 AI 모델 9 개 (오픈소스와 고가의 폐쇄소스 모두 포함) 를 테스트했습니다. 결과는 냉담했습니다:

  • 한계: 최고의 모델조차 테스트의 약 **52%**만 통과했습니다.这意味着 거의 절반은 실패한 것입니다.
  • 격차: 오픈소스 모델은 더 나빠서 28% 부근에 몰려 있었습니다.
  • 착시: 대부분의 모델은"단일 비디오"테스트에서는 높은 점수를 받았습니다 (비디오가 훌륭해 보임). 하지만"쌍"테스트에서는 실패했습니다 (비디오 간 차이가 충분하지 않음). 그들은 물리학을 위조하고 있었습니다.
  • 시각적 편향: AI 는 눈에 띄는 변화 (예: 차가 빠르게 달리는 대 느리게 달리는 것) 가 있을 때는 더 잘했지만, 미묘하거나 보이지 않는 변화 (예: 도로의 미끄러움 정도) 가 있을 때는 처참하게 실패했습니다.

핵심 교훈

이 논문은 결론적으로, 이러한 AI 모델들이 렌더링(아름다운 그림 만들기) 에는 놀라울 정도로 뛰어나지만, 아직은 신뢰할 수 있는 시뮬레이터(세상이 작동하는 방식을 이해하는 것) 는 아니라고 말합니다.

로봇의 움직임을 계획하거나 자율주행차를 시뮬레이션하는 데 AI 를 사용하려면, AI 가"강한 제동"이"짧은 정지"를 의미한다는 것을 이해해야 합니다. 현재 AI 는 강한 제동이 어떻게 보이는지 추측할 뿐, 그것이 무엇을 하는지는 모릅니다. What-If World테스트를 통과할 수 있을 때까지는, 우리가 AI 를 현실 세계에서 결정을 내리게 완전히 신뢰할 수는 없습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →