← 최신 논문
💻 computer science

YoCausal: How Far is Video Generation from World Model? A Causality Perspective

본 논문은 시간적으로 역방향으로 재구성된 실제 세계 영상을 활용하여 비디오 확산 모델을 평가하는 새로운 벤치마크인 YoCausal 을 소개하며, 이러한 모델들이 시간의 화살을 인지할 수는 있지만 인간 수준의 인지 능력에 비해 진정한 인과 추론 능력은 여전히 부족함을 보여줍니다.

원저자: You-Zhe Xie, Yu-Hsuan Li, Jie-Ying Lee, Kaipeng Zhang, Yu-Lun Liu, Zhixiang Wang

게시일 2026-05-29
📖 4 분 읽기☕ 가벼운 읽기

원저자: You-Zhe Xie, Yu-Hsuan Li, Jie-Ying Lee, Kaipeng Zhang, Yu-Lun Liu, Zhixiang Wang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 로봇에게 세상이 어떻게 작동하는지 가르치고 있다고 상상해 보세요. 당신은 유리가 깨지는 영상을 보여줍니다. 인간은 즉시 알 수 있습니다: 망치가 유리를 쳤고, 그 다음 유리가 깨졌습니다. 만약 그 영상을 거꾸로 재생하여 조각들이 날아올라 온전한 유리로 재조립되는 장면을 보여준다면, 당신은 즉시 "그건 불가능해!"라고 생각할 것입니다. 당신의 뇌는 "잠깐, 그건 틀렸어!"라고 외치고 있습니다.

이 논문인 YoCausal은 간단하지만 심오한 질문을 던집니다: 오늘날의 첨단 AI 영상 생성 모델들은 실제로 이것이 잘못되었다는 것을 "알고" 있을까요, 아니면 그 뒤에 있는 논리를 이해하지 못한 채 영상의 외형만 잘 모방하고 있을까요?

여기서는 일상적인 비유를 사용하여 그들의 발견을 정리해 보겠습니다.

문제: "마술" 대 실제 이해

현재의 AI 영상 모델들은 놀라울 정도로 재능 있는 마술사들과 같습니다. 그들은 유리가 깨지는 영상을 매우 사실적으로 만들 수 있습니다. 하지만 만약 그들에게 "유리가 망치 때문에 깨졌나요, 아니면 유리가 깨졌기 때문에 망치가 나타났나요?"라고 묻는다면, 그들은 아무것도 모를지도 모릅니다. 그들은 단순히 패턴을 암기하고 있을 뿐일 수 있습니다: "보통 깨진 유리는 이렇게 생겼지."

연구자들은 이러한 AI 들이 실제로 인과성(원인과 결과) 을 이해하는지, 아니면 단순히 이전에 본 것을 반복하는 "통계적 앵무새"인지 알고 싶어 했습니다.

해결책: "거꾸로 재생된 영상" 테스트

이를 테스트하기 위해 팀은 YoCausal이라는 새로운 벤치마크를 만들었습니다. 그들은 아기들을 테스트하는 방식에서 영감을 받은 교묘한 트릭을 사용했습니다: 기대 위반.

  • 아기 테스트: 만약 당신이 아기에게 공이 정상적으로 굴러가는 영상을 보여준다면, 아기는 차분하게 지켜봅니다. 하지만 공이 스스로 언덕을 올라가는 것처럼 거꾸로 재생한다면, 아기는 놀란 표정을 짓습니다. 이 놀람은 그들이 공이 어떻게 해야 움직이는지 이해하고 있다는 것을 증명합니다.
  • AI 테스트: 연구자들은 실제 세계의 영상 (예: 더러운 접시를 닦는 사람) 을 가져와 거꾸로 재생했습니다. 그들은 가짜 영상을 만들 필요가 없었습니다. 그저 실제 영상에 "역재생"을 누른 것뿐입니다. 이는 시간과 인과의 법칙을 위반하는 시나리오인 "반사실적" 표본입니다.

그런 다음 그들은 AI 에게 물었습니다: "이 영상의 어떤 버전이 더 '정상적'이라고 느껴집니까?"

"놀람"을 측정하는 방법

AI 영상 모델들은 "소음 제거"를 통해 작동합니다. 흐릿하고 정전기 잡음이 낀 이미지를 단계별로 정제하여 선명한 영상을 만드는 것입니다.

  • 비유: AI 가 퍼즐을 풀려고 한다고 상상해 보세요.
  • 정방향 영상: 퍼즐 조각들이 논리적으로 맞습니다. AI 는 이를 쉽게 풉니다 (낮은 "노력" 또는 손실).
  • 역방향 영상: 퍼즐 조각들이 논리를 거스르는 방식으로 뒤섞여 있습니다. AI 는 이를 이해하는 데 고군분투합니다 (높은 "노력" 또는 손실).

만약 AI 가 실제로 인과성을 이해한다면, 정방향 영상보다 역방향 영상에서 훨씬 더 많이 고군분투해야 합니다. 이 고군분투가 바로 그들이 측정하는 "놀람"의 척도입니다.

두 단계 테스트

연구자들은 단순히 거꾸로 재생된 영상에 혼란을 느낀다는 것만으로는 충분하지 않다는 것을 깨달았습니다. AI 가 단순히 "시간은 보통 앞으로 흐른다"는 것을 알 뿐, 그런지 이해하지 못할 수도 있기 때문입니다. 그래서 그들은 두 단계 테스트를 구축했습니다:

  1. 1 단계: "시간의 화살" 테스트 (RSI)

    • 질문: AI 는 시간이 보통 앞으로 흐른다는 것을 알고 있습니까?
    • 결과: 많은 첨단 AI 가 이를 통과했습니다. 그들은 거꾸로 재생된 영상이 이상하다는 것을 알았습니다. 하지만 이는 영화가 처음부터 끝까지 봐야 한다는 것을 알지만, 반드시 줄거리를 이해하는 것은 아닌 것과 같습니다.
  2. 2 단계: "이야기 논리" 테스트 (CCI)

    • 질문: AI 는 이야기를 이해합니까?
    • 트릭: 그들은 영상을 두 그룹으로 나눴습니다:
      • 인과 영상: A 가 확실히 B 를 일으키는 경우 (예: 망치가 못을 치는 경우).
      • 비인과 영상: A 가 B 를 일으키는 것이 아니라 단지 그곳에 있는 경우 (예: 고속도로를 달리는 차).
    • 논리: 인과 영상을 거꾸로 재생하면 이중 위반이 됩니다 (시간이 잘못됨 + 물리 법칙이 잘못됨). 비인과 영상을 거꾸로 재생하면 단일 위반만 있습니다 (시간이 잘못됨).
    • 목표: 진정으로 똑똑한 AI 는 거꾸로 재생된 비인과 영상보다 거꾸로 재생된 인과 영상에 훨씬 더 놀라야 합니다.

대발견

연구자들은 이용 가능한 13 개의 가장 똑똑한 영상 AI 모델을 테스트했습니다. 그들이 발견한 바는 다음과 같습니다:

  • "시간"과 "논리"의 격차: 많은 모델들은 영상이 거꾸로 재생된 것을 알아내는 데 뛰어났습니다 (1 단계). 하지만 인과관계가 깨진 영상과 그렇지 않은 영상을 구분하는 데는 실패했습니다 (2 단계).
    • 비유: 알파벳은 알지만 문장을 읽지 못하는 학생과 같습니다. 그들은 글자가 순서가 뒤죽박죽이라는 것을 알지만, 그 의미를 이해하지는 못합니다.
  • 아직도 인간이 아님: 최고의 AI 모델조차도 인간의 성능과는 거리가 멀었습니다. 인간은 본능적으로 인과관계를 이해하도록 설계되어 있지만, AI 들은 여전히 패턴에 기반하여 추측할 뿐입니다.
  • 크기가 항상 똑똑한 것은 아님 (아직은): 더 큰 모델과 새로운 아키텍처가 일반적으로 더 잘 수행했지만, 단순히 모델을 크게 만드는 것만으로는 사물이 왜 일어나는지에 대한 "인간과 같은" 이해를 자동으로 부여하지는 않았습니다.

결론

YoCausal은 AI 가 아름답고 사실적인 영상을 생성할 수 있다고 해서, 그것이 세상을 이해한다는 뜻이 아님을 증명합니다. 그것은 "시각적 모방"의 대가일 수 있지만, "논리적 추론"에서는 초보자일 뿐입니다.

이 논문은 우리가 우주 작동 방식을 이해하는 진정한 "세계 모델"을 구축하는 데는 아직 멀었다고 결론 내립니다. 그 지점에 도달하기 위해서는 이러한 모델들에게 세상을 단순히 보는 법을 가르치는 것을 넘어, 세상을 움직이게 만드는 규칙을 이해하도록 가르쳐야 합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →