← 최신 논문
💻 computer science

VDAWorld: World Modelling via VLM-Directed Abstraction and Simulation

VDAWorld는 시각-언어 모델(Vision-Language Model)을 활용하여 이미지-캡션 쌍을 추상적이고 접지된 장면 표현으로 자율적으로 증류하고 적절한 물리 시뮬레이터를 선택함으로써, 생성형 비디오 모델의 한계를 극복하여 상호작용 제어, 반사실적 생성 및 물리적 추론에서 최첨단 성능을 달성하는 새로운 프레임워크를 도입합니다.

원저자: Felix O'Mahony, Roberto Cipolla, Ayush Tewari

게시일 2026-06-23
📖 3 분 읽기☕ 가벼운 읽기

원저자: Felix O'Mahony, Roberto Cipolla, Ayush Tewari

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 도미노가 쓰러지는 비디오를 보고 있다고 상상해 보세요. 일반적인 AI 비디오 생성기는 다음 프레임을 예측하기 위해 픽셀(색상의 아주 작은 점들)이 어떻게 보여야 할지 추측하려고 노력합니다. 이것은 마치 화가가 현재의 그림을 보고 다음 붓터치를 추측하며 미래를 그리려는 것과 같습니다. 때때로 이 방식은 매우 아름답게 작동하기도 하지만, 종종 화가는 혼란에 빠집니다. 도미노가 허공으로 사라지거나, 다른 도미노를 유령처럼 통과해 버리거나, 장면 전체의 물리 법칙이 갑자기 변해버리기도 합니다.

VDAWorld는 완전히 다른 접근 방식을 취합니다. VDAWorld는 미래를 그리는 대신, 스마트한 설계자이자 물리 교사가 결합된 형태로 행동합니다.

그 작동 원리를 간단한 단계별로 설명하면 다음과 같습니다.

1. "번역기" (VLM 에이전트)

VDAWorld에 사진 한 장과 설명(예: "탁자 위의 블록 한 줄")을 주면, VDAWorld는 단순히 픽셀을 응시하는 것이 아닙니다. VDAWorld는 강력한 AI "번역기"(Vision-Language Model이라고 불림)를 사용하여 장면을 관찰하고 다음과 같이 질문합니다: "이것은 어떤 종류의 세상인가?"

  • 비유: 당신이 번역가에게 수영장 사진을 건네준다고 상상해 보세요. 일반적인 AI는 다음 몇 초 동안 물의 색깔이 어떻게 변할지 추측하려 할 것입니다. 하지만 VDAWorld의 번역기는 사진을 보고 이렇게 말합니다. "아, 이것은 물이다. 나는 유체 역학(Fluid Physics) 규칙집을 사용해야 한다."
  • 만약 사진이 나무 블록 더미를 보여준다면, 번역기는 이렇게 말합니다. "이것은 고체 물질이다. 나는 강체(Rigid Body) 규칙집을 사용해야 한다."
  • 만약 사진이 게임의 한 장면이라면, 번역기는 이렇게 말합니다. "이것은 논리다. 나는 게임 규칙 규칙집을 사용해야 한다."

2. "청사진" 구축 (추상화)

번역기가 규칙을 파악하면, VDAWorld는 지저분한 세부 사항(나무의 결이나 그림자 등)은 무시하고 깨끗하고 수학적인 청사진을 만듭니다.

  • 비유: 이것은 목수가 나무 더미를 보고 탁자를 만들기로 결정하는 것과 같습니다. 그들은 톱밥이나 나무의 색깔에는 신경 쓰지 않습니다. 그들은 치수와 접합부에 집중합니다. VDAWorld는 이러한 "노이즈"를 제거하고 컴퓨터가 완벽하게 이해할 수 있는 단순화되고 구조화된 모델을 만듭니다.

3. "시뮬레이터" 고용 (엔진)

그다음, 번역기는 시뮬레이터 역할을 하는 컴퓨터 프로그램(코드)을 작성합니다. 이것은 비디오가 아니라, "만약 내가 이 블록을 밀면, 중력이 블록을 아래로 끌어당기고, 그것이 다음 블록을 친다"라고 말하는 일련의 지침입니다.

  • 비유: VDAWorld는 단순히 다음에 무슨 일이 일어날지 추측하는 대신, 작은 가상 실험실을 구축합니다. 실험실 안에 블록들을 넣고 물리 법칙이 실행되도록 둡니다. 실제 물리 법칙 위에서 작동하기 때문에, 블록들은 서로를 통과할 수 없으며 사라질 수도 없습니다. 블록들은 반드시 논리적으로 행동해야 합니다.

4. "만약에?"라는 초능력 (상호작용성)

이 부분이 일반적인 비디오 AI와 차별화되는 VDAWorld의 강점입니다. VDAWorld는 청사진과 시뮬레이터를 구축했기 때문에, 규칙을 변경하고 그 결과를 즉시 확인할 수 있습니다.

  • 비유: 당신이 일반적인 도미노 영상을 보고 있다면, 시간을 멈추거나 도미노를 더 추가할 수 없습니다. 하지만 VDAWorld를 사용하면 당신은 리모컨을 든 감독이 됩니다.
    • 대본 수정하기: 당신이 AI에게 "사실, 도미노 두 개를 더 추가해줘"라고 말하면, AI는 청사진을 업데이트하고 시뮬레이션을 다시 실행합니다.
    • 물리 법칙 바꾸기: "중력을 더 강하게 해줘" 또는 "물을 뜨게 만들어줘"라고 말하면, 시뮬레이터는 새로운 규칙에 따라 결과를 즉시 재계산합니다.
    • 실수 바로잡기: 만약 AI가 이상해 보이는 다리를 만들었다면, 코드를 편집하여 다리를 수정할 수 있고, 그러면 시뮬레이션이 즉시 업데이트됩니다.

왜 이것이 더 나은가요?

논문은 일반적인 비디오 AI가 실감 나 보이긴 하지만 종종 대본(물리 법칙)을 잊어버리는 즉흥 연기 배우와 같다고 주장합니다. 반면 VDAWorld는 실험실을 갖춘 과학자와 같습니다. 처음에는 영화처럼 "예쁘거나" 사실적이지 않을 수 있지만, 물리 법칙이 정확하다는 것을 보장합니다.

  • 마법 없음: 물체가 사라지거나 합쳐지지 않습니다.
  • 추측 없음: 패턴이 아닌 규칙을 바탕으로 미래를 계산합니다.
  • 제어 가능: "만약에?"라는 질문을 던지면 무작위 비디오 클립이 아닌 논리적인 답변을 얻을 수 있습니다.

요약하자면, VDAWorld는 단순히 미래를 예측하는 것이 아니라, 실제 세상이 작동하는 방식에 따라 미래가 계산되는 작고 상호작용 가능한 세계를 구축합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →