비유: 이제부터는 각 배우에게 "너는 여기서 넘어질 때 무릎이 땅에 닿아야 해", "너는 커피를 따를 때 액체가 위로 튀지 않고 아래로 떨어져야 해"라고 구체적인 지시를 내리는 것입니다.
핵심 기술: 이 단계에서는 **VLM(시각 - 언어 모델)**이라는 '물리 박사' AI 를 스승으로 모십니다. 이 스승은 "이 커피가 불에 닿으면 어떻게 변해야 하는지"를 아주 정확하게 설명해 주고, 생성 AI 가 그 설명을 따라 하도록 가르칩니다.
🌟 3. ProPhy 의 놀라운 능력 (예시)
이 기술을 적용하면 다음과 같은 변화가 일어납니다:
기존 AI: 농구공이 모래밭에 떨어졌을 때, 모래가 튀지 않거나 공이 중력을 무시하고 공중에 떠 있습니다.
ProPhy: 농구공이 땅에 닿는 순간, 모래가 튀어 오르고 공은 자연스럽게 튕겨 나갑니다. 물이 튀는 크기와 모래가 튀는 크기가 서로 다른 물리 법칙을 정확히 따릅니다.
🚀 4. 요약: 왜 이것이 중요한가요?
ProPhy 는 AI 가 단순히 "예쁜 그림"을 그리는 것을 넘어, **우리가 사는 현실 세계의 법칙을 이해하고 따라 하는 '현실 시뮬레이터'**가 되게 합니다.
기존 방식: "전체적으로 비슷하게 만들어줘" (대충 맞춘다)
ProPhy 방식: "불은 타야 하고, 물은 아래로 떨어지며, 모래는 튀어야 해. 그리고 이 모든 게 영상 속 각 사물마다 다르게 적용되어야 해!" (정교하게 맞춤)
이 기술은 로봇이 현실 세계를 학습하거나, 영화 제작에서 특수 효과를 더 자연스럽게 만들 때 큰 도움이 될 것으로 기대됩니다. 결국 AI 가 현실과 구별이 안 될 정도로 진짜 같은 세상을 만들어내는 첫걸음입니다.
1. 문제 정의 (Problem)
최근 비디오 생성 모델 (World Simulators) 은 시각적 사실감을 크게 향상시켰으나, 물리 법칙의 일관성 (Physical Consistency) 측면에서는 여전히 한계를 보입니다.
기존 접근법의 한계:
암묵적 물리 학습: 많은 모델이 훈련 과정에서 물리 법칙을 암묵적으로 학습하려 하지만, 추론 시 명시적인 물리 가이드가 부족하여 복잡한 시나리오에서 중력, 관성, 유체 역학 등 기본 물리 법칙을 위반하는 결과가 나옵니다.
세밀한 정렬 부재: 기존 방법 (예: WISA, VideoREPA) 은 비디오 전체 수준 (Video-level) 에서 물리 지식을 적용하거나 coarse 한 라우팅을 사용합니다. 이로 인해 비디오 내의 국소적 (Localized) 물리 단서에 대한 세밀한 반응이 부족하며, 여러 물리 현상이 공존하는 복잡한 장면에서 정확한 공간적 제어를 실패합니다.
핵심 과제:
명시적 물리 가이드: 서로 다른 물리 법칙을 구별 가능하게 표현하여 명확한 물리 특성을 포착할 수 있어야 함.
세밀한 물리 정렬 (Fine-grained Alignment): 비디오 내 특정 공간 영역이 국소적인 물리 단서에 정확하게 반응하도록 정렬해야 함.
2. 제안 방법론 (Methodology)
저자들은 ProPhy(Progressive Physical Alignment Framework) 를 제안합니다. 이는 텍스트 기반의 물리 지식을 명시적으로 주입하고, 토큰 수준에서 점진적으로 정제하는 2 단계 Mixture-of-Physics-Experts (MoPE) 메커니즘을 핵심으로 합니다.
A. 점진적 물리 라우팅 (Progressive Physical Routing)
의미론적 전문가 블록 (Semantic Expert Block, SEB) - 비디오 수준:
입력 텍스트 프롬프트에서 물리적 의미 (예: "연소", "충돌") 를 추출합니다.
학습 가능한 물리 베이스 맵 (Physical Basis Maps) 을 가진 여러 전문가 (Experts) 중, 시맨틱 라우터 (Router) 가 가장 관련성 높은 전문가들을 동적으로 활성화합니다.
이를 통해 비디오 전체에 적용될 글로벌 물리 사전 지식 (Global Physical Priors) 을 생성합니다.
정제 전문가 블록 (Refinement Expert Block, REB) - 토큰 수준:
SEB 에서 생성된 글로벌 사전 지식을 기반으로, 각 토큰 (Token) 단위로 물리 법칙을 세분화합니다.
각 토큰에 해당하는 물리 법칙을 예측하는 라우터를 통해, 해당 영역에 맞는 전문가 (예: 액체 흐름 전문가, 고체 충돌 전문가) 를 선택하여 세밀한 물리 동역학을 학습합니다.
이 과정을 통해 모델은 공간적으로 이방성 (Anisotropic) 인 물리 반응을 학습하게 됩니다.
B. 물리 정렬 전략 (Physical Alignment Strategy)
VLM 기반 지도 학습: 현재 생성 모델보다 비전 - 언어 모델 (VLM, 예: Qwen2.5-VL) 이 물리 현상의 공간적 위치를 더 정확하게 파악한다는 점을 활용합니다.
Attention Map 정렬: VLM 에게 비디오와 물리 현상에 대한 질문을 주어 생성된 텍스트와 비디오 토큰 간의 Attention Map을 추출합니다.
세밀한 정렬 손실 (Fine-grained Alignment Loss): 생성 모델의 정제 라우터가 예측하는 물리 분포를 VLM 이 추출한 정밀한 물리 위치 지도와 정렬시킵니다. 이를 통해 생성 모델이 국소적 물리 현상을 더 정확하게 위치시키고 모방하도록 유도합니다.
C. 학습 목표 (Training Objectives)
총 손실 함수는 다음 4 가지로 구성됩니다:
Diffusion Loss: 일반적인 비디오 생성 품질 유지.
Coarse Alignment Loss (Lcoarse): SEB 라우터 가중치가 물리 카테고리 (WISA-80K) 와 일치하도록 유도 (동일 카테고리 간 유사성, 이질 카테고리 간 차이 극대화).
Fine-grained Alignment Loss (Lfine−align): REB 라우터가 VLM 이 추출한 토큰 수준의 물리 위치 지도와 정렬되도록 유도.
Load-balancing Loss: 전문가들의 활성화가 편중되지 않도록 균형을 잡음.
3. 주요 기여 (Key Contributions)
2 단계 MoPE 설계: 의미론적 (Semantic) 과 정제 (Refinement) 전문가를 통해 계층적 물리 사전 지식을 추출하고, 물리 법칙별 구별 가능한 표현을 학습하게 함.
VLM 기반 세밀한 물리 정렬: 생성 모델이 VLM 의 공간적 물리 이해 능력을 전수받아, 토큰 수준에서 국소적 물리 현상을 정확하게 모델링할 수 있도록 함.
광범위한 실험 검증: 다양한 백본 (Wan2.1, CogVideoX) 에서 SOTA 방법론 대비 물리 일관성과 동적 사실성을 크게 향상시켰음을 입증.
4. 실험 결과 (Results)
벤치마크 (VideoPhy2):
Joint Pass Rate (물리 및 의미 일관성 동시 충족): ProPhy 는 CogVideoX 기반 모델에서 기존 SOTA 대비 +19.7% 의 획기적인 개선을 보였습니다.
HARD Subset: 복잡한 물리 시나리오에서도 가장 우수한 성능을 기록했습니다.
품질 평가 (VBench):
물리 일관성 향상과 동시에 동적 정도 (Dynamic Degree) 및 전반적인 화질 점수도 향상되어, 물리 법칙을 준수하면서도 시각적으로 자연스러운 비디오를 생성함을 입증했습니다.
정성적 비교 (Qualitative):
구슬 충돌: 기존 모델은 운동량 보존 법칙을 위반하거나 물체가 관통하는 오류를 보였으나, ProPhy 는 정확한 운동량 전달과 충돌 반응을 구현했습니다.
먼지 발생: 디스크가 땅에 닿을 때만 먼지가 튀는 등, 물리 현상의 시공간적 타이밍이 정확했습니다.
유체 역학: 커피를 따르는 장면에서 액체 수위와 불꽃의 상호작용을 물리 법칙에 맞게 표현했습니다.
5. 의의 및 결론 (Significance)
세계 시뮬레이터로서의 진전: ProPhy 는 비디오 생성 모델이 단순한 시각적 합성을 넘어, 물리 법칙을 내재한 동적 세계 시뮬레이터로 발전할 수 있는 가능성을 제시합니다.
세밀한 제어의 중요성: 물리 법칙을 비디오 전체가 아닌 국소적 영역 (Local Regions) 과 토큰 수준에서 정렬하는 것이 복잡한 물리 현상을 해결하는 핵심임을 증명했습니다.
미래 방향: VLM 의 물리 추론 능력을 생성 모델에 주입하는 방식은 향후 더 해석 가능하고 원칙적인 물리 지식 (미분 방정식 등) 을 통합하는 데 중요한 기초가 될 것입니다.
요약하자면, ProPhy는 명시적인 물리 가이드와 VLM 기반의 세밀한 공간 정렬을 통해, 기존 비디오 생성 모델이 겪던 물리 법칙 위반 문제를 해결하고 현실적인 동적 세계를 시뮬레이션하는 새로운 패러다임을 제시한 연구입니다.