CoInteract: Physically-Consistent Human-Object Interaction Video Synthesis via Spatially-Structured Co-Generation
이 논문은 손과 얼굴의 구조적 안정성과 물리적 접촉의 현실성을 보장하기 위해 인간 인식형 MoE 와 공간 구조화된 공동 생성 기법을 도입하여, 사람과 제품 참조 이미지, 텍스트, 음성을 기반으로 물리적으로 일관된 인간 - 사물 상호작용 비디오를 생성하는 CoInteract 프레임워크를 제안합니다.
원저자:Xiangyang Luo, Xiaozhe Xin, Tao Feng, Xu Guo, Meiguang Jin, Junfeng Ma
🎥 코인터랙트 (CoInteract): 물건과 자연스럽게 상호작용하는 '디지털 인간'을 만드는 마법
이 논문은 "사람이 물건을 들고, 만지고, 사용하는 모습을 영상으로 만들어주는 AI" 에 대한 이야기입니다. 기존 AI 들은 사람 얼굴이나 입 모양만 잘 따라 했지만, 손이 물건을 잡을 때나 물체와 부딪힐 때 엉뚱한 실수 (손이 물건을 뚫고 지나가는 등) 를 많이 했습니다.
이 문제를 해결하기 위해 제안된 '코인터랙트 (CoInteract)' 는 마치 정교한 무대 연출가와 전문 코치가 함께 일하는 시스템처럼 작동합니다.
1. 왜 이 기술이 필요한가요? (기존의 문제점)
기존의 영상 생성 AI 는 마치 "눈만 있는 화가" 같았습니다.
문제 1 (손과 얼굴의 붕괴): 손가락이 6 개가 되거나, 얼굴이 흐릿해지는 경우가 많았습니다.
문제 2 (물리 법칙 무시): 사람이 물건을 잡을 때, 손이 물건을 뚫고 지나가거나 (Interpenetration), 물체가 공중에 떠 있는 등 물리적으로 불가능한 상황이 자주 발생했습니다.
이는 AI 가 단순히 "픽셀 (화면의 점)"만 보고 그림을 그렸기 때문입니다. "손이 어떻게 생겼는지", "물건을 잡으면 어떻게 변형되어야 하는지"에 대한 구조적인 이해가 부족했던 것이죠.
2. 코인터랙트의 핵심 아이디어: "두 명의 화가, 한 명의 연출가"
코인터랙트는 이 문제를 해결하기 위해 두 가지 혁신적인 전략을 사용합니다.
🎭 전략 1: "전문 코치" (Human-Aware Mixture-of-Experts)
비유: imagine 하세요. 거대한 그림을 그리는 화가 (AI) 가 있는데, 손과 얼굴만 전문으로 가르치는 코치들이 따로 붙어있는 상황입니다.
작동 원리: AI 가 그림을 그릴 때, 손이나 얼굴이 나올 예정인 부분을 감지하면, 일반 화가가 아니라 그 부분만 전문으로 다루는 **'손 전문가'나 '얼굴 전문가'**에게 작업을 맡깁니다.
효과: 손가락이 뭉개지거나 얼굴이 일그러지는 실수를 방지하고, 아주 정교한 디테일을 살려줍니다. 비용은 거의 들지 않지만 품질은 비약적으로 상승합니다.
🏗️ 전략 2: "투명한 뼈대" (Spatially-Structured Co-Generation)
비유: 건축가가 건물을 지을 때, **실제 외관 (RGB)**과 **철골 구조도 (HOI 구조)**를 동시에 그리고 있다고 상상해 보세요.
작동 원리:
AI 는 두 가지 영상을 동시에 학습합니다. 하나는 실제 색깔이 있는 영상 (RGB), 다른 하나는 물체의 모양과 사람의 실루엣만 있는 **'투명한 구조도'**입니다.
구조도는 색깔은 없지만, "손이 물건을 잡으면 이 위치에 있어야 한다"는 물리 법칙을 담고 있습니다.
AI 는 이 구조도를 보며 "아, 손이 물건을 뚫고 지나가면 안 되겠구나"라고 물리 법칙을 배우게 됩니다.
마법 같은 점: 학습할 때는 이 '투명한 구조도'를 함께 보지만, 실제 영상을 만들 때 (추론 단계) 는 구조도만 버리고 실제 영상만 출력합니다. 그래서 속도는 느려지지 않고, 물리적으로 정확한 영상을 만들어냅니다.
3. 어떻게 작동하나요? (간단한 프로세스)
입력: 사용자는 사람 사진, 물건 사진, 대본 (텍스트), 그리고 **목소리 (오디오)**를 줍니다.
학습 (훈련): AI 는 "사람이 이 물건을 어떻게 잡아야 자연스러운가?"를 구조도 (투명한 뼈대) 를 통해 배우며, 손과 얼굴 전문가 코치들의 도움을 받아 디테일을 다듬습니다.
생성 (실제 사용): 학습된 AI 는 입력된 정보만으로, 손이 물건을 자연스럽게 잡고, 물리 법칙을 지키며, 얼굴과 손이 일그러지지 않는 고화질 영상을 만들어냅니다.
4. 왜 이것이 중요한가요?
이 기술은 이커머스 (온라인 쇼핑), 디지털 광고, 가상 마케팅 분야에서 혁신을 일으킬 수 있습니다.
예시: 온라인 쇼핑몰에서 가상의 인물이 가방을 들고 "이 가방은 가볍고 튼튼해요!"라고 말하며 가방을 흔들거나, 옷을 입어보는 영상을 자동으로 만들 수 있습니다.
기존 방식: 사람이 직접 촬영하거나, 복잡한 3D 모델링을 해야 했습니다.
코인터랙트 방식: 사진과 목소리만 있으면, 물리적으로 자연스럽고 손이 물건을 뚫지 않는 영상을 몇 초 만에 만들어냅니다.
📝 한 줄 요약
"코인터랙트는 AI 에게 '손과 얼굴의 해부학'과 '물체의 물리 법칙'을 가르쳐, 손이 물건을 뚫지 않고 자연스럽게 상호작용하는 영상을 만들어주는 마법 같은 기술입니다."
CoInteract: 공간 구조화된 공동 생성 (Co-Generation) 을 통한 물리적으로 일관된 인간 - 객체 상호작용 비디오 합성
1. 문제 정의 (Problem Statement)
현재의 비디오 생성 모델 (특히 Diffusion 모델) 은 사실적인 렌더링 능력을 갖추고 있지만, 인간 - 객체 상호작용 (HOI, Human-Object Interaction) 비디오 합성에는 다음과 같은 두 가지 주요 한계가 존재합니다.
구조적 불안정성: 손과 얼굴과 같은 민감한 영역에서 손가락이 뭉개지거나 얼굴 특징이 흐려지는 등 구조적 붕괴가 빈번하게 발생합니다.
물리적 비일관성: 손이 물체 표면을 관통하는 (Interpenetration) 등 물리적으로 불가능한 접촉이 발생합니다. 이는 기존 모델이 픽셀 수준의 외관 (Appearance) 에만 의존하여 3D 공간적 관계나 물리적 제약을 내재화하지 못하기 때문입니다.
기존 방법의 한계: 기존 HOI 생성 방법들은 주로 프레임별 포즈나 객체 조건을 추출하는 전처리 (Preprocessing) 에 의존하거나, 명시적인 상호작용 구조 제어가 부족하여 일반화 성능과 물리적 타당성이 떨어집니다.
2. 방법론 (Methodology)
CoInteract 는 텍스트 프롬프트, 오디오, 사람 및 제품 참조 이미지를 입력받아 고품질의 HOI 비디오를 생성하는 엔드 - 투 - 엔드 (End-to-End) 프레임워크입니다. Diffusion Transformer (DiT) 백본에 두 가지 핵심 설계를 도입했습니다.
가. 공간 구조화된 공동 생성 (Spatially-Structured Co-Generation)
이중 스트림 학습: RGB 외관 스트림과 보조적인 HOI 구조 스트림을 공유 DiT 백본 내에서 동시에 학습합니다.
RGB 스트림: 일반적인 비디오 색상 및 질감을 생성합니다.
HOI 스트림: 인간의 메쉬를 실루엣 (Silhouette) 으로 변환하고 객체 마스크를 융합하여 텍스처가 제거된 구조적 표현을 생성합니다. 이는 외관 힌트가 아닌 상호작용 기하학 (Interaction Geometry) 에 집중하도록 모델을 유도합니다.
비대칭 공동 어텐션 (Asymmetric Co-Attention):
학습 단계 1: 양방향 어텐션으로 두 스트림 간의 의존성을 학습합니다.
학습 단계 2: 비대칭 마스크를 적용합니다. RGB 쿼리는 RGB 토큰만 참조하고, HOI 쿼리는 양쪽을 참조합니다.
추론 단계: HOI 스트림을 제거하고 RGB 스트림만 사용하여 **0 의 오버헤드 (Zero-overhead)**로 고품질 비디오를 생성합니다. 학습 시 HOI 스트림의 손실이 공유 백본을 정규화하여, 추론 시에도 물리적 제약을 내재화한 결과를 제공합니다.
나. 인간 인식형 전문가 혼합 모델 (Human-Aware Mixture-of-Experts, MoE)
목적: 손과 얼굴과 같은 고주파수 세부 사항이 필요한 영역의 구조적 충실도를 향상시킵니다.
구조:
라우터 (Router): 손과 얼굴의 바운딩 박스 (Bounding Box) 정보를 기반으로 토큰을 라우팅합니다.
전문가 (Experts): 공유 전문가 (Shared Expert) 와 손 (Hand), 얼굴 (Head), 기본 (Base) 을 위한 경량화된 3 개의 전용 전문가로 구성됩니다.
동작: 라우터는 해당 영역의 토큰을 전용 전문가로 보내고, 나머지는 기본 전문가로 보냅니다. 이는 매개변수 증가를 최소화하면서 손의 선명도와 얼굴의 정체성을 유지합니다.
다. 3D Rotary Positional Encoding (3D RoPE)
운동 프레임, 참조 이미지, RGB 및 HOI 잠금 (Latents) 등 이질적인 모달리티를 통합하기 위해 3D 좌표 (높이, 너비, 시간) 를 할당합니다.
시간 축을 구조화하여 과거 운동 (음수 인덱스), 참조 이미지 (매우 큰 인덱스), 생성 구간을 구분하여 인과적 연속성과 정체성 고정을 보장합니다.
3. 주요 기여 (Key Contributions)
CoInteract 프레임워크: 외부 전처리나 후처리에 의존하지 않고, DiT 백본에 인간 구조 사전 지식과 상호작용 기하학 제약을 직접 주입하여 물리적 타당성과 구조적 일관성을 보장하는 새로운 엔드 - 투 - 엔드 프레임워크를 제안했습니다.
Human-Aware MoE: 공간적 감독을 통해 손과 얼굴 영역을 위한 경량화된 전문가를 도입하여, 주요 영역의 구조적 결함을 최소화하고 고품질 합성을 가능하게 했습니다.
Spatially-Structured Co-Generation: 비대칭 어텐션 마스크를 활용한 비대칭 공동 생성 패러다임을 통해 모델이 기하학적 제약을 학습하도록 강제하면서도, 추론 시에는 보조 스트림을 제거하여 계산 비용 증가 없이 (Zero-overhead) 물리적 상호작용의 현실성을 극대화했습니다.
4. 실험 결과 (Results)
정량적 평가: CoInteract 는 기존 방법 (AnchorCrafter, Phantom, InteractAvatar 등) 대비 VLM-QA(상호작용 타당성 평가) 와 HQ(손 품질 점수) 에서 가장 높은 점수를 기록했습니다. 또한, 신원 유지 (DINOid, FaceSim) 와 시간적 일관성 (Smoothness) 에서도 우수한 성능을 보였습니다.
정성적 평가: 다양한 시나리오에서 손 - 객체 관통 현상이 줄어들고, 자연스러운 그립 동작과 프롬프트 준수도를 보여주었습니다. 특히 기존 방법들이 겪던 손의 구조적 붕괴와 배경/객체 불일치 문제를 해결했습니다.
사용자 연구: 객체 일관성, 인간/배경 일관성, 상호작용 타당성 3 가지 기준에서 모든 경쟁 모델보다 가장 낮은 순위 (가장 우수) 를 기록했습니다.
Ablation Study: HOI 스트림을 제거할 경우 상호작용 타당성이 33.3% 급감했으며, MoE 를 제거할 경우 손과 얼굴의 품질이 저하됨을 확인하여 각 구성 요소의 필수성을 입증했습니다.
5. 의의 및 결론 (Significance)
CoInteract 는 단순한 외관 생성을 넘어 물리적으로 일관된 상호작용을 이해하고 생성하는 새로운 패러다임을 제시합니다. 특히, 추론 시 추가 비용 없이 학습 단계의 구조적 제약을 효과적으로 전이하는 기술은 실시간 응용 (이커머스, 가상 마케팅, 원격 교육 등) 에 매우 중요합니다. 이 연구는 인간 중심 비디오 생성 분야에서 구조적 안정성과 물리적 현실성을 동시에 달성하는 중요한 이정표가 될 것으로 기대됩니다.