← 최신 논문
💻 computer science

VOID: Video Object and Interaction Deletion

이 논문은 물리적 상호작용이 포함된 복잡한 시나리오에서도 현실적인 결과물을 생성할 수 있도록, 반사실적 데이터셋을 구축하고 비전 - 언어 모델로 영향을 받는 영역을 식별하여 비디오 확산 모델을 안내하는 새로운 비디오 객체 삭제 프레임워크 'VOID'를 제안합니다.

원저자: Saman Motamed, William Harvey, Benjamin Klein, Luc Van Gool, Zhuoning Yuan, Ta-Ying Cheng

게시일 2026-04-03
📖 3 분 읽기☕ 가벼운 읽기

원저자: Saman Motamed, William Harvey, Benjamin Klein, Luc Van Gool, Zhuoning Yuan, Ta-Ying Cheng

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

VOID: 비디오에서 사물을 지우면 '세상'이 어떻게 변할까?

이 논문은 **"비디오에서 특정 사물을 지우면, 그 뒤에 무슨 일이 일어날까?"**라는 아주 흥미로운 질문에 답하는 기술을 소개합니다.

기존의 기술들은 단순히 사물을 지우고 그 빈 공간을 채우는 데만 집중했지만, VOID는 사물이 사라졌을 때 물리 법칙에 따라 주변 환경이 어떻게 변해야 하는지까지 상상하고 만들어냅니다.

이 복잡한 기술을 쉽게 이해할 수 있도록 몇 가지 비유로 설명해 드릴게요.


1. 기존 기술 vs VOID: "벽지 교체" vs "세상 재창조"

  • 기존 기술 (벽지 교체):
    imagine 하세요. 벽에 붙은 스티커를 떼어내고 그 자리에 똑같은 벽지 무늬를 붙이는 작업입니다. 스티커 뒤에 가려진 벽은 보이지만, 스티커가 붙어있던 때문에 생겼던 그림자반사는 어색하게 남거나 사라집니다. 더 중요한 건, 스티커가 다른 물건을 밀고 있었다면 그 물건은 여전히 밀려 있는 어색한 상황이 됩니다.

    • 기존 모델은 "빈 공간"만 채우는 데 능했습니다.
  • VOID (세상 재창조):
    VOID는 단순히 빈 공간을 채우는 게 아니라, **"만약 이 사물이 처음부터 없었더라면?"**이라는 질문을 던집니다.

    • 예시 1 (도미노): 도미노가 줄지어 넘어가는 비디오에서 중간 도미노를 지운다고 가정해 보세요. 기존 기술은 그 뒤의 도미노가 그대로 넘어가게 만듭니다 (물리적으로 불가능!). 하지만 VOID는 "중간 도미노가 없으면 뒤에 있는 도미노는 넘어질 수 없다"고 이해하고, 뒤에 있는 도미노가 그대로 서 있는 장면을 만들어냅니다.
    • 예시 2 (회전하는 팽이): 손이 팽이를 돌리고 있는데 손을 지운다면? 기존 기술은 팽이가 갑자기 멈추거나 사라집니다. 하지만 VOID는 "손이 없어도 관성에 의해 팽이는 계속 돌고 있어야 한다"고 판단해, 손이 사라진 후에도 팽이가 멈추지 않고 계속 도는 장면을 만듭니다.

2. VOID가 어떻게 일하는지? (3 단계 요리법)

VOID는 마치 현실 세계를 시뮬레이션하는 요리사처럼 작동합니다.

1 단계: 재료 준비 (데이터 학습)

요리사가 새로운 요리를 배우려면 다양한 실험이 필요합니다. VOID는 Kubric이라는 가상의 물리 엔진과 HUMOTO라는 인간 동작 데이터를 이용해 수천 개의 "사물 제거 전/후" 영상을 스스로 만들어 학습했습니다.

  • 비유: 요리사가 "소스를 없애면 국물이 어떻게 변할지", "고기를 빼면 어떻게 끓을지"를 수천 번 시뮬레이션해 본 것과 같습니다.

2 단계: 레시피 분석 (VLM 의 지혜)

사용자가 지우고 싶은 사물을 선택하면, VOID는 **VLM(시각 - 언어 모델)**이라는 '현실 세계를 아는 똑똑한 비서'를 부릅니다.

  • 비유: "이 컵을 치워줘"라고 하면, 비서가 "아, 컵을 치우면 그 위에 있던 과자가 떨어지겠네! 그리고 컵이 그늘을 드리웠던 그 부분도 햇빛을 받게 되겠네!"라고 원인과 결과를 분석합니다.
  • 이 분석을 바탕으로, 단순히 컵만 지우는 게 아니라 과자가 떨어지는 영역햇빛이 들어오는 영역까지 정확히 표시해 줍니다.

3 단계: 요리와 다듬기 (2 단계 생성)

  • 1 차 요리 (상상): VOID는 분석된 내용을 바탕으로 사물이 사라진 후의 장면을 처음에 그립니다. 이때 물리 법칙은 맞지만, 물체의 모양이 약간 찌그러지거나 흔들릴 수 있습니다.
  • 2 차 다듬기 (안정화): 이 찌그러짐을 고치기 위해, VOID는 **광학 흐름 (Optical Flow)**이라는 기술을 이용해 물체가 어떻게 움직여야 자연스러운지 계산한 뒤, 다시 한 번 영상을 다듬습니다.
    • 비유: 초보 요리사가 만든 요리를 맛보고, 셰프가 마지막에 소스를 살짝 뿌리고 모양을 정리해 완벽하게 만드는 과정입니다.

3. 왜 이 기술이 특별한가요?

이 논문은 VOID가 훈련 데이터에 없던 상황에서도 상상력을 발휘한다는 것을 증명했습니다.

  • 새로운 상황: 훈련 데이터에 '풍선'이나 '믹서기'가 없었는데도, 사람이 풍선을 들고 있다가 사라지면 풍선이 하늘로 날아가고, 믹서기를 돌리는 사람이 사라지면 믹서기가 꺼지는 것을 직관적으로 구현했습니다.
  • 핵심: VOID는 단순히 기억해 둔 영상을 복사하는 게 아니라, 물리 법칙과 인과 관계 (원인과 결과) 를 이해하고 있기 때문에 이런 일이 가능한 것입니다.

요약

VOID는 비디오 편집기를 단순한 '지우개'가 아닌, **현실 세계의 물리 법칙을 이해하는 '시뮬레이터'**로 바꿉니다.

"이 사물을 지우면, 그 뒤에 무슨 일이 일어날까?"

이 질문에 대해 VOID는 **"그 사물이 없었을 때의 현실"**을 가장 자연스럽게 재현해냅니다. 이는 영화 특수효과 제작을 쉽게 만들거나, 우리가 상상하지 못했던 새로운 비디오 편집 경험을 선사할 수 있는 중요한 첫걸음입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →