← 최신 논문
💻 computer science

Real2Sim in HOI: Toward Physically Plausible HOI Reconstruction from Monocular Videos

본 논문은 접촉 일관성을 보장하고 안정적인 물리 기반 시뮬레이션을 가능하게 하기 위해 "인간 우선, 객체 추종" 형식을 채택하여 단안 비디오로부터 물리적으로 타당한 4 차원 인간 - 객체 상호작용을 재구성하는 HA-HOI 프레임워크를 소개합니다.

원저자: Yubo Zhao, Yujin Chai, Yunao Dong, Chengfeng Zhao, Zijiao Zeng, Yuan Liu, Chi-Keung Tang

게시일 2026-05-15
📖 4 분 읽기☕ 가벼운 읽기

원저자: Yubo Zhao, Yujin Chai, Yunao Dong, Chengfeng Zhao, Zijiao Zeng, Yuan Liu, Chi-Keung Tang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

누군가 커피 머그잔을 집어 들고 한 모금 마시는 모습을 담은 가정용 비디오를 보고 있다고 상상해 보세요. 표준 컴퓨터 프로그램에게 이 장면을 3D 로 '재구성'하라고 요청하면, 3D 사람과 3D 머그잔을 그려낼 것입니다. 하지만 여기에 문제가 있습니다. 컴퓨터는 머그잔을 사람의 손 바로 위에 공중에 띄우거나, 사람의 손가락이 유령처럼 머그잔을 관통하게 만들 수 있습니다. 맨눈으로 보면 괜찮아 보이지만, 이 3D 장면을 비디오 게임이나 로봇 시뮬레이션에 사용하려 한다면 물리 법칙이 깨집니다. 머그잔이 바닥을 뚫고 떨어지거나, 로봇이 공기를 잡으려 시도하는 식이죠.

이 논문은 **"Real2Sim in HOI"**라는 제목으로, 바로 그 문제를 해결하기 위해 HA-HOI(Human-Anchored Human-Object Interaction, 인간 기반 인간 - 물체 상호작용) 라는 새로운 시스템을 소개합니다.

간단한 비유를 들어 작동 원리를 살펴보면 다음과 같습니다:

핵심 문제: '유령 손' 현상

2D 비디오를 3D 애니메이션으로 변환하는 기존 방법들은 사람과 물체를 각각 따로 움직이는 두 개의 별개 존재로 취급합니다. 이는 무용수와 소품을 각각 어디로 이동할지 지시하되, 서로 실제로 닿게 하라는 말은 하지 않고 춤을 안무하려는 것과 같습니다. 그 결과 카메라 각도에서는 시각적으로 올바르게 보일지라도 물리적으로 불가능한 3D 장면이 만들어집니다. 손이 컵 근처에 떠 있거나, 컵이 공중에 떠 있을 수 있습니다.

해결책: '앵커' 전략

저자들은 새로운 사고방식을 제안합니다: 사람은 앵커 (고정점) 이고, 물체는 추종자입니다.

사람과 물체의 위치를 각각 독립적으로 추측하려 하는 대신, HA-HOI 는 다음과 같이 말합니다: "먼저 사람이 정확히 무엇을 하고 있는지 파악한 뒤, 그 행동을 논리적으로 설명하기 위해 물체가 반드시 있어야 할 위치를 파악합시다."

이를 자석과 철심에 비유해 볼 수 있습니다.

  1. 자석 (사람): 시스템은 먼저 사람의 움직임에 고정됩니다. 특정 비디오에서 사람의 몸을 그 우주의 견고하고 안정적인 중심점으로 간주합니다.
  2. 철심 (물체): 사람의 움직임이 설정되면, 시스템은 사람에 상대적인 물체의 위치를 파악합니다. 사람의 손이 '잡는' 모양으로 닫혀 있다면, 물체는 반드시 그 손 안에 있어야 합니다. 단순히 근처에 떠 있는 것이 아니라, 제자리에 딱 맞춰집니다.

작동 방식 (세 단계)

1. 기초 구축 (사람 우선)
시스템은 비디오를 관찰하며 움직이는 사람의 3D 모델을 구축합니다. 이때 그 사람을 '좌표계'로 활용합니다. "방 안에서 물체가 어디에 있는가?"라고 묻는 대신, "사람의 손에 상대적으로 물체가 어디에 있는가?"라고 묻습니다. 이렇게 하면 카메라가 흔들리거나 움직여도 규모와 타이밍이 일관되게 유지됩니다.

2. '스마트 추측' (VLM 접촉)
때로는 비디오가 흐릿하거나 물체가 사람의 팔 뒤에 가려져 있을 수 있습니다. 이를 해결하기 위해 시스템은 이미지와 텍스트를 이해하는 AI 인 '시각 언어 모델 (Visual Language Model)'을 사용합니다.

  • 비유: 숨겨진 열쇠의 위치를 추측해야 한다고 가정해 보세요. 단순히 어두운 부분을 보는 것이 아니라, 전문가에게 "사람이 열쇠를 들고 있다면 보통 어디에 위치할까?"라고 물어봅니다. AI 는 손과 물체가 접촉해야 할 가능성이 높은 위치를 제안합니다. 시스템은 이러한 '스마트 추측'을 활용하여 3D 모델을 조정해 손이 단순히 근처에 떠 있는 것이 아니라 실제로 물체를 잡도록 만듭니다.

3. '물리 테스트' (시뮬레이션)
이 부분이 가장 독특합니다. 3D 애니메이션을 구축한 후 시스템은 여기서 멈추지 않습니다. 애니메이션을 물리 시뮬레이터(비디오 게임 엔진과 유사) 를 통해 실행합니다.

  • 비유: 나무 인형극을 만들었다고 상상해 보세요. 관객에게 보여주기 전에 실제 무대와 실제 중력을 갖춘 무대에 인형들을 올려둡니다. 인형의 팔이 너무 무거워 떨어지거나, 앉은 의자가 무너지면 디자인이 잘못되었다는 것을 알 수 있습니다.
  • HA-HOI 는 이를 수행합니다. 물리 엔진에서 사람과 물체가 상호작용하도록 시도합니다. 손의 파지가 너무 느슨해 컵에서 미끄러진다면, 시스템은 중력 아래서 컵을 잡을 만큼 파지가 강력하도록 애니메이션을 수정합니다. 이를 통해 최종 결과가 단순히 '보기에 예쁜' 것을 넘어 물리적으로 안정적임을 보장합니다.

결과

저자들은 BEHAVE(사람이 물체와 상호작용하는 비디오를 포함한 데이터셋) 에서 이를 테스트했습니다.

  • 이전: 다른 방법들은 사람과 물체가 가까이 보이는 3D 장면을 생성했지만, 종종 '유령 같은' 간격이 있거나 물체가 몸을 관통하는 문제가 있었습니다.
  • 이후: HA-HOI 는 접촉이 견고한 장면을 생성했습니다. 사람이 실제로 물체를 들고 있었고, 물체는 손에 머물러 있었습니다.
  • 측정 지표: 그들은 '침투' (손이 물체를 얼마나 통과했는지) 를 측정했습니다. HA-HOI 는 이 오류를 크게 줄여, 3D 모델이 로봇이나 비디오 게임 캐릭터를 위한 '교사'로 사용되기에 훨씬 더 현실적이고 준비되었음을 의미합니다.

요약

간단히 말해, 이 논문은 현실 세계의 비디오를 유용한 3D 시뮬레이션으로 변환하려면 사람과 물체를 따로 추적해서는 안 된다고 주장합니다. 대신 상호작용 자체를 가장 중요한 것으로 취급해야 합니다. 물체를 사람의 움직임에 고정시키고 물리 테스트를 통해 결과를 검증함으로써, HA-HOI 는 흔들리고 모호한 비디오를 로봇과 시뮬레이션이 실제로 사용할 수 있는 안정적이고 현실적인 3D 상호작용으로 변환합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →