Real-Time Human-Centric World Modeling for Upper-Body Human-Object Interaction
이 논문은 연속적인 인간의 움직임을 위한 통합된 다중 스케일 암시적 표현과 정밀한 객체 접촉 제어를 위한 언어 인코딩된 이산 상태를 결합하여 일관된 상체 상호작용을 합성하는 실시간 인간 중심 세계 모델을 제시하며, H100 GPU에서 25 FPS의 추론 속도를 달성한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 영화를 보고 있다고 상상해 보세요. 주인공은 당신에게 말을 거는 동시에 손을 뻗어 커피잔을 잡고, 한 모금 마시고, 다시 내려놓을 수 있습니다. 오랫동안 컴퓨터 과학자들은 캐릭터의 몸을 사실적으로 움직이게 만드는 데는 매우 뛰어났지만, "잡는" 부분에서는 종종 어려움을 겪었습니다. 때로는 손이 컵을 유령처럼 통과해 버리거나, 컵이 손에 닿는 순간 마법처럼 모양이 변하기도 했습니다. 이것이 바로 "인간-사물 상호작용(human-object interaction)"의 과제입니다. 즉, 컴퓨터에게 사람이 어떻게 움직이는지뿐만 아니라, 어떻게 물리적으로 사물을 만지고 주변 세계를 변화시키는지 이해하도록 가르치는 것입니다.
이를 위해 연구자들은 대개 두 가지 주요 도구에 의존합니다. 첫째는 묘사를 바탕으로 움직이는 그림을 그려내는 디지털 화가와 같은 **비디오 생성(video generation)**입니다. 둘째는 **월드 모델링(world modeling)**인데, 이는 컴퓨터가 시간이 흐름에 따라 장면이 어떻게 변할지 예측하려고 시도하는 세련된 방식입니다. 여기서 핵심적인 질문은 이것입니다. 이 둘을 결합하여 단순히 제자리에서 춤을 추는 캐릭터가 아니라, 마치 실제 만질 수 있는 것 같은 느낌을 주는 비디오 게임 캐릭터처럼 실시간으로 사물과 상호작용하는 캐릭터를 만들 수 있을까요?
이것이 바로 통의 랩(Tongyi Lab)의 연구팀이 작업해 온 내용입니다. 그들은 "실시간 인간 중심 월드 모델"처럼 작동하는 새로운 시스템을 구축했습니다. 이것을 디지털 인형술사라고 생각하면 쉽습니다. 이 인형술사는 단순히 인형의 팔다리를 조절하는 것이 아니라, 인형이 망치를 쥐고 있는지 아니면 그냥 허공에 손을 흔들고 있는지를 결정합니다. 그들의 목표는 사람의 라이브 영상, 사물의 사진(예: 컵), 그리고 간단한 명령(예: "잡기" 또는 "접촉 없음")을 입력받아, 사람이 그 사물과 완벽하게 상호작용하는 영상을 즉각적으로 생성하는 시스템을 만드는 것이었습니다.
연구팀은 제어 기능을 두 개의 별개 부분으로 나누면 이전 방식보다 문제를 훨씬 더 잘 해결할 수 있다는 것을 발견했습니다. 첫 번째 부분은 **연속적 인간 상태(continuous human state)**로, 신체, 손, 얼굴의 부드럽고 흐르는 듯한 움직임을 처리합니다. 이것을 인형술사의 손이 인형의 근육을 안내하는 과정이라고 상상해 보세요. 두 번째 부분은 **이산적 상호작용 상태(discrete interaction state)**로, "지금 손이 물체에 닿아 있는가?" 또는 "물체를 쥐고 있는가?"와 같이 시스템에 알려주는 단순한 스위치와 같습니다. 이 스위치에 길고 복잡한 문장 대신 "잡기"나 "접촉 없음"과 같은 특정한 짧은 명령어를 사용함으로써, 컴퓨터는 이 상태들을 즉각적이고 정확하게 전환할 수 있습니다.
그 결과, 이 시스템은 지연 시간이 약 1000밀리초에 불과하며 초당 25프레임의 속도로 상호작용을 생성할 수 있게 되었습니다. 이는 실시간 대화나 실제 비디오 게임처럼 느껴질 만큼 충분히 빠릅니다. 연구진은 자신들의 방식이 기존 시스템들이 흔히 보이던 떠 있는 물체나 잡아야 할 것을 제대로 쥐지 못하는 손과 같은 기괴한 오류를 범하는 것과 비교했을 때, 더 사실적인 손 움직임과 더 나은 사물 접촉을 만들어낸다는 것을 보여주었습니다. 또한 그들은 이러한 상호작용이 어떻게 보여야 하는지 시스템을 학습시키기 위해 3만 개 이상의 사례가 담긴 특별한 데이터셋을 제작했습니다. 그들이 세상의 모든 문제를 해결했다고 주장하는 것은 아니지만, 실험 결과에 따르면 이 "연속-이산(continuous-discrete)" 접근 방식은 실시간으로 자신의 세계와 진정으로 상호작용할 수 있는 디지털 휴먼을 만드는 데 있어 중요한 진전임을 시사합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.