← 최신 논문
🤖 AI

Robust Motion Generation using Part-level Reliable Data from Videos

이 논문은 신뢰할 수 있는 부위 수준의 정보만을 활용하여 고품질의 인간 동작을 생성하는 강건한 부위 인식 마스크 자기회귀 모델을 제 제안하고, 새로운 대규모 벤치마크인 K700-M의 도입과 함께 비디오 기반 동작 데이터에서의 가려짐 및 화면 외 캡처 문제를 다룬다.

원저자: Boyuan Li, Sipeng Zheng, Bin Cao, Ruihua Song, Zongqing Lu

게시일 2026-08-26
📖 4 분 읽기☕ 가벼운 읽기

원저자: Boyuan Li, Sipeng Zheng, Bin Cao, Ruihua Song, Zongqing Lu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

컴퓨터에게 문장을 읽는 것만으로 디지털 인간을 움직이는 법을 가르치는 것을 상상해 보십시오. 여러분이 "사람이 춤을 추고 있다"라고 입력하면, 화면에 유연하고 사실적인 퍼포먼스가 나타나기를 기대할 것입니다. 텍스트-투-모션(text-to-motion) 생성이라고 알려진 이 분야는 놀라운 발전을 이루었지만, 하나의 벽에 부딪혔습니다. 지금까지 가장 좋은 결과물은 값비싼 센서를 사용한 통제된 스튜디오에서 실제 사람의 움직임을 캡처한 특별하고 고품질인 기록물들을 통해 컴퓨터를 학습시킨 것에서 나왔습니다. 이러한 기록물들은 완벽하지만, 희귀하고 다양성이 제한적이며, 사람들이 실제 세상에서 움직이는 무질서하고 복잡한 방식들을 놓치는 경우가 많습니다. 이 장벽을 깨기 위해 연구자들은 인터넷으로 눈을 돌려, 온라인에 존재하는 수십억 개의 평범한 영상들로부터 배우기를 희망했습니다. 아이디어는 간단합니다. 만약 컴퓨터가 웹의 방대한 라이브러리로부터 배울 수 있다면, 훨씬 더 넓은 범위의 동작을 이해할 수 있을 것이라는 점입니다. 하지만 함정이 있습니다. 컴퓨터가 일반적인 영상 속에서 사람이 어떻게 움직이는지 파악하려고 할 때, 종종 몸 전체를 보지 못하는 경우가 발생합니다. 사람이 나무에 의해 부분적으로 가려지거나, 카메라 프레임 가장자리에 잘리거나, 다른 사람에 의해 가려질 수 있습니다. 이러한 순간에 컴퓨터는 사라진 팔다리가 어디에 있을지 추측해야 합니다.

이러한 추측은 학습에 있어 근본적인 문제를 일으킵니다. 만약 컴퓨터가 상체만 보이는 영상을 보고, 보이지 않는 다리를 포함한 전체 신체에 대한 추측으로부터 학습하도록 강요받는다면, 잘못된 것을 배울 수 있습니다. 컴퓨터는 보이지 않는 다리가 실제 증거가 아니라 단지 추측일 뿐인데도, 그것을 실제 증거라고 믿기 시작할 수 있습니다. 오랫동안 연구자들은 어려운 선택에 직面했습니다. 완벽하게 명확하지 않은 모든 영상 클립을 버려서 데이터의 대부분을 잃을 것인지, 아니면 모든 클립을 유지하면서 컴퓨터가 나쁜 추측을 무시하기를 바랄 것인지 말입니다. 두 접근 방식 모두 심각한 결함이 있었습니다. 클립을 버리는 것은 앉아 있는 동안 팔을 어떻게 움직이는지와 같은 특정 움직임에 대한 귀중한 정보를 잃는 것을 의미했습니다. 모든 것을 유지하는 것은 컴퓨터에게 잘못된 정보를 가르치는 것을 의미했습니다. 한 연구팀은 컴퓨터가 데이터를 바라보는 방식을 바꿈으로써 이 문제를 해결하는 방법을 찾아냈습니다. 전체 영상 클립을 좋거나 나쁜 것으로 취급하는 대신, 그들은 컴퓨터가 신체 부위별로 데이터를 살펴보도록 가르쳤습니다.

연구자들은 세심한 편집자처럼 작동하는 새로운 시스템을 개발했습니다. 시스템이 영상을 분석할 때, 먼저 신체의 어느 부분이 실제로 보이는지, 그리고 어느 부분이 숨겨져 있는지를 확인합니다. 만약 테이블에 의해 다리가 가려져 있다면, 시스템은 팔과 몸통의 움직임은 신뢰하되 다리에 대한 컴퓨터의 추측은 무시하도록 인지합니다. 시스템은 보이는 부분을 확고한 사실로 취급하고, 숨겨진 부분을 나중에 채워 넣어야 할 빈칸으로 취급합니다. 이 접근 방식은 이전에는 너무 무질서해서 사용할 수 없다고 여겨졌던 수천 개의 영상을 학습할 수 있게 해줍니다. 카메라가 실제로 보는 신체 부위에만 집중함으로써, 시스템은 자신의 추측에 혼란을 느끼지 않고 움직임에 대한 신뢰할 수 있는 이해를 구축합니다. 이는 마치 꼬리가 숨겨져 있을 때 날개만을 공부하여 새를 인식하는 법을 배우는 것이지, 만들어진 꼬리를 포함한 전체 새의 그림을 외우려고 노력하는 것이 아닙니다.

이 아이디어를 테스트하기 위해, 연구팀은 인터넷에서 거의 20만 쌍의 영상 클립과 텍스트 설명을 포함하는 거대한 새로운 데이터 컬렉션을 만들었습니다. 그들은 이 클립들을 분석했고, 프레임의 4분의 3 이상에서 적어도 한 부분의 신체가 완전히 보이지 않는다는 것을 발견했습니다. 이는 누락된 정보의 문제가 드문 일이 아니라, 웹 영상의 일반적인 현상임을 확인해 주었습니다. 이 데이터셋을 사용하여 그들은 새로운 시스템을 훈련시켰고, 이를 기존의 방식들(무질서한 클립을 버리거나, 필터링 없이 모든 클립을 학습시키려 했던 방식들)과 비교했습니다. 결과는 명확했습니다. 어떤 부분이 보이는지에 주의를 기울이는 새로운 시스템은 기존 방식들보다 훨씬 더 정확하고 사실적인 움직임을 만들어냈습니다. 이 시스템은 텍스트 설명에 더 충실할 뿐만 아니라, 훨씬 더 부드럽고 자연스러운 동작을 생성할 수 있었습니다.

연구는 무질서한 클립을 유지하고 컴퓨터가 보이지 않는 부분을 무시하도록 가르치는 것이, 클립을 버리는 것보다 훨씬 더 낫다는 것을 보여주었습니다. 연구자들이 20만 개의 클립이 있는 대규모 풀에서 시스템을 테스트했을 때, 새로운 시스템은 기존의 방법들을 크게 앞질렀습니다. 모든 데이터를 유지하려 했던 기존 방식들은 보이지 않는 부분으로부터 학습하려 했기에 많은 실수를 저질렀고, 나쁜 데이터를 버렸던 방식들은 너무 많은 다양성을 잃었습니다. 새로운 시스템은 대규모 데이터셋의 다양성을 유지하면서도 실수를 피할 수 있었습니다. 시스템은 앉아서 드럼을 치는 사람이 다리가 가려질 수 있지만, 팔의 움직임은 여전히 실제적이고 학습에 유용하다는 것을 배웠습니다. 신뢰할 수 있는 부분에 집중함으로써, 시스템은 누락된 조각들에 의해 현혹되지 않고 움직임의 완전한 그림을 구성할 수 있었습니다.

이 연구는 불완전한 데이터를 사용하여 컴퓨터에게 물리적 세계를 가르치는 새로운 방법을 제시합니다. 이는 기계에게 움직임을 가르치기 위해 완벽한 스튜디오 품질의 기록물이 반드시 필요한 것은 아님을 보여줍니다. 대신, 우리가 기계에게 무엇을 신뢰할지에 대해 영리하게 가르칠 수 있다면 인터넷의 방대한 무질서한 영상들을 사용할 수 있습니다. 시스템은 사람이 어떻게 움직이는지 이해하기 위해 신체 전체를 볼 필요가 없습니다. 단지 행동을 이해할 수 있을 만큼의 신체 일부만 보면 됩니다. 이 접근 방식은 향에 훨씬 더 크고 유능한 시스템을 훈련할 수 있는 문을 열어주며, 이전보다 훨씬 더 넓은 범위의 인간 행동을 이해할 수 있게 합니다. 연구자들은 카메라가 볼 수 있는 한계를 존중함으로써, 컴퓨터가 더 적게 배우는 것이 아니라 더 많이 배울 수 있다는 것을 발견했습니다. 완벽한 데이터를 요구하는 것에서 부분적인 증거로부터 배우는 것으로의 이러한 전략적 전환은, 기계가 인간의 움직임을 이해하도록 가르치는 데 있어 중요한 진전을 의미합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →