← 최신 논문
🤖 AI

HiPHI: A Large-Scale Benchmark for High-Precision Human Motion and Object-Interaction

HiPHI는 휴머노이드 정책의 확장 가능한 학습 및 평가를 가능하게 하기 위해 이론적으로 유도된 다양성과 서브밀리미터 단위의 정밀도를 결합함으로써 기존의 임보디드(embodied) 데이터셋의 한계를 극복하도록 설계된, 600시간 이상의 전신 인간 동작 및 사물 상호작용 데이터를 포함하는 대규모, 고정밀 벤치마크 데이터셋입니다.

원저자: Jiahao Ji, Ji Ma, Runhan Zhang, Runyi Yu, Wenjia Wang, Weiheng Chi, Qianqian Peng, Weichao Yan, Yongfei Gu, Ye Tian, Ting Wu, Longwei Li, Chun Yuan, Ruoli Dai, Lei Han

게시일 2026-08-18
📖 3 분 읽기☕ 가벼운 읽기

원저자: Jiahao Ji, Ji Ma, Runhan Zhang, Runyi Yu, Wenjia Wang, Weiheng Chi, Qianqian Peng, Weichao Yan, Yongfei Gu, Ye Tian, Ting Wu, Longwei Li, Chun Yuan, Ruoli Dai, Lei Han

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

로봇에게 인간처럼 움직이는 법을 가르치기 위해, 엔지니어들은 먼저 하나의 역설을 해결해야 합니다. 그들은 사람이 할 수 있는 방대한 종류의 행동을 모두 포괄할 수 있을 만큼 광범위하면서도, 발이 땅에 닿는 방식이나 손이 손잡이를 쥐는 방식의 정확한 물리적 디테일을 포착할 수 있을 만큼 정밀한 데이터가 필요합니다. 수년간 이 분야는 두 가지 불완전한 선택지 사이에서 정체되어 있었습니다. 한쪽에는 수백만 시간 분량의 인터넷 영상이 있습니다. 이 영상들은 인간 행동의 거대한 범위를 보여주지만, 단지 영상일 뿐입니다. 즉, 물건을 들어 올릴 때의 정확한 무게나 발걸음의 정밀한 힘과 같은 숨겨진 물리적 세부 사항이 결여되어 있습니다. 다른 한쪽에는 신체의 모든 관절을 추적하는 특수 카메라로 촬영된 실험실 기록이 있습니다. 이것들은 믿을 수 없을 정도로 정확하지만, 대개 좁은 범위의 동작만을 다루며, 실제 세상에서 일어나는 복잡하고 무질서한 사물과의 상호작용을 놓치는 경우가 많습니다. 이 두 세계를 잇는 가교가 없다면, 로봇은 물리적 환경에서 안전하고 효과적으로 움직이는 법을 배우는 데 어려움을 겪게 됩니다.

한 연구팀이 'HiPHI'라는 새로운 데이터셋을 통해 그 가교를 구축했습니다. 그들은 132명의 서로 다른 사람으로부터 600시간 이상의 고정밀 모션 데이터를 포착하여 방대한 인간 움직임 라이브러리를 만들었습니다. 작성자가 직접 목록을 만들어 촬영하는 기존 방식과 달리, 이 팀은 언어가 사건을 조직하는 방식에 기반한 구조화된 시스템을 사용했습니다. 그들은 인간의 행동을 구체적이고 의미 있는 단위로 나누는 언어적 프레임워크에서 시작하여, 속도, 방향, 사용하는 물체와 같은 요소들을 변화시키며 각 단위를 체계적으로 확장했습니다. 그 결과, 이 데이터셋은 인간의 신체 움직임뿐만 아니라 가구에서 스포츠 장비에 이르기까지 실제 물체의 동기화된 움직임까지 포함하게 되었습니다. 연구진은 신체와 물체를 함께 밀리미터 미만의 정확도로 기록함으로써, 마찰, 무게, 균형과 같은 세상의 실제 물리적 제약 조건이 데이터에 반영되도록 했습니다.

수집 과정은 우연이 아닌 철저한 계획하에 설계되었습니다. 배우들이 임의의 대본을 수행하도록 촬영하는 대신, 팀은 데이터셋 제작을 마치 지도를 만드는 것처럼 취급했습니다. 그들은 '걷기'나 '운반하기'와 같은 핵심 행동 개념에서 시작하여 각각에 대해 수백 가지의 변형을 생성했습니다. '걷기'라는 단일 개념은 다양한 속도, 다양한 방향, 다양한 보폭으로 촬영되었으며, 다양한 무게의 짐을 들고 있는 상태에서도 촬영되었습니다. 이러한 접근 방식은 가능한 인간 움직임의 전체 영역을 논리적인 방식으로 포괄할 수 있게 하여, 주요한 유형의 움직임이 누락되지 않도록 보장했습니다. 최종 데이터셋은 2억 프레임 이상의 모션을 포함하며, 여기에는 40가지의 서로 다른 실제 사물과 상호작용하는 약 250시간의 시퀀스가 포함되어 있습니다. 모든 클립에는 행동과 맥락을 설명하는 특정 라벨이 붙어 있어, 연구자들이 로봇에게 가르칠 정확한 유형의 움직임을 쉽게 찾을 수 있습니다.

이 데이터의 품질은 로봇 학습에 실제로 사용될 수 있는지 확인하기 위해 엄격하게 테스트되었습니다. 연구진은 발이 바닥 속으로 가라앉거나 신체가 지지 없이 공중에 떠 있는 것과 같이 다른 데이터셋에서 흔히 발생하는 오류들을 점검했습니다. 측정 결과, HiPHI는 기존의 대규모 모션 라이브러리보다 훨씬 더 깨끗하고 물리적으로 일관성이 높았습니다. 이 데이터를 사용하여 컴퓨터 시뮬레이션 내의 휴머노이드 로봇을 훈련시켰을 때, 로봇은 다른 데이터셋으로 훈련했을 때보다 훨씬 더 빠르고 안정적으로 걷기, 앉기, 물건 운반하기를 학습했습니다. 로봇은 무거운 상자를 밀거나 여행 가방을 뒤집는 것과 같은 복잡한 과업을 수행할 때 이전에는 달성하기 어려웠던 수준의 안정성을 유지하며 균형을 잡을 수 있었습니다. 이러한 시뮬레이션은 이 데이터가 기계가 세상과 관련하여 자신의 몸을 어떻게 움직여야 하는지 이해하는 데 필요한 미세한 물리적 신호를 포착하고 있음을 시사했습니다.

프로젝트의 성공은 연구팀이 훈련된 로봇을 시뮬레이션에서 꺼내 실제 실험실 바닥으로 가져갔을 때 더욱 확증되었습니다. 실제 환경의 센서와 기계적 한계에도 불구하고, 로봇은 HiPHI 데이터로부터 학습한 다양한 행동을 성공적으로 수행했습니다. 로봇은 달리고, 앉고, 기어가고, 상자를 나르고, 여행 가방을 끌며, 고정밀 기록이 실제 물리적 행동으로 번역될 수 있음을 입증했습니다. 이는 이 데이터셋이 단순히 움직임을 묘사하는 것을 넘어, 기계가 물리적 세계와 상호작용하는 법을 가르치는 신뢰할 수 있는 토대를 제공한다는 것을 증명했습니다. 현재의 데이터셋은 단일 인물의 움직임에 집중하고 있으며 여러 사람 간의 상호작용이나 직접적인 접촉력 측정을 아직 포함하지는 않지만, 이는 중요한 진전입니다. 대규모의 물리적 근거를 갖춘 인간 모션 기록을 제공함으로써, HiPHI는 인간이 설계한 목적대로 인간과 같은 우아함과 적응력을 가지고 움직일 수 있는 로봇을 개발하는 데 있어 새로운 표준을 제시합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →