← 최신 논문
💻 computer science

HumanoidVLN: A Physics-Grounded Simulator and Benchmark for Vision-Language Navigation Across Diverse Humanoid Embodiments

이 논문은 다양한 휴머노이드 로봇을 위한 시각-언어 탐색의 고유한 과제들을 해결하기 위해, 다중 형태(multiple embodiments) 지원, 충돌 인지형 지시어 데이터셋 생성, 그리고 강력한 심투리얼(sim-to-real) 전이 능력을 입증하는 NVIDIA Isaac Sim 기반의 물리 기반 시뮬레이터이자 벤치마크인 HumanoidVLN을 소개한다.

원저자: Quan-Dung Pham, Anh Dao, The-Anh Nguyen, Minh Nguyen-Dinh, Phuong Nam Dang, Tri Pham, Hung Tran, Bach Dao, Tuyen P. Le, Truong Nguyen, Quan Nguyen

게시일 2026-08-14
📖 4 분 읽기☕ 가벼운 읽기

원저자: Quan-Dung Pham, Anh Dao, The-Anh Nguyen, Minh Nguyen-Dinh, Phuong Nam Dang, Tri Pham, Hung Tran, Bach Dao, Tuyen P. Le, Truong Nguyen, Quan Nguyen

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. ✨ 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

로봇이 단순히 원격 조종 자동차처럼 바퀴로 굴러다니는 것이 아니라, 우리처럼 두 다리로 걷고, 비틀거리고, 균형을 잡는 법을 배우는 세상을 상상해 보세요. 이것이 바로 "휴머노이드 로보틱스(humanoid robotics)"라는 분야의 최전선이며, 이 분야는 기계가 우리의 복잡하고 실제적인 집과 사무실을 누빌 수 있도록 만드는 것을 목표로 합니다. 로봇에게 움직이는 법을 가르치기 위해 과학자들은 "시각-언어 내비게이션(Vision-Language Navigation, VLN)"이라는 분야를 사용합니다. VLN을 로봇을 위한 "사이먼 세즈(Simon Says)" 게임이라고 생각해보세요. 인간이 "주방으로 걸어가서 냉장고 옆에 멈춰라"와 같은 음성 명령을 내리면, 로봇은 주변을 살펴보고, 단어를 이해하고, 물리적으로 올바른 위치로 이동해야 합니다.

까다로운 점은 오늘날 대부분의 로봇이 중력, 균형, 그리고 걷기가 얼마나 어려운지를 무시한 채, 마치 비디오 게임 속에서 한 지점에서 다른 지점으로 "순간이동"할 수 있는 시뮬레이션이나 게임 속에서 테스트된다는 것입니다. 하지만 실제 걷기는 물리 법칙으로 가득 차 있습니다. 만약 로봇이 너무 빠르게 회전하려고 하면 넘어질 수도 있습니다. 이 논문은 이 거대한 질문을 다룹니다. "우리는 어떻게 걷는 로봇이 넘어지지 않고 명령을 따르도록 가르칠 수 있는가? 그리고 모든 로봇이 저마다 다르게 생기고 움직일 때, 어떻게 그들을 공정하게 테스트할 수 있는가?"


논문: HumanoidVLN

HumanoidVLN의 연구진은 기존의 로봇 내비게이션 테스트 방식이 마치 포뮬러 1 자동차를 흙길에서 테스트한 다음 그것을 자전거라고 주장하는 것과 같다는 점을 깨달았습니다. 그들은 걷는 로봇을 위해 특별히 설계된 새롭고 매우 사실적인 "놀이터(시뮬레이터)"를 구축했습니다. 로봇이 순간이동하게 두는 대신, 그들의 시스템은 로봇이 물리 법칙을 따르도록 강제합니다. 만약 로봇이 너무 큰 발걸음을 내딛거나 너무 급격하게 회전하려고 하면, 실제 사람처럼 실제로 비틀거리며 넘어지게 됩니다.

그들은 이 놀이터에 네 가지 유형의 "휴머노이드" 로봇을 설정했습니다. 이들은 모두 동일하지 않습니다. 1.17미터의 짧은 로봇(키 큰 십 대 정도의 높이)부터 1.80미터의 거인까지 다양합니다. 또한 다리의 관절 수도 달라서 어떤 로봇은 다른 로봇보다 더 유연합니다. 팀은 이들을 관리하기 위해 "계층적 제어(hierarchical control)" 시스템을 구축했습니다. 이것은 두 명의 팀원처럼 생각하면 쉽습니다. 로봇이 넘어지지 않고 균형을 잡으며 걷는 법을 가르치는 "보행 코치(강화 학습 정책)"와, 인간의 음성 명령에 따라 코치에게 어디로 갈지 알려주는 "내비게이터(경로 추적기)"가 있습니다. 이 설정은 모든 테스트가 비디오 게임의 속임수가 아닌, 진정한 물리적 도전이 되도록 보장합니다.

테스트를 공정하고 현실적으로 만들기 위해, 팀은 단순히 만화 같은 3D 모델을 사용하지 않았습니다. 그들은 아늑한 거실부터 분주한 작업장에 이르기까지 87개의 서로 다른 환경을 구축했습니다. 그들은 로봇이 작고 불가능한 구석에 갇히지 않도록 각 방의 크기를 충분히 크게(최소 100제곱미터 이상) 만들었습니다. 어떤 방은 예술가들이 그린 것이고, 어떤 방은 사진을 3D 세계로 바꾸는 "3D 가우시안 스플래팅(3D Gaussian Splatting)"이라는 멋진 기술을 사용하여 실제 삶을 스캔한 것입니다. 심지어 그들은 카메라 뷰가 실제 로봇이 걸을 때처럼 흔들리고 휘청거리도록 만들어, 이족 보행의 비틀거림을 포착하도록 했습니다.

로봇에게 주어지는 명령 또한 정교하게 제작되었습니다. 단순히 무작위 문장을 입력하는 대신, "멀티 에이전트 어노테이션(Multi-Agent Annotation)" 시스템을 사용했습니다. AI 작가, 편집자, 팩트 체크 담당자가 함께 일하는 팀을 상상해 보세요. 두 명의 AI "생성기"가 로봇이 걷는 영상을 바탕으로 경로를 생성하고, "검토자" AI가 그 경로가 지도와 일치하는지 확인하며, "패러프레이저(paraphraser)"가 명령어를 세 가지 다른 스타일(격식 있는 스타일: 상사처럼, 자연스러운 스타일: 친구처럼, 캐주얼한 스타일: 문자 메시지처럼)로 다시 작성합니다. 마지막으로 실제 사람들이 이 작업이 안전하고 정확한지 확인했습니다. 그 결과 933개의 고유한 테스트 에피소드가 만들어졌습니다.

테스트를 실행했을 때, 그들은 몇 가지 놀라운 사실을 발견했습니다. 그들은 네 가지 서로 다른 AI 내비게이션 모델을 테스트하여 어떤 모델이 넘어지지 않고 명령을 가장 잘 따르는지 확인했습니다. JanusVLN이라는 이름의 모델이 가장 우수한 성능을 보였으며, 약 43.55%의 확률로 목표에 성공적으로 도달하고 경로를 밀접하게 따라갔습니다. 그러나 결과는 로봇의 몸체가 매우 중요하다는 것을 보여주었습니다. 키가 큰 로봇(Unitelle H1)은 다른 로봇들에 비해 훨씬 더 고전했으며, 일부 모델에서는 거의 70%의 시도에서 넘어졌습니다. 반면, 더 짧고 안정적인 로봇들은 훨씬 적게 넘어졌습니다. 이는 단순히 하나의 로봇에 대해 내비게이션 AI를 테스트하고 그것이 다른 로봇에서도 작동할 것이라고 가정해서는 안 된다는 것을 증명합니다. 로봇의 물리적 형태와 균형이 모든 것을 바꿉니다.

팀은 또한 컴퓨터 속의 AI 모델 중 하나를 실제 로봇에 실어 실제 방에서 테스트하는 "심 투 리얼(sim-to-real)" 파일럿 테스트를 수행했습니다. 그들은 컴퓨터 시뮬레이션에서의 성능이 실제 세계에서의 성능과 거의 동일하며, 경로에서 얼마나 벗어나는지에 대한 상관관계가 매우 강력하다는 것을 발견했습니다. 이는 그들의 물리 기반 시뮬레이터가 실제 세계의 행동을 예측하는 신뢰할 수 있는 지표임을 시사합니다.

요약하자면, HumanoidVLN은 단순한 새로운 데이터셋이 아니라 로봇 내비게이션에 대한 새로운 사고방식입니다. 이 논문은 우리가 로봇이 거리와 집을 누비길 원한다면, 로봇이 넘어질 수 없는 세상에서 테스트하는 것을 멈춰야 한다고 주장합니다. 물리 법칙에 기반한 테스트와 다양한 로봇 신체를 통해, 이 논문은 도움이 되는 걷는 로봇으로 가는 길은 코드만이 아니라 균형 위에 세워져 있음을 보여줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →