← 최신 논문
💻 computer science

FetchMan: Learning Visual Humanoid Loco-Manipulation Policies from Simulated Experiences

이 논문은 합성 행동 복제(synthetic behavior cloning)의 성능 한계를 Flow-GRPO 강화 학습으로 정책을 정교화함으로써 극복하는 엔드 투 엔드 심투리얼(sim-to-real) 파이프라인인 FetchMan을 소개하며, 이를 통해 Unitree G1 휴머노이드가 미지의 장면에서도 로코매니퓰레이션(loco-manipulation) 작업에서 73.3%의 제로샷 성공률을 달성할 수 있게 한다.

원저자: Omar Rayyan, Zhi Li, Max Argus, Yuxin Jiang, Chang Yu, Chenfanfu Jiang, Yuchen Cui

게시일 2026-09-01
📖 3 분 읽기☕ 가벼운 읽기

원저자: Omar Rayyan, Zhi Li, Max Argus, Yuxin Jiang, Chang Yu, Chenfanfu Jiang, Yuchen Cui

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

로봇이 방 안으로 걸어 들어가 특정 물체를 발견하고 그것을 집어 올리는 꿈은 오랫동안 로보틱스의 핵심 목표였습니다. 수십 년 동안 연구자들은 기계에게 이러한 복잡한 행동을 가르치기 위해 고군분투해 왔는데, 이는 두 가지 어려운 기술, 즉 공간을 통해 몸을 움직이는 것과 손을 사용하여 세상과 상호작용하는 것이 동시에 작동해야 하기 때문입니다. 로봇은 스스로 걷는 데에는 꽤 능숙해졌지만, 두 다리로 균형을 잡으면서 물체에 손을 뻗고 움켜쥐는 능력을 추가하는 것은 프로그래밍하기가 매우 까다로운 혼란스러운 물리적 결합을 만들어냅니다. 이러한 방식으로 로봇을 가르치기 위해 필요한 데이터를 수집하는 것 또한 거대한 장애물입니다. 인간이 모든 가능한 방에서 그릇을 향해 걷고 그것을 집어 올리는 모든 가능한 방법을 시연하는 것은 수년이 걸릴 것이며 로봇이 파손될 위험도 있습니다. 이를 해결하기 위해 과학자들은 컴퓨터 시뮬레이션으로 눈을 돌려, 로봇이 손상에 대한 두려움 없이 수백만 번 연습할 수 있는 디지털 세계를 만들었습니다. 그러나 한 가지 주요한 의문이 남아 있었습니다. 디지털 세계에서 전적으로 훈련받은 로봇이 실제로 실제 집의 무질서하고 예측 불가능한 현실을 다룰 수 있을 것인가 하는 점이었습니다.

UCLA의 연구진과 앨런 인공지능 연구소(Allen Institute for AI), 워싱ントン 대학교의 협력 연구진은 '페치맨(FetchMan)'이라 불리는 새로운 시스템으로 이 과제에 도전했습니다. 그들의 연구는 사람과 매우 흡사하게 생기고 움직이는 휴머노이드 로봇인 유니트리(Unitree) G1에 초점을 맞추고 있습니다. 연구팀은 컴퓨터 시뮬레이션에서 수천 개의 사례를 보여주는 것만으로 이 로봇에게 방을 탐색하고 목표 물체를 잡도록 가르칠 수 있는지, 그리고 추가 훈련 없이 실세계에서 완벽하게 수행할 수 있는지를 알고 싶었습니다. 그들은 단순히 로봇에게 더 많은 사례를 보여주는 것만으로는 충분하지 않다는 것을 발견했습니다. 15만 개 이상의 서로 다른 장면에서 훈련을 마친 후에도 로봇의 성능은 한계에 부딪혔습니다. 로봇은 디지털 스승을 모방할 수는 있었지만, 걷기에서 손을 뻗는 동작으로 매끄럽게 전환하는 데 필요한 미묘한 타이밍을 학습하지 못했습니다. 로봇은 종로 너무 일찍 물체를 잡으려 하거나 너무 빨리 걷기를 멈추곤 했는데, 이는 로봇이 볼 수 없는 비밀 정보를 사용하는 스승을 그대로 복제하려 했기 때문에 발생한 실패였습니다.

이 장벽을 깨기 위해 연구진은 훈련 과정에 두 번째 단계를 추가했습니다. 단순히 디지털 스승을 복제하는 대신, 로봇이 시뮬레이션 내에서 스스로 연습하게 하고 물체까지 걸어가서 물체를 집어 올리는 전체 과제를 성공적으로 완료했을 때만 보상을 주었습니다. 강화 학습이라는 기술을 사용하는 이 방법은 로봇이 스스로 적절한 타이밍과 움직임을 파악할 수 있게 해주었습니다. 로봇은 단순히 모방할 때 저질렀던 실수들을 교정하며, 물체에 도달하기 전에 더 가까이 걸어가는 법을 배웠습니다. 연구팀이 정교해진 로봇을 실세계에서 테스트했을 때 결과는 놀라웠습니다. 실제 방이나 실제 물체를 본 적이 없는 상태에서도 로봇은 낯선 공간을 걸어 들어가 목표한 그릇을 식별하고 73% 이상의 성공률로 그것을 움켜쥐었습니다. 이는 초기 훈련 방식이 실세계 테스트에서 약 57%의 성공률만을 기록했던 것에 비해 상당한 개선이었습니다.

연구진은 또한 이 접근 방식이 그릇뿐만 아니라 다양한 유형의 물체에도 적용될 수 있는지 탐구했습니다. 그들은 로봇에게 물체의 이름을 단서로 제공함으로써 빵, 병, 책과 같은 물체를 인식하고 집어 올리도록 시스템을 훈련시켰습니다. 이 다중 물체 버전은 단일 물체 버전에 비해 아주 성공적이지는 않았지만, 여전히 다양한 상황에서 과업을 수행해 냈으며, 이는 이 방법이 확장 가능하다는 것을 증명했습니다. 이 연구는 스승을 복제하는 것이 좋은 시작점은 될 수 있지만, 복잡한 물리적 과업을 숙달하기에는 충분하지 않다는 점을 강조합니다. 로봇이 세상을 움직이는 법을 진정으로 이해하려면 스스로의 성공과 실패로부터 탐구하고 배울 수 있는 자유가 필요합니다. 방대한 양의 시뮬레이션 연습과 최종 단계의 자기 교정을 결합함으로써, 연구팀은 인간이 매 단계마다 손을 잡아주지 않아도 새로운 환경에 적응할 수 있는 로봇을 만드는 명확한 경로를 제시했습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →