← 최신 논문
💻 computer science

Now You See That: Learning End-to-End Humanoid Locomotion from Raw Pixels

본 논문은 고정밀 깊이 시뮬레이션과 행동 증류를 통해 시뮬레이션-현실 간극을 극복하고, 전문화된 보상 설계와 다중 네트워크 학습을 통해 다양한 지형 적응을 가능하게 하는 강건한 비전 기반 휴머노이드 보행을 위한 엔드투엔드 프레임워크를 제시한다.

원저자: Wandong Sun, Yongbo Su, Leoric Huang, Alex Zhang, Dwyane Wei, Mu San, Daniel Tian, Ellie Cao, Baoshi Cao, Yang Liu, Finn Yan, Ethan Xie, Zongwu Xie

게시일 2026-05-12
📖 4 분 읽기☕ 가벼운 읽기

원저자: Wandong Sun, Yongbo Su, Leoric Huang, Alex Zhang, Dwyane Wei, Mu San, Daniel Tian, Ellie Cao, Baoshi Cao, Yang Liu, Finn Yan, Ethan Xie, Zongwu Xie

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. ✨ 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

인간처럼 걷는 로봇을 가르쳐 보라고 상상해 보세요. 간단해 들리지만, 로봇에게 세상은 혼란스러운 정보로 가득한 지뢰밭과 같습니다. 로봇에 완벽한 컴퓨터 생성 지면을 제공하면 쉽게 걸을 수 있지만, 실제 세계에서는 그 '눈'(카메라) 이 엉망입니다. 흐려지기도 하고, 구멍을 내기도 하며, 사물의 거리를 거짓으로 말하기도 합니다.

이 논문인 "Now You See That" 은 완벽한 지도나 인간의 손잡이가 필요 없이, 오직 엉망진창인 실제 세계의 카메라 눈만으로도 인간형 로봇이 자신 있게 걷도록 가르치는 방법에 관한 것입니다.

그들이 어떻게 했는지 간단한 비유로 설명해 드리겠습니다.

1. 문제: '완벽한 학생' 대 '실제 세계'

보통 로봇 엔지니어들은 세상이 완벽한 비디오 게임 (시뮬레이션) 안에서 로봇을 훈련시킵니다. 로봇은 깨끗한 디지털 계단에서 걷는 법을 배웁니다. 하지만 그 로봇을 실제 세계에 데려가면 넘어지고 쓰러집니다. 왜일까요? 실제 카메라에는 비디오 게임에는 없던 '결함'(노이즈, 이미지 내의 구멍, 나쁜 조명) 이 있기 때문입니다.

마치 완벽한 날씨로 비행 시뮬레이터에서 조종사를 훈련시킨 뒤, 실제 폭풍우 속으로 떨어뜨리는 것과 같습니다. 그들은 실제 폭풍우가 다르다는 사실에 당황합니다.

2. 해결책 A: '가짜 결함' 공장

이를 해결하기 위해 연구자들은 컴퓨터 안에 초현실적인 '결함 공장'을 구축했습니다.

로봇에게 깨끗한 사진만 보여주는 대신, 실제 값싼 카메라가 보일 법하게 사진을 고의로 망가뜨렸습니다. 그들은 다음과 같은 것들을 추가했습니다:

  • 구멍: 질감 없는 벽을 카메라가 볼 수 없을 때와 같은 상황 (스테레오 매칭 아티팩트 시뮬레이션).
  • 정적: 멀리 볼수록 더 심해지는 TV 의 눈꽃 같은 노이즈.
  • 왜곡: 왜곡된 환상 거울을 통해 보는 것과 같은 현상.

비유: 운전 배우기를 상상해 보세요. 완벽한 빈 트랙에서 연습하는 대신, 운전 학교는 안개가 낀 앞유리, 흔들리는 카메라, 때로는 거짓말을 하는 GPS 가 장착된 차에 당신을 태웁니다. 실제 운전 시험을 볼 때쯤이면 당신은 어떤 엉망진창 상황에서도 운전하는 데 능통한 전문가가 됩니다. 이것이 바로 이 '결함 공장'이 로봇에게 한 일입니다.

3. 해결책 B: '전문 코치' 팀

부드러운 언덕을 걷는 것과 가파른 계단을 오르는 것은 다르고, 그 또한 간격을 뛰어넘는 것과 다릅니다. 단일한 '코치'(표준 AI 뇌) 는 이러한 다양한 기술을 한 번에 배우려다 종종 혼란에 빠집니다. 마치 한 시간 안에 학생에게 수영, 암벽 등반, 마라톤을 모두 가르치려 하는 것과 같습니다.

연구자들은 로봇에게 함께 일하는 세 명의 전문 코치를 배치했습니다:

  • 코치 1: 계단과 플랫폼에 특화됨.
  • 코치 2: 간격을 뛰어넘는 데 특화됨.
  • 코치 3: 거칠고 바위투성이 지면에 특화됨.

비유: 일반적인 교사 한 명 대신 로봇은 '꿈의 팀'을 갖게 됩니다. 로봇이 계단을 보면 코치 1 의 말을 듣고, 간격을 보면 코치 2 의 말을 듣습니다. 이렇게 하면 로봇이 '걸어'야 할 때 '뛰어'야 한다고 혼란을 겪는 것을 방지합니다.

4. 해결책 C: '선생님 - 학생' 인수인계

로봇은 마스터 셰프가 견습생을 가르치듯 두 단계로 학습합니다.

  • 1 단계 (마스터): 로봇은 먼저 '신의 시선'(완벽하고 깨끗한 데이터) 을 이용해 걷는 법을 배웁니다. 모든 발걸음이 어디에 있는지 정확히 압니다. 이것이 선생님입니다.
  • 2 단계 (견습생): 그런 다음 로봇은 엉망이고 결함이 있는 카메라 이미지만 이용해 걷는 법을 배워야 합니다. 이것이 학생입니다.

학생은 선생님의 동작을 따라 하려 하지만, 선생님은 깨끗한 지도를 보는 반면 학생은 흐릿한 사진을 봅니다. 학생을 돕기 위해 연구자들은 특별한 규칙을 추가했습니다: "비록 사진이 흐릿하더라도, 당신의 뇌 내부에서 느끼는 지면의 감각은 선생님의 명확한 감각과 일치해야 한다."

비유: 마스터 피아니스트 (선생님) 가 노래를 완벽하게 연주한다고 상상해 보세요. 학생 (로봇) 은 정적 소리가 나는 노이즈 캔슬링 헤드폰을 쓰고 있습니다. 학생은 귀의 정적을 무시하고 마스터의 손 움직임을 보며 리듬을 느껴 같은 노래를 배워야 합니다. 연구자들은 로봇에게 정적을 무시하고 핵심 동작에 집중하도록 가르쳤습니다.

결과: 로봇은 실제로 무엇을 했을까요?

연구자들은 이 로봇을 두 가지 다른 실제 인간형 로봇에서 테스트했습니다. 그들은 단순히 평평한 바닥을 걷는 것을 넘어 '파쿠르' 스타일의 도전에 맞섰습니다:

  • 긴 계단: 긴 계단을 오르내리기 (양방향).
  • 높은 플랫폼: 높은 상자 위로 올라서기.
  • 간격: 바닥의 넓은 구멍 뛰어넘기.
  • 잔해: 쓰레기 더미와 고르지 않은 바위 위를 걷기.

결과:
로봇은 시도한 **98.9%**에서 성공했습니다. 부드럽게 걸었고, 넘어지지 않았으며, 에너지를 효율적으로 사용했습니다. 가장 중요한 점은 컴퓨터를 떠난 후 인간의 조정 없이 이를 달성했다는 것입니다. 로봇은 '결함이 있는' 시뮬레이션에서 학습했고, 즉시 실제 세계에서 완벽하게 작동했습니다.

하나의 작은 한계

논문은 하나의 특정 약점을 지적합니다: 계단 내려가기.
로봇은 계단을 오르는 데는 완벽했지만, 내리는 데는 약간 덜 완벽했습니다.

  • 왜? 내려갈 때는 중력이 당신을 앞으로 당깁니다. 작은 실수를 하면 올라갈 때보다 회복하기가 더 어렵습니다. 또한 로봇의 발이 종종 다음 단계에 대한 시야를 가려 '결함이 있는' 카메라를 더욱 혼란스럽게 만듭니다.

요약

이 논문은 로봇에게 걷는 법을 가르치는 새로운 방식을 제시합니다:

  1. 로봇이 놀라지 않도록 훈련 중에 실제 세계의 카메라 오류를 가짜로 만들어 학습시킵니다.
  2. 다양한 유형의 지형에 대해 전문 코치들을 고용합니다.
  3. 완벽한 데이터에서 엉망인 데이터로 지식을 전달하기 위해 선생님 - 학생 시스템을 사용합니다.

그 결과, 로봇은 엉망진창인 실제 세계 환경을 바라보고 인간처럼 계단, 간격, 바위 위를 자신 있게 걸을 수 있게 되었습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →