← 최신 논문
💻 computer science

From Seeing to Experiencing: Scaling Navigation Foundation Models with Reinforcement Learning

이 논문은 웹 규모의 비디오를 활용한 오프라인 사전 학습과 시뮬레이션에서의 강화 학습을 결합하여 상호작용적 추론과 안전성을 향상시키고, 새로운 평가 벤치마크인 NavBench-GS로 뒷받침되는 Seeing-to-Experiencing (S2E) 프레임워크를 소개한다.

원저자: Honglin He, Yukai Ma, Brad Squicciarini, Wayne Wu, Bolei Zhou

게시일 2026-06-12
📖 4 분 읽기☕ 가벼운 읽기

원저자: Honglin He, Yukai Ma, Brad Squicciarini, Wayne Wu, Bolei Zhou

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. ✨ 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

큰 문제: "관광객" vs "현지인"

로봇에게 복잡한 도시를 걷는 법을 가르치고 싶다고 상상해 보세요.

기존 방식 ("보는 것"에만 의존):
현재 대부분의 내비게이션 로봇은 도시를 걷는 수천 시간 분량의 유튜브 영상을 시청한 관광객처럼 훈련됩니다. 그들은 화면 속에서 온갖 종류의 거리, 인파, 장애물을 보았습니다. 이것을 **오프라인 사전 학습(Offline Pre-training)**이라고 합니다.

  • 결함: 누군가 스케이트보더를 피하는 영상을 보는 것과 실제로 직접 피하는 것은 매우 다릅니다. 로봇은 충돌이 어떻게 보이는지는 알지만, 넘어지는 물리 법칙이나 멈추기 위해 필요한 찰나의 타이밍은 이해하지 못합니다. 만약 로봇이 현실 세계에서 걸으려고 한다면, 잘못된 방향으로 틀었을 때의 결과를 실제로 "느껴본" 적이 없기 때문에 얼어붙거나 충돌할 수 있습니다. 즉, 로봇에게는 **인과관계(원인과 결과)**가 부족합니다.

새로운 방식 (S2E 프레임워크):
저자들은 **S2E(Seeing-to-Experiencing, 보는 것에서 경험하는 것으로)**라고 불리는 새로운 방법을 제안합니다. 이것은 앞서 말한 관광객을 매우 사실적이고 안전한 비디오 게임 시뮬레이터로 보내서, 다치지 않고도 직접 걷고, 넘어지고, 실수로부터 배울 수 있게 만드는 과정과 같습니다.

목표는 비디오를 통해 얻은 폭넓은 지식과 실제로 연습하며 얻은 실전 감각을 결합하는 것입니다.


작동 원리: 두 단계 레시피

S2E 프레임워크는 이를 효율적으로 수행하기 위해 두 가지 주요 "기술"을 사용합니다.

1. "앵커(Anchor)" 시스템 (비디오 단계 중)

과제: 로봇이 비디오를 볼 때, 어떤 때는 사람들이 똑바로 걷고, 어떤 때는 개를 피하기 위해 왼쪽으로 돌며, 어떤 때는 빨간불에 멈추는 것을 봅니다. 이 모든 행동은 동일한 상황에서 유효한 행동들입니다. 만약 로봇이 단 하나의 '평균적인 경로'만을 예측하려고 한다면 실패할 것입니다.

해결책: 저자들은 **앵커 가이드 분포 매칭(Anchor-Guided Distribution Matching)**이라는 기술을 사용합니다.

  • 비유: 로봇이 레시피를 추측하려는 요리사라고 상상해 보세요. 단 하나의 맛을 추측하는 대신, 테이블 위에 여러 개의 "앵커"(예: "매콤한 맛", "단맛", "짭짤한 맛" 같은 구체적인 맛의 프로필)를 배치합니다.
  • 도움이 되는 방식: 로봇은 특정 상황에서 정답이 "매콤한 맛"(직진)일 수도 있고, 혹은 "짭짤한 맛"(왼쪽으로 회전)일 수도 있다는 것을 배웁니다. 이러한 앵커를 사용함으로써, 로봇은 단순히 하나의 평균적인 추측을 하는 것이 아니라 가능한 여러 가지 좋은 행동들의 "메뉴"를 예측하는 법을 배웁니다. 이는 로봇을 훨씬 더 유연하게 만들고 다양한 시나리오에 대비할 수 있게 합니다.

2. "잔차(Residual)" 뇌 (연습 단계 중)

과제: 로봇이 시뮬레이터에서 연습을 시작하면, 우리는 로봇이 새로운 기술(예: 움직이는 보행자 피하기)을 배우길 원합니다. 하지만 로봇이 모든 것을 처음부터 다시 배우게 한다면, 똑바로 걷는 법이나 보도를 인식하는 법을 잊어버릴 수 있습니다. 이를 "파괴적 망각(catastrophic forgetting)"이라고 합니다. 또한, 시뮬레이터는 현실 세계와 약간 다르게 보일 수 있는데(조명, 질감 등), 이는 로봇을 혼란스럽게 할 수 있습니다.

해결책: 이들은 **잔차 주의 모듈(Residual-Attention Module)**을 사용합니다.

  • 비유: 로봇에게는 거리 인식 능력이 뛰어난 "기본 뇌(Base Brain, 비디오로 훈련된 부분)"가 있다고 상상해 보세요. 시뮬레이터에 들어갔을 때, 우리는 이 기본 뇌를 교체하지 않습니다. 대신, 그 위에 작고 가벼운 "추가 뇌(Residual Module)"를 부착합니다.
  • 도움이 되는 방식: 기본 뇌는 고정된 상태를 유지하며 일반적인 지식을 안전하게 지킵니다. 추가 뇌만이 학습을 담당합니다. 이 추가 뇌는 오직 새로운 상호작용적인 요소들에만 집중합니다: "아, 저 사람이 움직이고 있구나, 속도를 줄여야겠다."
  • 이점: 이것은 휴대폰에서 연락처를 삭제하지 않고 새로운 앱을 설치하는 것과 같습니다. 로봇은 기존의 일반 지식(도로 인식 등)을 잃지 않으면서도 새로운 반응형 기술(피하기, 멈추기)을 습득합니다.

테스트 드라이브: NavBench-GS

이 방법의 효과를 증명하기 위해, 저자들은 NavBench-GS라는 새로운 테스트 환경을 구축했습니다.

  • 무엇인가? 평면적인 2D 이미지(거리 사진을 보는 것) 대신, 현실 세계와 똑같이 생겼지만 실제 물리 법칙이 적용되는 3D 세계를 만들었습니다. 로봇에게 공을 던지면 로봇이 반응할 수 있습니다.
  • 결과:
    • 비디오로만 훈련된 로봇("관광객")은 움직이는 사람이나 장애물을 마주했을 때 자주 충돌했습니다.
    • S2E 방식으로 훈련된 로봇("현지인")은 훨씬 뛰어났습니다. 목적지에 더 자주 도달했으며 충돌도 훨씬 적었습니다.
    • 효율성의 놀라움: S2E 로봇은 더 적은 데이터로 더 빠르게 학습했습니다. 단 100시간의 데이터와 시뮬레이터 연습으로 훈련된 로봇이, 2,000시간 이상의 비디오 데이터로 훈련된 다른 로봇들보다 더 나은 성능을 보였습니다. 이는 상호작용적인 연습이 단순히 더 많은 영상을 보는 것보다 더 가치 있다는 것을 입증합니다.

실제 세계에서의 증명

연구팀은 시뮬레이션에만 머물지 않았습니다. 그들은 두 가지 실제 기기에 로봇을 적용했습니다:

  1. 바퀴형 로봇 (배달 로봇과 유사)
  2. 사족 보행 로봇 (강아지 형태의 로봇)

그들은 실제 도시 거리에서 실제 장애물과 사람들이 있는 환경에서 이 로봇들을 테스트했습니다. S2E 로봇은 해당 거리들에 대한 사전 특정 훈련 없이도(Zero-Shot Generalization) 복잡한 환경을 성공적으로 통과했습니다. 로봇은 보도를 유지하고 보행자를 피하며, 시뮬레이터에서 배운 기술이 현실 세계로 완벽하게 전이되었음을 증명했습니다.

요약

이 논문은 로봇을 진정으로 똑똑한 내비게이터로 만들기 위해서는 단순히 더 많은 영상을 보여주는 것만으로는 부족하다고 주장합니다. 우리는 반드시 연습하게 해야 합니다. 안정적인 "비디오 기반" 토대와 원래의 지식을 덮어쓰지 않는 "연습 기반" 학습 모듈을 결합함으로써, 로봇은 혼란스러운 현실 세계를 안전하고 효율적으로 항해하는 법을 배울 수 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →