NavOL: Navigation Policy with Online Imitation Learning
NavOL 은 사전 훈련된 확산 정책과 글로벌 플래너를 활용하여 시뮬레이터 내에서 전문가 궤적을 반복적으로 수집하고 학습하는 온라인 모방 학습 프레임워크로, 이를 통해 보상 공학을 제거하고 분포 변화를 완화하며 시뮬레이션과 실제 환경 모두에서 견고한 시각 항행 성능을 달성합니다.
로봇이 가구와 부딪히지 않고 지저분한 집을 통과하는 법을 가르친다고 상상해 보세요. 이것이 논문 NavOL이 해결하는 핵심 과제입니다.
다음은 그들이 사용한 간단한 비유를 통해 어떻게 이 문제를 해결했는지의 이야기입니다:
문제: "교과서" 대 "실제 세계"
과거 로봇 항법 훈련은 정적인 교과서만을 사용하여 운전 면허 시험을 준비하는 것과 같았습니다.
오프라인 학습 (구식 방법): 연구자들은 시뮬레이터에서 수천 개의 완벽한 주행 경로를 기록하여 하드 드라이브에 저장한 후, 로봇이 이를 암기하도록 가르쳤습니다.
결함: 로봇이 실제 세계에서 아주 작은 실수를 하면 (예: 핸들을 너무 일찍 약간 돌리는 경우), 암기했던 "완벽한 경로"에서 벗어나게 됩니다. 실수를 수정하는 법을 연습해 본 적이 없기 때문에 혼란을 겪고 충돌한 뒤 포기합니다. 이를 "분포 이동 (distribution shift)" 문제라고 합니다.
강화 학습 (시행착오 방식): 또 다른 방법은 로봇이 수백만 번 "시행하고 실패"하게 하여 결국 학습하기를 기대하는 것입니다.
결함: 이는 놀라울 정도로 느리고 비효율적입니다. 벽에 부딪히며 우연히 멈추는 법을 알아낼 때까지 운전하는 법을 배우려 시도하는 것과 같습니다. 또한 모든 단일 행동에 대해 복잡한 "점수 시스템 (보상)"을 고안해야 하는데, 이를 올바르게 설정하기가 어렵습니다.
해결책: NavOL ("생생한 튜터" 시스템)
저자들은 로봇에 생생한 튜터를 제공하여 가상 세계에서 로봇 곁을 따라가며 실시간으로 실수를 수정하는 NavOL을 만들었습니다.
다음은 이 시스템이 단계별로 작동하는 방식입니다:
가상 놀이터: 그들은 256 개의 로봇을 동시에 실행할 수 있는 거대하고 고속의 가상 세계 (IsaacLab 이라는 도구를 사용) 를 구축했습니다. 이는 256 명의 학생이 동시에 운전을 연습하는 교실과 같습니다.
"특권" 튜터: 이 가상 세계 내부에는 "신 (God-mode)" 플래너가 있습니다. 이 튜터는 지도 (벽, 가구, 목표지점) 를 완벽하게 알고 있으며 목표까지의 절대적으로 최선의 경로를 볼 수 있습니다. 로봇은 실제 세계에서 이 지도를 볼 수 없지만, 튜터는 훈련 중에 이를 사용합니다.
"롤아웃 - 업데이트" 루프 (연습 세션):
단계 A (시도): 로봇이 혼자 방을 항해해 보려고 시도합니다.
단계 B (수정): 매 순간마다 "신" 튜터가 확인합니다: "로봇이 완벽했다면 지금 어디에 있어야 할까?"
단계 C (교훈): 로봇은 자신이 한 행동과 튜터가 말한 해야 할 행동을 비교합니다. 그리고 이 차이점에서 즉시 학습합니다.
단계 D (업데이트): 로봇의 뇌 (신경망) 는 다음 단계를 시도하기 전에 이 새로운 교훈으로 즉시 업데이트됩니다.
비유: 자전거 타기를 배운다고 상상해 보세요.
구식 방법: 완벽하게 타는 사람의 영상을 보고 그걸 따라 하려고 시도합니다. 흔들리면 넘어집니다. 흔들림을 어떻게 수정하는지 배운 적이 없기 때문입니다.
NavOL 방식: 당신이 자전거를 타고 있는데 코치가 바로 옆을 따라 뛰어갑니다. 당신이 너무 왼쪽으로 기울어질 때마다 코치는 당신이 여전히 움직이는 동안 부드럽게 중앙으로 밀어줍니다. 당신은 영상을 암기하는 것이 아니라 실시간으로 자신의 실수를 수정하며 균형을 잡는 법을 배웁니다.
이것이 특별한 이유는 무엇일까요?
"보상" 추측 불필요: 로봇은 복잡한 점수 시스템이 필요 없습니다. 그냥 전문가 튜터를 따라 하려고 하면 됩니다.
실수 수정: 로봇은 훈련 중에 자신의 이탈을 수정하는 법을 연습하기 때문에, 실제 세계에서 실수를 했을 때 당황하지 않습니다.
속도: 그들은 8 개의 강력한 그래픽 카드 (RTX 4090) 를 사용하여 매시간 2,000 개 이상의 새로운 학습 경험 (궤적) 을 수집했습니다. 이는 한 학생이 하루 만에 운전 매뉴얼 전체 도서관을 읽는 것과 같습니다.
결과: 시뮬레이션에서 현실로
이 팀은 두 가지 방식으로 이를 테스트했습니다:
가상 테스트: 그들은 복잡한 물건으로 가득 찬 가상 방에서 NavOL 을 다른 최상위 로봇 항법 방법들과 겨루게 했습니다. NavOL 은 거의 매번 이겼으며, 목표를 더 빠르고 안전하게 도달했습니다.
실제 세계 테스트: 그들은 가상 세계에서 훈련된 로봇을 실제 로봇 (Unitree Go2 개 로봇) 에 탑재하여 실제 사무실, 체육관, 복도에서 테스트했습니다.
결과: NavOL 로 훈련된 로봇은 이러한 지저분한 실제 방들을 성공적으로 항해했습니다. 구식 방법 (NavDP) 은 막히거나 충돌했습니다.
"마법": 로봇은 가상 "Dingo" 로봇으로 훈련되었지만 실제 "Go2" 로봇에서도 완벽하게 작동했습니다. 이는 학습이 특정 로봇의 모양을 암기하는 것이 아니라 항법하는 법에 관한 것임을 증명합니다.
요약
NavOL은 로봇이 움직이는 법을 가르치는 새로운 방법입니다. 정적인 지도를 암기하거나 시행착오를 통해 추측하는 대신, 빠른 가상 시뮬레이터 내에서 "생생한 튜터"를 사용하여 로봇의 경로를 실시간으로 수정합니다. 이로 인해 로봇은 더 똑똑하고 안전해지며, 이전에 본 적이 없는 지저분한 실제 환경도 처리할 수 있게 됩니다.
기술 요약: NavOL – 온라인 모방 학습을 통한 탐색 정책
문제 정의
열린 세상, 동적이며 혼잡한 환경에서의 로봇 비주얼 탐색은 여전히 중요한 과제입니다. 기존 접근법은 다음과 같은 뚜렷한 한계에 직면해 있습니다:
오프라인 모방 학습: 효율적이기는 하지만, 배포 중 에이전트가 마주치는 상태를 충분히 포함하지 않을 수 있는 정적이고 사전 수집된 데이터셋에 의존하기 때문에, 배포 중 rollout 시 분포 이동 (distribution shift) 과 누적 오류로 고통받습니다.
강화 학습 (RL): RL 은 환경과 상호작용할 수 있게 하지만, 신중하게 설계된 보상 함수에 크게 의존하며, 희소한 보상을 자주 마주치고 낮은 샘플 효율성을 겪어 복잡한 환경에서의 대규모 학습을 어렵게 만듭니다.
데이터 부족: 대규모 고품질 실세계 궤적을 수집하는 것은 비용이 많이 들고 모델 용량을 제한합니다. 반면, 순수한 합성 데이터 생성 (예: NavDP) 은 효율성을 높이지만, 학습 중 분포 이동을 보정할 수 없는 오프라인 파이프라인에 머뭅니다.
핵심 병목 현상은 보상 공학 없이 분포 이동을 완화하기 위해 모방 학습의 샘플 효율성과 온라인 학습의 상호작용 이점을 결합하는 확장 가능한 패러다임의 부재입니다.
방법론: NavOL
NavOL 은 오프라인 모방 학습과 온라인 RL 간의 간극을 메우는 온라인 모방 학습 패러다임을 제안합니다. 이는 IsaacLab 시뮬레이터를 사용하여 폐쇄 루프 rollout–update 프레임워크 내에서 작동합니다.
1. 모델 아키텍처
NavOL 은 사전 훈련된 멀티모달 확산 정책 (특히 NavDP 에서 유래) 을 기반으로 하며, 두 가지 협력 구성 요소로 이루어집니다:
궤적 생성기 (f): RGB-D 관측치와 목표 지시를 짧은 시간 범위의 상대적 웨이포인트 시퀀스로 매핑하는 Diffusion Transformer(DiT) 입니다. 시각 인코딩을 위해 DepthAnythingV2 ViT 백본을 사용하고, 특징 융합을 위해 트랜스포머 디코더를 사용합니다.
비평가 네트워크 (V): 생성기와 시각 토큰 및 DiT 백본을 공유합니다. 안전성과 실행 가능성에 대해 후보 궤적을 점수화하여 스칼라 안전 점수를 출력합니다. 이를 통해 시스템은 샘플링된 궤적을 순위 매기고 가장 안전한 계획을 실행할 수 있습니다.
2. 온라인 모방 학습 파이프라인
학습 과정은 두 단계를 번갈아 수행합니다:
Rollout 단계:
에이전트는 현재 정책을 사용하여 시뮬레이터 내에서 탐색합니다.
전문가 감독: 환경 지도 (NavMesh) 에 특권적으로 접근할 수 있는 글로벌 플래너가 현재 포즈에서 목표까지 최적 경로를 계산합니다. 이 경로는 밀도화되고 매끄럽게 처리되어 실제 궤적 레이블로 사용됩니다.
데이터 집계: 각 단계에서 에이전트는 확률 ρ로 정책의 행동을 실행하거나 확률 1−ρ로 전문가의 행동을 실행합니다. 이러한 "DAgger 스타일" 상호작용은 정책이 실제로 방문하는 상태로부터 학습하도록 하여 공변량 이동을 완화합니다.
안전 라벨링: 장애물까지의 거리를 기반으로 목표 안전 점수를 도출하여 비평가 네트워크를 감독합니다.
Update 단계:
확산 정책과 비평가는 새로 수집된 관측 - 궤적 쌍으로 학습됩니다.
정책은 관측, 목표, 전문가 궤적을 조건으로 하는 표준 데노이징 목적 함수 (예측된 노이즈와 목표 노이즈 간의 MSE) 를 사용하여 최적화됩니다.
비평가는 목표 안전 점수에 대한 MSE 손실로 최적화됩니다.
중요하게도, 시스템은 이전 반복의 데이터를 폐기하고 업데이트 효율성을 극대화하기 위해 가장 최근의 rollout 데이터만으로 학습합니다.
3. 구현 및 확장
시뮬레이션: 전역 조명, 반사, 그림자와 같은 고품질 렌더링 및 도메인 무작위화 (카메라 포즈, 조명, 에이전트 치수) 를 갖춘 IsaacLab 기반입니다.
효율성: 시스템은 8 개의 RTX 4090 GPU 에서 50 개의 장면을 병렬로 실행하여 시간당 2,000 개 이상의 새로운 궤적을 수집합니다 (평균 400 개 이상의 단계).
초기화: 정책은 사전 훈련된 NavDP 모델의 가중치로 초기화되어 강력한 행동 사전 지식을 제공하지만, 제거 실험 (ablation studies) 에 따르면 성능이 감소하더라도 처음부터 학습할 수도 있음이 입증되었습니다.
주요 기여
NavOL 프레임워크: 온라인으로 수집된 전문가 시연을 사용하여 정책을 반복적으로 업데이트하는 새로운 온라인 모방 학습 탐색 프레임워크로, 보상 공학의 필요성을 제거합니다.
확장 가능한 파이프라인: 다양한 3D 장면에서 시간당 수천 개의 고품질 궤적을 수집하고 학습할 수 있는 고도로 병렬화된 rollout–update 파이프라인입니다.
새로운 벤치마크: 3D-Front 데이터셋을 기반으로 한 실내 비주얼 탐색 벤치마크를 도입하여, 제로샷 일반화를 엄격하게 평가하기 위해 사전 정의된 시작 - 목표 쌍을 가진 8 개의 도메인 외 장면을 포함합니다.
실증적 검증: 시뮬레이션과 실세계 제로샷 배포 모두에서 최첨단 베이스라인보다 일관된 성능 향상을 보여주는 광범위한 실험 결과입니다.
결과
시뮬레이션 벤치마크
NavDP 벤치마크: NavOL 은 모든 지표에서 베이스라인 (DD-PPO, iPlanner, ViPlanner, 그리고 원래 NavDP) 을 능가합니다. 평균 성공률 (mSR) 은 80.4%, 평균 성공 가중 경로 길이 (mSPL) 는 **76.3%**를 달성하여 NavDP(77.8% SR, 74.8% SPL) 를 상회합니다.
NavOL 벤치마크: 더 까다로운 새로운 벤치마크에서 NavOL 은 mSR **69.0%**와 mSPL **63.7%**를 달성합니다. 이는 가장 강력한 베이스라인인 NavDP(42.2% SR, 37.7% SPL) 와 ViPlanner(33.0% SR), iPlanner(18.7% SR) 와 같은 다른 방법들을 크게 능가합니다.
안정성: 정성적 분석에 따르면 NavOL 은 장애물 근처에서도 안정적이고 충돌 없는 궤적을 생성하는 반면, NavDP 는 높은 분산과 떨림 행동을 보여 실패로 이어집니다.
실세계 배포
제로샷 시뮬레이션에서 실세계로: 시뮬레이션에서 Dingo 로봇으로 훈련된 정책은 RealSense D435i 카메라가 장착된 Unitree Go2 로봇에 배포되었습니다.
성능: 세 가지 혼잡한 실세계 시나리오 (사무실, 체육관, 복도) 에서 NavOL 은 각각 80%, 70%, **100%**의 성공률을 달성했습니다. 반면 NavDP 는 각각 40%, 20%, 20% 에 그쳤습니다.
크로스 임바디먼트: 결과는 서로 다른 로봇 임바디먼트에 대한 강력한 일반화를 보여주어 학습된 공간 표현의 견고성을 입증합니다.
효율성 분석
NavDP 에서 초기화된 NavOL 은 mSR 69.0% 를 달성하는 데 16 GPU-일(8 개 GPU 로 2 일) 만 필요했습니다.
반면, 원래 NavDP 는 mSR 42.2% 를 달성하는 데 약 1,024 GPU-일(32 개 A100 으로 32 일) 이 필요했습니다.
심지어 처음부터 학습한 NavOL 변형 (16 GPU-일) 도 원래 NavDP 를 능가하여 온라인 감독 접근법의 데이터 효율성을 강조합니다.
중요성과 주장
이 논문은 NavOL 이 다음과 같은 방식으로 오프라인 모방 학습과 강화 학습의 한계를 성공적으로 해결한다고 주장합니다:
분포 이동 완화: 정책이 자체적으로 탐색한 rollout 에서 학습하고 전문가 수정 (DAgger 스타일) 을 통합함으로써 오프라인 정책의 전형적인 누적 오류를 방지합니다.
보상 공학 제거: 특권 글로벌 플래너를 사용하여 직접적인 궤적 감독을 제공함으로써 희소하거나 수동으로 설계된 보상 함수의 필요성을 제거합니다.
확장성: IsaacLab 과의 통합을 통해 대규모 병렬화가 가능해져 고품질 온라인 학습이 실현 가능하고 효율적이게 됩니다.
견고성: 제로샷 실세계 실험을 통해 입증된 바와 같이, 이 프레임워크는 보이지 않는 환경과 서로 다른 로봇 임바디먼트에 잘 일반화되는 정책을 생성합니다.
저자들은 온라인 플래너 감독을 모방 학습에 통합하면 탐색 성능이 크게 향상되어 견고한 임바디드 에이전트를 향한 더 데이터 효율적이고 확장 가능한 길을 제공한다고 결론지었습니다.