← 최신 논문
💻 computer science

NavOL: Navigation Policy with Online Imitation Learning

NavOL 은 사전 훈련된 확산 정책과 글로벌 플래너를 활용하여 시뮬레이터 내에서 전문가 궤적을 반복적으로 수집하고 학습하는 온라인 모방 학습 프레임워크로, 이를 통해 보상 공학을 제거하고 분포 변화를 완화하며 시뮬레이션과 실제 환경 모두에서 견고한 시각 항행 성능을 달성합니다.

원저자: Xiaofei Wei, Chun Gu, Li Zhang

게시일 2026-05-13
📖 4 분 읽기☕ 가벼운 읽기

원저자: Xiaofei Wei, Chun Gu, Li Zhang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. ✨ 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

로봇이 가구와 부딪히지 않고 지저분한 집을 통과하는 법을 가르친다고 상상해 보세요. 이것이 논문 NavOL이 해결하는 핵심 과제입니다.

다음은 그들이 사용한 간단한 비유를 통해 어떻게 이 문제를 해결했는지의 이야기입니다:

문제: "교과서" 대 "실제 세계"

과거 로봇 항법 훈련은 정적인 교과서만을 사용하여 운전 면허 시험을 준비하는 것과 같았습니다.

  • 오프라인 학습 (구식 방법): 연구자들은 시뮬레이터에서 수천 개의 완벽한 주행 경로를 기록하여 하드 드라이브에 저장한 후, 로봇이 이를 암기하도록 가르쳤습니다.
    • 결함: 로봇이 실제 세계에서 아주 작은 실수를 하면 (예: 핸들을 너무 일찍 약간 돌리는 경우), 암기했던 "완벽한 경로"에서 벗어나게 됩니다. 실수를 수정하는 법을 연습해 본 적이 없기 때문에 혼란을 겪고 충돌한 뒤 포기합니다. 이를 "분포 이동 (distribution shift)" 문제라고 합니다.
  • 강화 학습 (시행착오 방식): 또 다른 방법은 로봇이 수백만 번 "시행하고 실패"하게 하여 결국 학습하기를 기대하는 것입니다.
    • 결함: 이는 놀라울 정도로 느리고 비효율적입니다. 벽에 부딪히며 우연히 멈추는 법을 알아낼 때까지 운전하는 법을 배우려 시도하는 것과 같습니다. 또한 모든 단일 행동에 대해 복잡한 "점수 시스템 (보상)"을 고안해야 하는데, 이를 올바르게 설정하기가 어렵습니다.

해결책: NavOL ("생생한 튜터" 시스템)

저자들은 로봇에 생생한 튜터를 제공하여 가상 세계에서 로봇 곁을 따라가며 실시간으로 실수를 수정하는 NavOL을 만들었습니다.

다음은 이 시스템이 단계별로 작동하는 방식입니다:

  1. 가상 놀이터: 그들은 256 개의 로봇을 동시에 실행할 수 있는 거대하고 고속의 가상 세계 (IsaacLab 이라는 도구를 사용) 를 구축했습니다. 이는 256 명의 학생이 동시에 운전을 연습하는 교실과 같습니다.
  2. "특권" 튜터: 이 가상 세계 내부에는 "신 (God-mode)" 플래너가 있습니다. 이 튜터는 지도 (벽, 가구, 목표지점) 를 완벽하게 알고 있으며 목표까지의 절대적으로 최선의 경로를 볼 수 있습니다. 로봇은 실제 세계에서 이 지도를 볼 수 없지만, 튜터는 훈련 중에 이를 사용합니다.
  3. "롤아웃 - 업데이트" 루프 (연습 세션):
    • 단계 A (시도): 로봇이 혼자 방을 항해해 보려고 시도합니다.
    • 단계 B (수정): 매 순간마다 "신" 튜터가 확인합니다: "로봇이 완벽했다면 지금 어디에 있어야 할까?"
    • 단계 C (교훈): 로봇은 자신이 한 행동과 튜터가 말한 해야 할 행동을 비교합니다. 그리고 이 차이점에서 즉시 학습합니다.
    • 단계 D (업데이트): 로봇의 뇌 (신경망) 는 다음 단계를 시도하기 전에 이 새로운 교훈으로 즉시 업데이트됩니다.

비유: 자전거 타기를 배운다고 상상해 보세요.

  • 구식 방법: 완벽하게 타는 사람의 영상을 보고 그걸 따라 하려고 시도합니다. 흔들리면 넘어집니다. 흔들림을 어떻게 수정하는지 배운 적이 없기 때문입니다.
  • NavOL 방식: 당신이 자전거를 타고 있는데 코치가 바로 옆을 따라 뛰어갑니다. 당신이 너무 왼쪽으로 기울어질 때마다 코치는 당신이 여전히 움직이는 동안 부드럽게 중앙으로 밀어줍니다. 당신은 영상을 암기하는 것이 아니라 실시간으로 자신의 실수를 수정하며 균형을 잡는 법을 배웁니다.

이것이 특별한 이유는 무엇일까요?

  • "보상" 추측 불필요: 로봇은 복잡한 점수 시스템이 필요 없습니다. 그냥 전문가 튜터를 따라 하려고 하면 됩니다.
  • 실수 수정: 로봇은 훈련 중에 자신의 이탈을 수정하는 법을 연습하기 때문에, 실제 세계에서 실수를 했을 때 당황하지 않습니다.
  • 속도: 그들은 8 개의 강력한 그래픽 카드 (RTX 4090) 를 사용하여 매시간 2,000 개 이상의 새로운 학습 경험 (궤적) 을 수집했습니다. 이는 한 학생이 하루 만에 운전 매뉴얼 전체 도서관을 읽는 것과 같습니다.

결과: 시뮬레이션에서 현실로

이 팀은 두 가지 방식으로 이를 테스트했습니다:

  1. 가상 테스트: 그들은 복잡한 물건으로 가득 찬 가상 방에서 NavOL 을 다른 최상위 로봇 항법 방법들과 겨루게 했습니다. NavOL 은 거의 매번 이겼으며, 목표를 더 빠르고 안전하게 도달했습니다.
  2. 실제 세계 테스트: 그들은 가상 세계에서 훈련된 로봇을 실제 로봇 (Unitree Go2 개 로봇) 에 탑재하여 실제 사무실, 체육관, 복도에서 테스트했습니다.
    • 결과: NavOL 로 훈련된 로봇은 이러한 지저분한 실제 방들을 성공적으로 항해했습니다. 구식 방법 (NavDP) 은 막히거나 충돌했습니다.
    • "마법": 로봇은 가상 "Dingo" 로봇으로 훈련되었지만 실제 "Go2" 로봇에서도 완벽하게 작동했습니다. 이는 학습이 특정 로봇의 모양을 암기하는 것이 아니라 항법하는 법에 관한 것임을 증명합니다.

요약

NavOL은 로봇이 움직이는 법을 가르치는 새로운 방법입니다. 정적인 지도를 암기하거나 시행착오를 통해 추측하는 대신, 빠른 가상 시뮬레이터 내에서 "생생한 튜터"를 사용하여 로봇의 경로를 실시간으로 수정합니다. 이로 인해 로봇은 더 똑똑하고 안전해지며, 이전에 본 적이 없는 지저분한 실제 환경도 처리할 수 있게 됩니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →