← 최신 논문
💻 computer science

NavWAM: A Navigation World Action Model for Goal-Conditioned Visual Navigation

NavWAM은 미래 시각 예측, 목표 진행 가치 추정, 그리고 행동 생성을 하나의 공유된 잠재 시퀀스로 통합하여, 로봇이 외부 플래너나 행동 탐색에 의존하지 않고 직접 폐루프 내비게이션을 실행할 수 있도록 하는 디퓨전 트랜스포머 정책입니다.

원저자: Daichi Azuma, Taiki Miyanishi, Koya Sakamoto, Shuhei Kurita, Yaonan Zhu, Petr Khrapchenkov, Motoaki Kawanabe, Yusuke Iwasawa, Yutaka Matsuo

게시일 2026-06-12
📖 4 분 읽기☕ 가벼운 읽기

원저자: Daichi Azuma, Taiki Miyanishi, Koya Sakamoto, Shuhei Kurita, Yaonan Zhu, Petr Khrapchenkov, Motoaki Kawanabe, Yusuke Iwasawa, Yutaka Matsuo

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. ✨ 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 로봇에게 집 안의 특정 방을 찾는 법을 가르치고 있다고 상상해 보세요. 하지만 로봇은 오직 자신의 "눈"(카메라) 바로 앞에 보이는 것만 볼 수 있습니다. 로봇은 지도가 없으며, 모퉁이 너머를 볼 수도 없습니다. 이것이 바로 **목표 조건부 시각 내비게이션(goal-conditioned visual navigation)**의 과제입니다.

여기서 저자인 아즈마 다이치(Daichi Azuma)와 그의 팀이 NavWAM이라는 새로운 시스템을 통해 이 문제를 해결한 이야기가 있습니다.

문제점: "수정구슬" vs "운전자"

과거에 연구자들은 두 가지 별개의 도구를 사용하여 로봇에게 내비게이션을 가르치려 했습니다:

  1. 수정구슬 (세계 모델, World Model): 이 도구는 로봇이 앞으로 움직였을 때 무엇을 보게 될지 추측하는 데 탁-월합니다. "왼쪽으로 돌면 주방이 보일 거야." "직진하면 벽에 부딪힐 거야."
  2. 운전자 (플래너, Planner): 이 도구는 수정구슬의 추측을 보고 "좋아, 주방이 잘 보이니 왼쪽으로 돌자"라고 결정합니다.

결함: 이 논문은 이 두 가지를 분리해서 유지하는 것이 비효율적이라고 주장합니다. 이는 마치 옆자리에 앉은 승객이 "왼쪽으로 돌아!"라고 소리를 지르는 동안, 운전자는 멈춰서 생각한 뒤에야 핸들을 돌려야 하는 상황과 같습니다. 병목 현상이 발생하는 것입니다. "수정구슬"은 미래를 예측하지만, 그곳에 도달하기 위해 어떻게 운전해야 하는지는 알지 못합니다.

해결책: NavWAM (더 "운전 잘하는 예측 모델")

저자들은 NavWAM(Navigation World Action Model)을 만들었습니다. NavWAM을 미래를 볼 줄 아는 초특급 운전자라고 생각해보세요.

NavVM은 별도의 "수정구슬"과 "운전자"를 두는 대신, 이 둘을 하나의 뇌로 결합했습니다. 이 모델은 단순히 무엇을 보게 될지 추측하는 것에 그치지 않고, 무엇을 보게 될지, 목표에 얼마나 가까워질지, 그리고 정확히 어떤 조향 명령(steering commands)을 내려야 하는지를 동시에 예측합니다.

창의적 비유: "공유된 캔버스"

NavWAM이 어떻게 작동하는지 이해하려면, 9개의 패널로 구성된 단일 캔버스에서 작업하는 화가를 상상해 보세요.

  • 하단 패널 (우리가 알고 있는 것): 로봇의 현재 시야, 현재 위치, 그리고 목표 이미지(예: 특정 의자 사진)를 보여줍니다.
  • 상단 패널 (우리가 예측하는 것): 로봇은 다음을 보여주기 위해 이 패널들을 그려냅니다:
    1. 로봇이 미래에 보게 될 모습.
    2. 목표에 얼마나 가까워졌는지.
    3. 가장 중요한 부분: 그곳에 도달하기 위해 필요한 실제 조향 명령(액션 청크, action chunk).

로봇은 이 캔버스를 "디노이징(denoising, 노이즈 제거)"하며 학습합니다. 로봇은 미래의 흐릿하고 엉망인 버전에서 시작하여, 경로와 목적지, 그리고 취해야 할 단계들이 명확하게 드러날 때까지 그림을 깨끗하게 다듬어 나갑니다. "조향 명령"이 "미래의 모습"과 동일한 캔버스에 그려지기 때문에, 로봇은 그 목표를 보기 위해서는 이러한 특정 행동을 취해야 한다는 것을 학습하게 됩니다.

경쟁 모델을 압도하는 방법

논문은 NavWAM을 두 가지 유형의 다른 로봇과 비교 테스트했습니다:

  1. 기존 방식 (NWM): 로봇이 미래를 예측한 다음, 어떤 행동을 취할지 결정하기 위해 복잡하고 느린 수학적 탐색(CEM이라 불리는)을 수행합니다. 이는 한 수를 두기 전에 100수 앞을 계산하는 체스 선수와 같습니다.
  2. 직접적인 방식 (OmniVLA): 로봇이 미래를 생각하지 않고 목표만 보고 다음 움직임을 즉각적으로 예측합니다. 이는 앞을 내다보지 않고 도로 상황에 반응하기만 하는 운전자와 같습니다.

결과:

  • NavWAM vs 기존 방식 (NWM): NavWAM은 복잡한 계산 과정을 거칠 필요가 없었기에 훨씬 빠르고 정확했습니다. 복잡한 탐색을 위해 멈출 필요 없이 그냥 "알아서" 움직였습니다. 기존 방식은 실제 환경 테스트에서 성공률이 **16%**에 불과했지만, NavWAM은 **79%**의 성공률을 기록했습니다.
  • NavWAM vs 직접적인 방식 (OmniVLA): NavWAM은 훨씬 더 크고 강력한 컴퓨터 뇌를 사용하는 Direct Way와 대등한 성능을 보여주었으며, 여기에 더해 미래를 예측하는 초능력까지 갖추고 있었습니다.

실제 환경 테스트

연구팀은 단순히 컴퓨터 시뮬레이션에서만 테스트하지 않았습니다. 그들은 Diablo라는 이름의 실제 로봇에 NavWAM을 탑재하여 네 가지 서로 다른 실내 환경(사무실, 창고, 회의실, 복도)에 보냈습니다.

  • 목표: 해당 공간에 찍힌 특정 이미지를 찾는 것.
  • 결과: NavWAM은 24번의 시도 중 24번 중 19번을 성공적으로 찾아냈습니다.
  • "예측력" 검증: NavWAM이 움직이기 위해 반드시 미래 예측을 사용할 필요는 없었음에도 불구하고(조향 명령만 사용해도 됨), 논문은 그 예측이 놀라울 정도로 정확했다는 점을 보여줍니다. 로봇이 "4초 후에 문이 보일 것이다"라고 예측했을 때, 실제로 4초 후에 문이 나타났습니다.

핵심 요약

이 논문의 결론은 로봇이 잘 길을 찾으려면 단순히 "예측자"나 단순히 "운전자"여 데 그쳐서는 안 된다는 것입니다. 두 가지 역할을 동시에 수행해야 합니다. 미래를 예측하는 것과 그 미래를 만들기 위해 필요한 행동을 한 번에 학습함으로써, 로봇은 한 번도 가본 적 없는 장소에서도 훨씬 더 길을 잘 찾을 수 있게 됩니다.

요약하자면: NavWAM은 로봇에게 "앞을 보고, 멈추고, 계산하고, 그다음에 운전하라"가 아니라, **"앞을 내다보며 동시에 운전하는 법"**을 가르칩니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →