← 최신 논문
💻 computer science

NavThinker: Action-Conditioned World Models for Coupled Prediction and Planning in Social Navigation

이 논문은 로봇의 행동에 따라 미래의 장면 기하학과 인간 움직임을 예측하는 '액션 조건부 세계 모델'과 온-정책 강화학습을 결합하여 사회적 항법에서 안전하고 효과적인 의사결정을 가능하게 하는 'NavThinker' 프레임워크를 제안합니다.

원저자: Tianshuai Hu, Zeying Gong, Lingdong Kong, XiaoDong Mei, Yiyi Ding, Qi Zeng, Ao Liang, Rong Li, Yangyi Zhong, Junwei Liang

게시일 2026-03-19
📖 3 분 읽기☕ 가벼운 읽기

원저자: Tianshuai Hu, Zeying Gong, Lingdong Kong, XiaoDong Mei, Yiyi Ding, Qi Zeng, Ao Liang, Rong Li, Yangyi Zhong, Junwei Liang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. ✨ 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

이 논문은 로봇이 사람들과 함께 다니는 복잡한 환경에서 어떻게 안전하고 예의 바르게 이동할 수 있을지 해결하는 새로운 방법, **'NavThinker(내비게이션 사고쟁이)'**를 소개합니다.

기존의 로봇들은 "지금 보이는 것"만 보고 반응했습니다. 마치 길을 걷다가 갑자기 앞에 사람이 나타나면 멈추거나 피하는 '반사 신경'만 가진 것과 비슷하죠. 하지만 NavThinker 는 **"앞으로 어떻게 될지 미리 상상해 본다"**는 인간과 같은 사고 방식을 로봇에 심어줍니다.

이해를 돕기 위해 몇 가지 비유로 설명해 드릴게요.

1. 문제: "눈만 뜨고 걷는 로봇" vs "미래를 보는 로봇"

기존 로봇들은 눈을 감고 걷다가 장애물을 만나면 멈추는 사람과 비슷합니다. 사람이 갑자기 튀어나오면 피할 수 있지만, 복잡한 군중 속에서 서로를 비켜가며 길을 찾는 것은 매우 어렵습니다.

  • 기존 방식: "아, 저 사람이 오네? 멈춰!" (반응형)
  • NavThinker 방식: "내가 지금 왼쪽으로 가면 저 사람은 어떻게 될까? 오른쪽으로 가면 어떨까? 아, 왼쪽으로 가면 저 사람이 나를 피해서 지나가겠구나. 그럼 왼쪽으로 가자!" (예측형)

2. 해결책: "상상력"을 가진 두 가지 도구

NavThinker 는 로봇에게 두 가지 강력한 능력을 선물합니다.

A. "미래를 보는 안경" (세계 모델)

이 로봇은 Depth Anything V2라는 아주 똑똑한 안경을 끼고 있습니다. 이 안경은 로봇이 보는 깊이 (거리) 정보를 바탕으로, 로봇이 어떤 행동을 취했을 때 미래의 장면이 어떻게 변할지 그려냅니다.

  • 비유: 체스 선수가 다음 수를 두기 전에 "내가 이 말을 움직이면 상대방은 어떻게 반응할까?"라고 3~4 수 앞을 상상하는 것과 같습니다. 로봇은 "내가 앞으로 가면 사람 A 는 왼쪽으로 피할 것 같고, 오른쪽으로 가면 사람 B 와 부딪힐 것 같다"고 가상의 미래를 만들어냅니다.

B. "미래를 반영하는 두 가지 전략"

그렇게 상상한 미래를 실제 행동에 어떻게 적용할까요? 두 가지 방법이 있습니다.

  1. 미래의 모습을 현재에 섞어보기 (Feature Fusion):
    로봇이 결정을 내릴 때, 지금 보이는 장면뿐만 아니라 **"만약 내가 앞으로 간다면 1 초 뒤의 장면"**을 함께 보고 판단합니다. 마치 운전할 때 "지금 차선만 보는 게 아니라, 3 초 뒤의 차선 상황도 미리 보고 핸들을 꺾는" 것과 같습니다.

  2. 미래의 결과를 점수로 매기기 (Social Reward Shaping):
    로봇은 "사람과 부딪히면 안 돼"라는 규칙만 배우는 게 아닙니다. "내가 이렇게 행동하면 사람이 불편해할 것 같아"라고 예측했을 때 벌점을 받습니다. 반대로 "사람이 자연스럽게 지나갈 것 같아"라고 예측되면 보상을 받습니다.

    • 비유: 게임에서 "상대방을 괴롭히면 점수가 깎인다"는 규칙을 미리 알려주는 것과 같습니다. 로봇은 부딪히기 전에 "아, 이 길로 가면 나중에 사람과 부딪혀서 점수가 깎이겠구나"라고 깨닫고 다른 길을 선택합니다.

3. 실제 성과: 시뮬레이션과 현실 모두에서 성공

이 기술은 컴퓨터 시뮬레이션 (Social-HM3D) 에서만 좋은 게 아니라, **실제 Unitree Go2(4 발 로봇)**에서도 테스트되었습니다.

  • 결과: 다른 로봇들보다 성공률이 훨씬 높았고, 사람들과의 충돌은 줄였습니다. 특히 여러 대의 로봇이 동시에 이동하는 복잡한 상황에서도 서로를 잘 배려하며 길을 찾았습니다.
  • 특이점: 학습한 환경과 완전히 다른 새로운 환경에서도 별도의 학습 없이 바로 작동했습니다 (Zero-shot). 이는 로봇이 환경의 '규칙'을 외운 게 아니라, **'상황을 이해하고 예측하는 능력'**을 진짜로 배웠다는 뜻입니다.

요약

NavThinker는 로봇에게 **"지금 당장 반응하는 것"을 넘어 "앞으로 일어날 일을 상상하고 계획하는 능력"**을 가르쳤습니다.

마치 길을 걷는 사람이 "저 사람이 오면 내가 피해야겠다"라고 미리 생각하고 자연스럽게 옆으로 비켜가는 것처럼, 로봇도 사람들과 함께 살아가는 사회에서 예의 바르고 안전한 이동을 할 수 있게 된 것입니다. 이는 로봇이 단순히 기계가 아니라, 인간의 사회적 맥락을 이해하는 파트너로 발전하는 중요한 한 걸음입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →