← 최신 논문
💻 computer science

Walk With Me: Long-Horizon Social Navigation for Human-Centric Outdoor Assistance

본 논문은 고수준 비전-언어 모델을 활용한 의미적 계획 및 안전 추론과 저수준 비전-언어-행동 정책을 통한 일상적 실행을 결합하여 장기적·사회적 준수를 갖춘 야외 로봇 항법을 가능하게 하는 지도 없는 프레임워크인 "Walk with Me"를 소개합니다.

원저자: Lingfeng Zhang, Xiaoshuai Hao, Xizhou Bu, Yingbo Tang, Hongsheng Li, Jinghui Lu, Xiu-shen Wei, Jiayi Ma, Yu Liu, Jing Zhang, Hangjun Ye, Xiaojun Liang, Long Chen, Wenbo Ding

게시일 2026-04-30
📖 3 분 읽기☕ 가벼운 읽기

원저자: Lingfeng Zhang, Xiaoshuai Hao, Xizhou Bu, Yingbo Tang, Hongsheng Li, Jinghui Lu, Xiu-shen Wei, Jiayi Ma, Yu Liu, Jing Zhang, Hangjun Ye, Xiaojun Liang, Long Chen, Wenbo Ding

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. ✨ 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

로봇을 산책 동반자로 만들고 싶다고 상상해 보세요. "45 번 거리에서 왼쪽으로 돌아라"와 같은 구체적인 GPS 좌표를 입력하고 싶지 않습니다. 대신 "산책을 하고 싶어요"나 "저기 있는 건물로 이 택배를 가져가 줘"처럼 자연스러운 말을 하고 싶을 것입니다.

이 논문은 거칠고 예측 불가능한 실제 세계에서, 도시 전체를 미리 그린 고가의 지도가 필요 없이 정확히 이런 일을 하려는 "Walk with Me"라는 로봇 시스템을 소개합니다.

다음은 이를 간단한 부분으로 나누어 설명한 작동 원리입니다:

1. 문제: "GPS 대 인간" 간극

오늘날 대부분의 로봇은 엄격한 일정을 가진 관광객과 같습니다.去哪里할지 알기 위해 미리 구축된 고해상도 지도 (도시의 상세한 설계도 같은 것) 가 필요합니다. 그 지도가 없거나 오래되면 로봇은 길을 잃습니다. 또한, 그들은 보통 특정 지점까지 가는 방법만 알지, "편안한 곳으로 가자"와 같은 모호한 인간의 욕구를 이해하는 방법은 모릅니다.

다른 로봇들은 작은 안전한 방 안에서만 움직일 수 있는 비디오 게임 캐릭터와 같습니다. 복도에서 장애물을 피하는 데는 뛰어나지만, 붐비는 도시 거리, 신호등, 또는 사람들로 가득 찬 상황을 마주하면 혼란에 빠집니다.

"Walk with Me"는 도시 전체를 처리하고, 당신의 모호한 소원을 이해하며, 정중한 인간 산책 동반자처럼 행동할 수 있는 로봇으로 설계되었습니다.

2. 해결책: 두 개의 뇌 시스템

연구자들은 로봇에 관광 가이드와 운전기사처럼 함께 작동하는 두 가지 다른 "뇌"를 부여했습니다.

관광 가이드 (고수준 VLM)

이것은 "큰 그림"을 보는 뇌입니다. 보도 위의 작은 자갈 하나하나를 걱정하지 않습니다. 대신, 사물이 어디에 있는지 대략적인 아이디어를 얻기 위해 구글 지도나 바이두 지도와 같은 표준 공개 지도 앱을 사용합니다.

  • 역할: "산책을 하고 싶어요"라고 말하면, 이 뇌는 현재 위치를 확인하고 근처 공원이나 광장을 찾기 위해 공개 지도를 검색한 후 하나를 선택합니다. 그런 다음 그곳으로 가는 대략적인 긴 경로를 빵 부스러기처럼 연결하여 그립니다.
  • 비유: "좋아, 공원으로 가자. 저쪽으로 약 10 블록 정도 걸어가면 돼. 빵집을 지나고, 도서관을 지나고, 그리고 길을 건너면 돼"라고 말하는 인간 친구라고 생각하세요.

운전기사 (저수준 VLA)

이것은 "실무"를 담당하는 뇌입니다. 실시간으로 카메라 영상을 봅니다.

  • 역할: 관광 가이드로부터 받은 "빵 부스러기"를 받아, 사람들과 부딪히지 않고 다음 지점까지 로봇의 바퀴를 어떻게 움직여야 할지 정확히 파악합니다. 보행자에게 공간을 양보하고 장애물을 돌아다니는 등 정중하게 걷는 법을 학습합니다.
  • 비유: 이것은 실제로 걷는 사람입니다. 그들은 군중을 보고, 유모차를 피해 걸으며, 바로 앞의 상황에 기반하여 언제 좌회전이나 우회전을 해야 할지 정확히 압니다.

3. 안전 스위치: "교통 경찰"

이 시스템의 가장 영리한 부분은 관광 가이드와 운전기사 사이에 있는 안전 스위치(관측 인식 라우터) 입니다.

  • 일반적인 걷기: 로봇이 조용한 보도를 걷고 있다면, 안전 스위치는 "모두 안전함!"이라고 말하며 운전기사에게 주도권을 넘깁니다. 로봇은 매끄럽게 계속 이동합니다.
  • 위험 구역: 로봇이 붐비는 횡단보도, 빨간 신호등, 또는 거대한 군중을 보이면 안전 스위치는 브레이크를 밟습니다. "잠깐! 이건 운전기사가 처리하기엔 너무 복잡해"라고 말합니다.
  • 정지: 로봇은 멈추고 관광 가이드(큰 뇌) 에게 생각해보라고 요청합니다. 관광 가이드는 신호등, 차량, 사람들을 보고 결정합니다: "신호등이 빨간색이야; 우리는 기다려야 해." 또는 "신호등이 초록색이지만, 개가 뛰고 지나가고 있어; 잠시 기다려."
  • 재개: 관광 가이드가 "출발" 신호를 주면, 운전기사가 다시 움직이기 시작합니다.

4. 실제 테스트 내용

연구자들은 이를 컴퓨터에서 시뮬레이션하는 데 그치지 않고, 실제 바퀴 달린 로봇에 탑재하여 실제 세계로 보냈습니다. 그들은 두 가지 주요 시나리오를 테스트했습니다:

  1. 마지막 1 마일 배송: 로봇에게 "이 밀크티를 B 동으로 가져가 줘"라고 말하고 건물을 찾아 배달하는지 지켜보는 것.
  2. 맹인 안내: 로봇에게 "산책을 하고 싶어요"라고 말하고 공장을 찾아 인간과 안전하게 걷게 하며 위험한 횡단보도에서 멈추게 하는 것.

결과:
테스트에서 로봇은 인간이 개입할 필요 없이 약 **60%**의 여행을 성공적으로 완료했습니다. 모호한 지시를 이해하고, 공개 지도를 사용하여 올바른 목적지를 찾으며, 횡단보도에서 안전하게 멈추는 데 성공했습니다.

결론

"Walk with Me"는 로봇이 실제 세계를 항해하게 하는 새로운 방법입니다. 도시의 완벽하게 미리 그려진 지도가 필요 대신, 관광 가이드가 공개 지도에서 목적지를 선택하고, 운전기사가 걷기를 처리하며, 안전 스위치가 위험한 상황이 발생하면 멈추고 생각하게 합니다. 이는 로봇이 단순히 땅에 그어진 선을 따르는 것이 아니라, 우리와 함께 진정으로 걸을 수 있는 단계입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →