← 최신 논문
💻 computer science

City Navigation in the Wild: Exploring Emergent Navigation from Web-Scale Knowledge in MLLMs

이 논문은 MLLM(멀티모달 거대언어모델)의 실세계 지식 기반 내비게이션 능력을 평가하기 위한 새로운 벤치마크인 'CityNav'를 제안하고, 도시 규모의 인지 지도를 활용해 경로를 구체화하는 'VoP(Verbalization of Path)' 기법을 통해 탐색 성능을 크게 향상시켰음을 보여줍니다.

원저자: Dwip Dalal, Utkarsh Mishra, Narendra Ahuja, Nebojsa Jojic

게시일 2026-02-12
📖 2 분 읽기☕ 가벼운 읽기

원저자: Dwip Dalal, Utkarsh Mishra, Narendra Ahuja, Nebojsa Jojic

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

🏙️ 제목: "AI, 길치 탈출기: 구글 스트리트 뷰로 떠나는 도시 탐험"

1. 문제 제기: "AI는 똑똑하지만, 길은 잘 못 찾아요" (The Problem)

지금까지의 AI(멀티모달 거대언어모델, MLLM)는 책을 읽거나 그림을 보고 설명하는 건 아주 잘했습니다. 하지만 **"실제 도시에서 길 찾기"**라는 미션을 주면 이야기가 달라집니다.

기존의 AI 길 찾기 테스트는 마치 '실내 게임기' 안에서 움직이는 것과 같았습니다. 정해진 규칙이 있고, 지도가 있고, 주변에 "여기는 거실입니다"라고 친절하게 알려주는 환경이었죠. 하지만 진짜 세상은 어떤가요? 표지판은 외국어로 되어 있고, 건물은 비슷비슷하며, 가다 보면 막다른 길도 나옵니다.

이 논문의 저자들은 AI에게 **"지도도 없고, GPS도 없고, 친절한 설명도 없다! 오직 네 눈(카메라 이미지)과 네 머릿속 지식만 믿고 뉴욕이나 도쿄 같은 대도시에서 목적지까지 찾아가 봐!"**라는 아주 어려운 미션을 던진 것입니다. 이것을 논문에서는 **'CityNav'**라고 부릅니다.

2. 새로운 해결책: "말로 하면서 가기" (The Solution: VoP)

연구팀은 AI가 길을 헤매는 이유를 찾아냈습니다. AI가 눈앞의 사진만 보고 "왼쪽으로 갈까, 오른쪽으로 갈까?"를 결정하다 보니, 자기가 지금 어디쯤 있는지, 원래 어디로 가려고 했는지를 금방 까먹는 것이죠. 마치 **"눈앞의 맛있는 냄새에 홀려 목적지를 잊어버리는 여행객"**처럼 말이죠.

그래서 연구팀은 **'VoP(Verbalization of Path, 경로의 언어화)'**라는 마법 같은 방법을 제안했습니다.

이 방법은 AI에게 이렇게 시키는 것입니다:

"길을 결정하기 전에, 네가 지금 어디에 있는지, 목적지는 어디인지, 그리고 앞으로 어떤 길로 갈 건지 입 밖으로(텍스트로) 소리 내어 말해봐!"

비유를 들어볼까요?

  • 기존 AI: 눈을 감고 걷다가 갈림길이 나오면 "음, 왼쪽인가?" 하고 대충 찍어서 가는 사람.
  • AgentNav (새로운 AI): 걷는 내내 **"나는 지금 뉴욕 브로드웨이 5번가에 있어. 목적지는 원 월드 트레이드 센터야. 이제 남쪽으로 쭉 가다가 베시 스트리트에서 우회전할 거야!"**라고 끊임없이 중얼거리며 걷는 사람.

이렇게 **말로 내뱉는 과정(Verbalization)**을 통해 AI는 자신의 머릿속에 있는 '도시 지식'을 끄집어내고, 자신이 어디에 있는지 스스로 확인하며(자기 위치 파악), 길을 잃지 않게 됩니다.

3. 결과: "놀라운 성적 향상" (The Results)

연구팀은 뉴욕, 도쿄, 비엔나, 상파울루 등 전 세계 다양한 도시에서 실험을 했습니다. 결과는 놀라웠습니다.

  • 성적 급상승: 단순히 사진만 보고 결정하던 AI보다, **"말로 계획을 세우며 걷는 AI"**의 성공률이 압도적으로 높았습니다.
  • 지식의 활용: AI는 학습 과정에서 이미 인터넷의 방대한 데이터를 통해 도시의 구조를 배웠는데, '말로 하기'를 시키니까 그 잠들어 있던 지식을 깨워서 길 찾기에 사용하기 시작했습니다.

4. 요약하자면? (Summary)

이 논문은 **"AI에게 단순히 '보고 움직여'라고 하는 대신, '네가 아는 것을 말하면서 움직여'라고 하면 훨씬 똑똑하게 길을 찾는다"**는 것을 증명했습니다.

이 기술이 발전하면, 나중에는 AI 로봇이 우리 대신 복잡한 도시를 돌아다니며 심부름을 하거나, 자율주행 자동차가 훨씬 더 사람처럼 유연하게 길을 찾는 세상을 만들 수 있을 것입니다. 🚀

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →