← 최신 논문
💻 computer science

VLN-AVP: Zero-Shot Vision-Language Navigation with Hybrid Long-Short-Term Memory for Autonomous Valet Parking

본 논문은 지도 의존성을 제거하고 자연어 지시를 해석하며 시뮬레이션 및 실제 지하 주차 환경 모두에서 우수한 성능을 달성하기 위해 조감도(Bird's-Eye-View) 인지, 시각-언어 모델, 그리고 하이브리드 메모리 시스템을 결합한 자율 발레 파킹을 위한 제로샷 내비게이션 프레임워크인 VLN-AVP를 제안한다.

원저자: Yijian Li, Xiangru Mu, Changze Li, Hantian Shi, Jiyuan Cai, Jia Cai, Xiaoxue Liu, Yajing Sun, Ming Yang, Tong Qin

게시일 2026-07-21
📖 3 분 읽기☕ 가벼운 읽기

원저자: Yijian Li, Xiangru Mu, Changze Li, Hantian Shi, Jiyuan Cai, Jia Cai, Xiaoxue Liu, Yajing Sun, Ming Yang, Tong Qin

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. ✨ 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

로봇에게 운전하는 법을 가르치고 있다고 상상해 보세요. 오랫동안 로봇에게 주차를 가르치는 유일한 방법은 모든 회전 구간과 장애물이 잉크로 표시된 완벽하고 정교한 지도를 보물 지도처럼 통째로 주는 것이었습니다. 건물을 이미 알고 있다면 이 방법은 아주 잘 작동하지만, 만약 로봇이 처음 가보는 낯선 주차장에 들어선다면 지도가 없기 때문에 로봇은 꼼짝도 할 수 없습니다. 이것이 바로 '자율 발레 파킹(AVP)'의 세계입니다. 하지만 만약 로봇이 스스로 주변을 둘러보고, 표지판을 읽고, "엘리베이터 근처에 자리를 찾아줘"라는 사람의 말을 이해할 수 있다면 어떨까요? 여기서 '시각-언어 내비게이션(VLN)'이 등장합니다. VLN을 로봇이 눈(시각)과 단어를 읽고 추론하는 능력(언어)을 결组合하여 세상을 이해하도록 가르치는 것이라고 생각해 보세요. 연구자들이 던지는 핵심 질문은 이것입니다: 우리가 말하는 것을 듣고 표지판을 보는 것만으로, 한 번도 본 적 없는 낯선 지하 주차장을 헤매지 않고 스스로 운전할 수 있을 만큼 자율주행 자동차를 똑똑하게 만들 수 있을까?

이 논문은 정확히 그 문제를 해결하고자 하는 VLN-AVP라는 새로운 시스템을 소개합니다. 저자들은 "제로샷(zero-shot)" 내비게이션 프레임워크를 제안하는데, 이는 시스템이 사전에 만들어진 지도 없이 오직 인간의 자연어 지시만을 사용하여 한 번도 본 적 없는 새로운 주차 공간을 처리할 수 있다는 뜻의 멋진 표현입니다. 시스템은 미리 구축된 지도에 의존하는 대신, 강력한 "시각-언어 모델(VLM)"을 사용합니다. VLM은 사진을 보고 문장을 읽어 무엇을 해야 할지 파악할 수 있는 '슈퍼 스마트한 로봇의 뇌'라고 생각하면 됩니다. 하지만 저자들은 단순히 로봇에게 똑똑한 뇌를 주는 것만으로는 충분하지 않으며, 혼란을 피하기 위해 더 나은 기억력이 필요하다는 것을 발견했습니다.

이를 해결하기 위해 팀은 두 가지 뚜렷한 부분으로 구성된 하이브리드 메모리 시스템을 구축했습니다. 첫째, **단기 기억(Short-Term Memory)**은 로봇의 즉각적인 "작업 기억" 역할을 합니다. 똑똑한 뇌(VLM)는 세상을 아주 빠르게 관찰하지는 못하기 때문에, 빠르게 지나가는 표지판을 놓칠 수도 있습니다. 단기 기억은 최근에 본 표지판과 시각적 단서들의 목록을 계속 유지하여, 로봇이 3초 전에 '출구' 표지판을 봤다는 사실을 잊지 않도록 돕습니다. 둘째, **장기 토폴로지컬 메모리(Long-Term Topological Memory)**는 로봇이 주행하면서 그리는 정신적인 스케치와 같습니다. 로봇이 경로를 찾거나 랜드마크(예: 특정 엘리베이터)를 성공적으로 찾을 때마다 이를 스케치에 추가합니다. 만약 로봇이 같은 주차장을 다시 주행해야 한다면, 매번 똑똑한 뇌에게 처음부터 모든 것을 파악하라고 요청하는 대신 이 스케치를 사용하여 더 빠르고 효율적으로 움직일 수 있습니다.

연구진은 두 가지 방식으로 이 아이디어를 테스트했습니다: 고정밀 컴퓨터 시뮬레이션과 실제 지하 주차장에서의 실제 차량 테스트입니다. 그들은 10개의 고품질 3D 주차 장면과 1,000개 이상의 내비게이션 에피소드를 특징으로 하는 VLN-AVP라는 새로운 데이터셋을 만들었는데, 이는 이 분야의 연구를 위해 만들어진 지하 주차장 장면 중 가장 큰 규모입니다.

결과는 유망했습니다. 시뮬레이션에서 VLN-AVP 시스템은 다른 방법들보다 훨씬 뛰어난 성능을 보였습니다. 이 시스템은 다른 시각-언어 내비게이션 방법들보다 25% 이상 높은 성공률을 기록했으며, 다른 자율주행 방법들보다 15% 이상 높은 성공률을 달성했습니다. 실제 차를 이용한 실전 테스트에서도 시스템은 잘 작동했습니다. "엘리베이터 홀 근처에 자리를 찾아줘"와 같은 복잡한 지시를 성공적으로 수행했을 뿐만 아니라, 사람이 "아니요, 그 엘리베이터가 아니에요, 계속 가세요"라고 말했을 때 경로를 수정하는 모습도 보여주었습니다. 이 연구는 똑똑한 언어 뇌와 영리한 두 부분의 메모리 시스템을 결합함으로써, 우리가 더 유연하고 미리 그려진 지도 없이도 임무를 완수할 수 있는 자율 주차 자동차를 만들 수 있음을 시사합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →