← 최신 논문
💻 computer science

MemVLN: Episodic and Procedural Memory for Vision-and-Language Navigation

MemVLN은 효율적인 장기 이력 유지를 위한 피라미드형 에피소드 메모리와 자기회귀적 디코딩 지연을 우회하기 위해 원자적 중간 수준 동작을 사용하는 절차적 메모리를 통합함으로써, 최첨단 성능과 14 FPS의 추론 속도를 달리는 실시간 시각-언어 내비게이션 프레임워크이다.

원저자: Yuqi Liu, Shengju Qian, Tianyuan Qu, Mingxian Lin, Zixuan Wang, Xin Wang, Bei Yu, Jiaya Jia

게시일 2026-07-28
📖 3 분 읽기☕ 가벼운 읽기

원저자: Yuqi Liu, Shengju Qian, Tianyuan Qu, Mingxian Lin, Zixuan Wang, Xin Wang, Bei Yu, Jiaya Jia

원본 논문은 CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/)에 따라 공공 도메인에 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 로봇에게 한 번도 본 적 없는 집 안을 걸어 다니는 법을 가르치려 한다고 상상해 보세요. 로봇은 오직 "주방으로 가서, 파란 꽃병에서 왼쪽으로 꺾은 뒤, 냉장고 옆에 멈춰라"라는 음성 안내만을 받습니다. 이것이 바로 **시각-언어 내비게이션(Vision-and-Language Navigation, VLN)**의 세계입니다. 이는 컴퓨터 에이전트가 음성 명령을 이해하고 카메라를 통해 세상을 바라보며 다음에 어디로 이동할지를 파악해야 하는 로봇 공학 및 인공지능의 한 분야입니다. 까다로운 점은 로봇이 비디오 게임처럼 한 지점에서 다른 지점으로 점프할 수 있는 것이 아니라, 연속적인 공간에서 실제 단계별 행동을 취해야 한다는 것입니다. 이를 잘 수행하기 위해 로봇에게는 두 가지 초능력이 필요합니다. 바로 자신이 어디서 시작했고 어디로 가고 있는지 기억하는 **장기 기억(long-term memory)**과, 지금 눈에 보이는 것에 즉각적으로 반응하는 **빠른 반사 신경(fast reflexes)**입니다. 로봇이 생각하는 데 너무 느리면 벽에 부딪히고, 과거를 잊어버리면 제자리를 맴돌게 됩니다. 과학자들은 이 두 가지를 동시에 수행할 수 있는 로봇을 만들기 위해 노력해 왔지만, 대개 똑똑함과 빠름 사이에서 하나를 선택해야만 했습니다.

여기, 두 마리 토끼를 모두 잡도록 설계된 새로운 로봇 두뇌인 MemVLN이 등장했습니다. 이 프로젝트의 연구진은 기존의 로봇들이 모든 여정의 세부 사항을 동일한 품질로 기억하려고 하기 때문에 속도가 느려진다는 점을 깨달았습니다. MemVLN은 인간의 기억 방식이 실제로 어떻게 작동하는지를 모방함으로써 이 문제를 해결합니다. 이 시스템은 기억을 **에피소드 기억(Episodic Memory)**과 **절차적 기억(Procedural Memory)**이라는 두 가지 특별한 유형으로 나눕니다. 에피소드 기억은 가장 최근의 사진은 고화도로 유지하되, 오래된 사진은 아주 작은 썸네일로 축소해 놓은 사진 앨범과 같습니다. 이를 통해 로봇은 몇 시간 전의 경로 형태는 기억하면서도 데이터 과부하에 빠지지 않고, 현재 자신이 있는 곳을 선명하게 파악할 수 있습니다. 한편, 절차적 기억은 운전이나 타이핑을 할 때의 근육 기억과 같습니다. 로봇이 "이제 왼쪽으로 꺾어서 앞으로 걸어가겠다"와 같이 긴 문장을 정성스럽적으로 입력하는 대신, 미리 만들어진 "액션 토큰(action tokens)"이라는 지름길 어휘를 사용합니다. 이를 통해 로봇은 지연을 유발하는 느린 단계별 사고 과정을 건너뛰고 단 한 번의 번뜩임으로 결정을 내릴 수 있습니다.

이 논문은 두 가지 기억 스타일을 결합하여 연속적인 환경을 14 FPS(초당 프레임 수)의 속도로 항해하는 프레임워크로서 MemVL much VLN을 소개합니다. 이는 이전 방식들이 긴 시각적 이력과 실시간 제어 사이의 균형을 맞추는 데 어려움을 겪는다는 저자들의 언급과 비교했을 때 상당한 속도 향상입니다. '피라미드 해상도(pyramidal resolution)' 전략을 사용하여, 시스템은 즉각적인 뷰는 풀 512 × 512 해상도로 처리하고, 단기 뷰는 256 × 256, 장기 이력은 압축된 128 × 128 해상도로 처리합니다. 이는 로봇이 눈앞의 상황에 집중하면서도 과거의 요약본을 유지할 수 있도록 보장합니다. 절차적 기억의 경우, 팀은 표준적인 느린 액션 생성 방식(시퀀스당 300ms 이상 소요)을 복잡한 움직임을 나타내는 단일 토큰을 사용하는 "빠른 액션(fast action)" 메커니즘으로 대체하여, 시간을 약 70ms로 단축했습니다.

표준 내비게이션 벤치마크, 특히 R2R-CERxR-CE에서의 테스트 결과는 이 접근 방식이 매우 효과적임을 시사합니다. 저자들은 자신들의 모델인 MemVLN-4B가 R2R 데이터셋에서는 베이스라인인 Qwen3-VL-4B 구조보다 성공률에서 5.8%, RxR 데이터셋에서는 9.7% 더 높은 성능을 보였다는 것을 발견했습니다. 더욱 인상적인 것은, 이 새로운 시스템이 추론 지연 시간에서 7배의 속도 향상을 달 Gener 하여 실시간 작동이 가능하다는 점입니다. 논문은 토큰 병합(데이터를 압축하기 위해 다른 시스템에서 사용하는 방법)이 최선의 해결책이라는 생각에 명시적으로 반박하며, 해당 방식이 고급 위치 파악에 필요한 공간 그리드를 파괴한다고 지적합니다. 대신, 그들의 피라미드 해상도는 그리드 구조를 유지하면서도 데이터를 압축합니다. 저자들은 기억 피라미드의 다양한 "모양"을 테스트했으며, 가장 최근의 뷰에 가장 높은 해상도를 부여하는 "상승형(ascending)" 디자인이 가장 효과적이라는 것을 발견했습니다. 이 모델은 추가적인 센서(깊이 카메라 등) 없이 오직 표준 RGB 비디오(인간의 눈과 동일)와 자연어에만 의존함에도 불구하고, 스마트한 기억 시스템이 제한된 시각 데이터의 한계를 보완할 수 있음을 시사합니다. 이 연구는 고해도도의 최근 관측치와 압축된 이력 사이의 균고를 맞춤으로써, 로봇이 복잡하고 미지의 공간을 이전보다 훨씬 더 효과적이고 빠르게 항해할 수 있음을 확인시켜 줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →