← 최신 논문
💻 computer science

HiMemVLN: Enhancing Reliability of Open-Source Zero-Shot Vision-and-Language Navigation with Hierarchical Memory System

HiMemVLN은 계층적 메모리 시스템을 도입하여 오픈 소스 제로샷 시각-언어 내비게이션의 "내비게이션 건망증(Navigation Amnesia)" 문제를 해결함으로써 장기적 위치 추정 및 시각적 회상을 크게 향상시키며, 기존의 최첨단 오픈 소스 방식보다 거의 두 배 높은 성능을 달성합니다.

원저자: Kailin Lyu, Kangyi Wu, Pengna Li, Xiuyu Hu, Qingyi Si, Cui Miao, Ning Yang, Zihang Wang, Long Xiao, Lianyu Hu, Jingyuan Sun, Ce Hao

게시일 2026-07-21
📖 2 분 읽기☕ 가벼운 읽기

원저자: Kailin Lyu, Kangyi Wu, Pengna Li, Xiuyu Hu, Qingyi Si, Cui Miao, Ning Yang, Zihang Wang, Long Xiao, Lianyu Hu, Jingyuan Sun, Ce Hao

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신의 목소리를 이해하고 당신처럼 세상을 볼 수 있는 로봇을 상상해 보세요. 이것이 바로 '체화된 AI(Embodied AI)'의 꿈입니다. 이는 컴퓨터가 단순히 대화를 나누거나 계산만 하는 것이 아니라, 방 안을 물리적으로 이동하고, "주방으로 가서 컵을 가져와"와 같은 지시를 따르며, 복잡한 공간에서 벽에 부딪히지 않고 항해하는 분야를 말합니다. 오랫동안 이러한 로봇들은 움직이는 법을 배우기 위해 인간이 작성한 방대한 양의 훈련 데이터가 필요했으며, 이로 인해 새로운 집이나 사무실에 적응하는 속도가 느렸습니다. 최근 과학자들은 로봇에게 상식을 부여하기 위해 거대 언어 모델(LLM)이라는 거대한 '두뇌' 모델을 사용하기 시작했고, 이를 통해 로봇이 사전 훈련 없이도 즉석에서 항해 방법을 파악할 수 있게 되었습니다. 하지만 여기에는 문제가 있습니다. 가장 똑똑한 두뇌들은 비용이 많이 드는 클라우드 기반의 문 뒤에 잠겨 있어 사용료가 발생하며, 집 안의 영상 피드를 서버로 전송하기 때문에 개인정보 보호 문제도 일으킵니다. 오픈 소스 모델(무료인 로컬 두뇌)도 존재하지만, 이들은 종종 혼란을 겪거나, 자신이 어디에 있는지 잊어버리거나, 제자리를 맴도는 등, 비싼 폐쇄형 모델이 보여주는 능력과 실제 능력 사이에 큰 격차가 존재합니다.

여기에 HiMemVLN이 등장했습니다. 이는 오픈 소스 로봇 두뇌에게 자신이 어디에 있었고 어디로 가고 있는지를 기억하는 법을 가르쳐, 효과적으로 그들의 '항해 기억상실증'을 치료하는 새로운 접근 방식입니다. 연구진은 오픈 소스 로봇들이 두 가지 유형의 망각을 겪는다는 것을 발견했습니다. 바로 주변 환경을 놓쳐서 제자리를 맴도는 단기 기억상실과, 원래의 목표를 잊어버리고 몇 걸음 만에 경로를 벗어나는 장기 기억상실입니다. 이를 해결하기 위해 팀은 인간의 뇌가 작동하는 방식에서 영감을 얻은 '계층적 메모리 시스템'을 구축했습니다. 그들은 방금 방문한 방들을 지속적으로 그려내어 제자리를 맴돌고 있는지 파악하는 시각적 스케치북 역할을 하는 Short-Term Localer를 만들었습니다. 또한, 나침반이자 미션 컨트롤러 역할을 하며 로봇에게 "너는 침실에서 시작했고, 주방으로 가야 하며, 현재 잘못된 방향으로 향하고 있다"와 같이 큰 그림을 끊임없이 상기시켜 주는 Long-Term Globaler를 구축했습니다.

이 두 가지 메모리 시스템을 결합함으로써, HiMemVLN은 오픈 소스 로봇이 이전에는 값비싼 폐쇄형 모델에서나 볼 수 있었던 수준의 신뢰성 있는 항해를 할 수 있게 해줍니다. 테스트 결과, 이 방식은 로봇이 루프(제자리 돌기)를 피하도록 도왔을 뿐만 아니라, 기존의 가장 뛰어난 오픈 소스 방식들과 비교했을 때 성공률을 거의 두 배로 높였습니다. 시뮬레이션 환경에서 이 새로운 시스템은 성공률 **30%**와 성공 가중 경로 길이(SPL) 26.85를 달ach하여, 단 **16%**의 성공률만을 기록했던 이전의 오픈 소스 선두주자인 OpenNav를 크게 앞질렀습니다. 연구진은 실제 방 안에서 실제 바퀴 달린 로봇을 대상으로 테스트를 진행했는데, 여기서도 OpenNav의 18% 대비 **32%**의 성공률을 기록하며 경쟁 모델을 이겼습니다. 이 연구는 로봇에게 즉각적인 시각적 주변 환경과 장기적인 목표를 모두 기억할 수 있는 구조화된 방법을 제공함으로써, 클라우드에 의존하지 않고도 안전하고 사적인, 그리고 매우 유능한 항해 에이전트를 구축할 수 있음을 시사합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →