← 최신 논문
🤖 AI

LifelongCrossNav: Persistent 3D Semantic Memory for Cross-Floor Multi-Object Navigation

LifelongCrossNav는 지속적인 공유 희소 3D 시맨틱 복셀 메모리를 유지하고 특화된 계단 이동 능력을 통합함으로써 미지의 실내 환경 내 여러 층을 가로지르는 순차적 다중 객체 내비게이션을 가능하게 하는 프레임워크이며, 새롭게 도입된 HM3D-MFMON 벤치마크에서 기존의 평면 기반 베이스라인들을 능가한다.

원저자: Zehui Li, Zihao Sun, Jiawei Xu, Zheqi He, Xiaoqiang Zhang, Jing-Shu Zheng, Lu Liu, Dahui Gao, Xiuwan Chen

게시일 2026-08-10
📖 3 분 읽기☕ 가벼운 읽기

원저자: Zehui Li, Zihao Sun, Jiawei Xu, Zheqi He, Xiaoqiang Zhang, Jing-Shu Zheng, Lu Liu, Dahui Gao, Xiuwan Chen

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

집 안을 돌아다니며 리모컨을 찾고, 그다음엔 고양이를, 마지막으로 토스터기를 찾아내는 로봇을 상상해 보세요. 이 로봇은 길을 잃거나 벽에 부딪히지 않습니다. 이것이 바로 컴퓨터가 단순히 사진을 보는 것을 넘어, 실제로 움직이며 일을 수행하는 '체화된 AI(embodied AI)'의 꿈입니다. 오랫동안 이러한 로봇들은 기억력이 매우 짧고 계단을 무서워하는 사람과 같았습니다. 단일 층에서 물건 하나는 찾을 수 있었지만, 세 가지 물건을 차례로 찾아달라고 하거나 다음 물건이 위층에 있는 경우, 그들은 종 eyes 혼란에 빠지거나 이미 살펴본 곳을 잊어버리거나, 혹은 단순히 계단을 오르기를 거부하곤 했습니다. 그들은 세상을 평면 지도로 취급하여 2층을 1층 위에 겹쳐 놓았는데, 이는 비디오 게임에는 적합할지 몰라도 계단이 있는 실제 집에는 끔찍한 방식입니다.

과학자들이 던져온 핵심 질문은 이것입니다: 어떻게 하면 로봇에게 사물이 어떻게 생겼는지뿐만 아니라, 각 층이 어떻게 연결되어 있는지도 이해하는 '평생(lifelong)' 기억력을 줄 수 있을까? 만약 로봇이 거실에서 의자를 발견했다면, 주방에 가서 숟가락을 찾는 동안에도 그 의자를 기억해야 합니다. 또한 만약 숟가락이 위층 침실에 있다면, 로봇은 1층에서 뱅뱅 도는 대신 계단이 존재하며 어떻게 사용하는지를 알아야 합니다. 이것은 단순히 로봇에게 예의를 갖추는 문제가 아닙니다. 여러 층에서 활동이 일어나는 복잡한 다층 주택, 병원, 또는 사무실에서 실제로 도움을 줄 수 있는 기계를 만드는 것에 관한 문제입니다.

여기에 강력한 메모리를 갖춘 궁극의 가사 로봇이 되도록 설계된 새로운 프레임워크, LifelongCrossNav가 등장했습니다. 이것은 로봇에게 집 전체의 3D 모델을 주는 것과 같습니다. 이 모델은 벽, 바닥, 그리고 까다로운 계단의 기하학적 구조까지 형성하는 작은 투명 블록(복셀, voxels)들로 쌓아 올려진 형태입니다. 기존의 로봇들이 세상을 2D 종이 지도로 펼치려 했던 것과 달리, LifelongCrossNav는 진정한 3D 구조를 구축합니다. 이 로봇은 단순히 무엇이 '어디에' 있는지뿐만 아니라, 그것이 어떻게 '지지되고 있는지'도 기억합니다. 바닥이 지면에 의해 지지되기 때문에 단단하다는 것을 알지만, 공중에 떠 있는 틈은 걸을 수 없는 곳임을 압니다. 결정적으로, 이 로봇은 계단을 무서운 장애물이 아니라 서로 다른 층을 연결하는 특별한 종류의 경로로 취급합니다.

이 시스템은 마치 노트를 든 호기심 많은 탐험가처럼 작동합니다. 로봇은 움직이면서 방의 모양과 벽의 질감에 대한 세부 정보를 지속적으로 업데이트하며 3D 지도를 작성합니다. 또한 '시각-언어(vision-language)' 메모리를 사용하는데, 이는 마치 초고성능 도서관 카탈로그와 같습니다. 로봇에게 "TV를 찾아라"라고 명령하면, 단순히 상자를 찾는 것이 아니라 이전에 보았을지도 모르는 TV의 시각적 및 텍축적 단서를 자신의 메모리에서 검색합니다. 만약 이전에 거실에서 TV를 발견했다면, 그 위치를 기억합니다. 만약 다음 임무가 침대를 찾는 것이고 그 침대가 위층에 있다면, 로봇은 당황하지 않습니다. 3D 지도를 확인하여 계단을 보고, 위로 올라가는 경로를 계획합니다.

이것이 실제로 작동하는지 테스트하기 위해, 연구진은 HM3D-MFMON이라는 새로운 챌린지를 만들었습니다. 36개의 서로 다른 다층 주택이 있는 비디오 게임 레벨을 상상해 보세요. 연구진은 로봇이 특정 순서대로 세 가지 서로 다른 물건을 찾아야 하는 927개의 시나리오를 설정했습니다. 이 중 288개의 시나리오에서는 임무를 완수하기 위해 반드시 위층이나 아래층으로 이동해야만 했습니다. 즉, 한 층에서 해결할 방법이 없었습니다. 이는 층간 이동과 장기 기억 능력을 검증하기 위한 궁극의 스트레스 테스트였습니다.

결과는 명확했습니다. 평면 2D 지도를 사용하는 표준 로봇(베이스라인)과 비교했을 때, LifelongCrossNav는 전체 작업 시퀀스를 완료하는 데 훨씬 더 뛰어난 성능을 보였습니다. 평면 지도를 사용하는 로봇은 층간 이동이 필요할 때 자주 막히거나 완전히 실패했는데, 이는 펼쳐진 세상 속에서 계단을 '볼' 수 없었기 때문입니다. 반면 LifelongCrossாLifelongCrossNav는 이러한 층간 도전 과제들을 성공적으로 수행했습니다. 단순히 물건을 찾는 것에 그치지 않고, 더 효율적으로 찾아냈습니다. 이미 살펴본 곳을 기억함으로써(역사적 관심 지점, 즉 History POIs 활용), 같은 복도를 다시 걷는 것을 피하여 시간과 에너지를 절약했습니다.

이 논문은 이러한 접근 방식이 중요한 진전임을 시사합니다. 로봇에게 환경에 대한 지속적인 3D 이해력(계단의 기하학적 구조와 서로 다른 층에 있는 물건의 위치를 기억하는 능력)을 부여하는 것이 실세계의 과제를 처리하는 능력을 크게 향상시킨다는 것을 입증했습니다. 비록 로봇이 여전히 실수(예를 들어 침대를 소파로 혼동하는 등)를 하기도 하지만, 지도를 처음부터 다시 만들지 않고도 여러 층을 이동하고 과거의 발견을 기억하는 능력은 기존 방식에 비해 확실하고 측정 가능한 개선을 보여줍니다. 아직 완벽한 로봇은 아니지만, 다층 주택에서 살아가는 법을 진정으로 이해하는 첫 번째 로봇입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →