← 최신 논문
💻 computer science

AdaGeoVLN: Selective Geometry Across Representation Depth and Navigation Time for Vision-Language Navigation

AdaGeoVLN은 서로 다른 깊이의 계층적 기하학 파운데이션 모델 표현을 선택적으로 융합하고 제한된 메모리 메커니즘을 통해 내비게이션 인지적 역사적 기하학적 증거를 유지함으로써 성능을 향상시키는 스트리밍 시각-언어 내비게이션 프레임워크이다.

원저자: Quan-Dung Pham, Anh Dao, Danh Vinh Le, Nguyen Viet Tri Pham, The-Anh Nguyen, Zhirui Dai, Yiyu Chen, Tuyen P. Le, Truong Nguyen, Quan Nguyen

게시일 2026-09-17
📖 4 분 읽기☕ 가벼운 읽기

원저자: Quan-Dung Pham, Anh Dao, Danh Vinh Le, Nguyen Viet Tri Pham, The-Anh Nguyen, Zhirui Dai, Yiyu Chen, Tuyen P. Le, Truong Nguyen, Quan Nguyen

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

한 로봇이 한 번도 본 적 없는 집 안에서 구두로 전달된 일련의 지시 사항을 따라가려고 노력하는 모습을 상상해 보십시오. 성공하기 위해서, 로봇은 단순히 의자가 의자라는 것, 혹은 문이 문이라는 것을 인식하는 것 이상의 것을 이해해야 합니다. 로봇은 사물들이 공간 속에서 서로 어떻게 연관되어 있는지, 자신의 관점이 이동함에 따라 어떻게 변하는지, 그리고 자신이 걷고 있는 경로가 듣고 있는 지시 사항과 어떻게 연결되는지를 이해해야 합니다. 시각-언어 내비게이션(vision-language navigation)이라고 알려진 이 과제는, 에이전트가 오직 카메라와 음성 명령만을 사용하여 세상에 대한 정신적 지도를 실시간으로 구축할 것을 요구합니다. 수년간 연구자들은 방대한 양의 시각 데이터를 기계에 입력함으로써 이 기술을 가르치려 노력해 왔지만, 한 가지 중요한 질문은 해결되지 않은 채로 남아 있었습니다. 즉, 현대의 AI 모델이 보유한 깊고 층층이 쌓인 기하학적 이해를 로봇이 어떻게 활용해야 하며, 미래에 좋은 결정을 내리기 위해 과거의 어느 정도까지를 기억해야 하는가 하는 점입니다.

연구팀은 로봇이 세상을 바라보는 방식과 기억을 저장하는 방식을 바꿈으로써 이 질문들에 답하는 'AdaGeoVLвL'이라는 새로운 시스템을 선보였습니다. 이 시스템은 주변 환경에 대한 단 하나의 최종 스냅샷에 의존하는 대신, 자신의 사고 과정 중 여러 단계에서 유용한 기하학적 정보를 끌어내는 법을 배웁니다. 또한, 이 시스템은 자신이 본 모든 프레임을 전부 기억하려고 하여 메모리를 빠르게 과부하시키지 않습니다. 대신, 로봇은 자신이 어디에 있는지, 그리고 다음에 어디로 가야 하는지를 이해하는 데 도움이 되는 가장 중요한 역사적 순간들만을 선별하여 보관하는 세심한 기록 보관소처럼 행동합니다. 이러한 접근 방식 덕분에 로봇은 깊이 카메라나 미리 만들어진 지도와 같은 추가적인 센서 없이도, 표준 비디오 피드만을 사용하여 복잡하고 미지의 환경을 탐색할 수 있습니다.

이 새로운 방법의 핵심은 로봇이 시각 정보를 처리하는 방식에 있습니다. 기하학을 이해하는 현대 인공지능 모델은 깊은 층 구조로 이루어져 있으며, 각 층은 이미지를 조금씩 다르게 처리합니다. 초기 층은 단순한 모양과 가장자리를 포착할 수 있고, 더 깊은 층은 복잡한 구조와 공간적 관계를 이해합니다. 기존 시스템들은 대개 이러한 초기 층들을 무시하고, 프로세스의 맨 마지막 단계에서 단 하나의 최종적인 장면 요약본만을 사용했습니다. 연구자들은 이것이 실수였다는 것을 발견했습니다. 로봇의 의사 결정 단계를 기하학 모델의 여러 층과 동시에 연결함으로써(초기, 중간, 후기 단계를 동시에 사용), 로봇은 주변 환경에 대해 훨씬 더 풍부한 이해를 얻을 수 있었습니다. 이러한 다층적 접근 방식은 단순히 최종 요약본을 반복적으로 주입하는 것보다 훨씬 더 효과적이었으며, 이는 로봇이 동시에 서로 다른 '렌즈'를 통해 세상을 보는 것이 유익하다는 점을 시사합니다.

두 번째 주요 혁신은 메모리 문제를 다룹니다. 로봇이 집 안을 걸어갈 때, 로봇은 연속적인 시각 데이터의 흐름을 생성합니다. 이 모든 데이터를 모두 저장하는 것은 특히 긴 여정의 경우 불가능한 양의 메모리를 요구할 것입니다. 기존 방식들은 대개 가장 최근의 프레임이나 정해진 수의 과거 뷰를 유지하며, 방금 전의 일이 가장 중요할 것이라고 가정했습니다. 그러나 연구자들은 특정 랜드마크가 지시 사항에 언급되었거나, 경로의 독특한 회전 구간을 보여주는 경우라면 오래된 뷰가 매우 중요할 수 있다는 점을 깨달았습니다. AdaGeoVLN은 세 가지 특정 기준, 즉 해당 기억이 현재 지시 사항과 얼마나 관련이 있는지, 로봇이 그 뷰의 기하학적 세부 사항에 대해 얼마나 확신하는지, 그리고 그 뷰가 이전에 본 것들과 얼마나 다른지를 바탕으로 어떤 기억을 유지할지 선택함으로써 이 문제를 해결합니다. 이를 통해 로봇은 중복된 정보는 버리면서도, 나중에 탐색하는 데 도움이 될 구체적인 순간들을 붙잡아 둘 수 있습니다.

이 아이디어들을 테스트하기 위해, 연구진은 수천 개의 시뮬레이션 내비게이션 과제를 통해 시스템을 학습시킨 후, 과학계에서 사용하는 두 가지 표준 벤치마크를 통해 평가했습니다. 결과에 따르면, 이 새로운 시스템은 이전의 방식들을 크게 능가했습니다. 한 테스트 세트에서 이 시스템은 목적지에 55.7%의 확률로 도달했는데, 이는 외부 데이터를 사용하지 않는 기존의 최고 시스템들보다 눈에 띄는 개선입니다. 더 중요한 점은, 이 시스템이 방대한 양의 이력을 저장하려고 시도했던 다른 방식들보다 훨씬 적은 컴퓨터 메모리를 사용하면서도 이 높은 수준의 성능을 달성했다는 것입니다. 연구진은 무엇을 기억할지 선택적으로 결정함으로써, 로봇이 불필요한 데이터에 발목 잡히지 않고도 공간 인지 능력을 유지할 수 있음을 입증했습니다.

연구팀은 컴퓨터 시뮬레이션에서 멈추지 않았습니다. 그들은 학습된 정책을 표준 카메라가 장착된 인간 크기의 실제 로봇에 배치했습니다. 실제 환경 실험에서, 로봇은 벽난로에서 멀어지고, 곡선형 계단을 오르고, 특정 문 앞에서 멈추는 것과 같은 다단계 지시 사항을 성공적으로 수행했습니다. 로봇은 식물을 올바른 쪽으로 지나치고 관련 없는 문들을 피하며 성공적으로 이동했는데, 이는 선택적 메모리와 다층적 기하학적 추론이 가상 세계뿐만 아니라 물리적 세계에서도 작동한다는 것을 증명했습니다. 연구진은 이 시스템이 매우 효과적이지만, 서로 다른 메모리 신호들의 균형을 맞추는 방식을 정교화할 여지가 여전히 남아 있다고 언급했습니다. 하지만 다양한 깊이와 시간의 기하학을 선택하는 근본적인 접근 방식은 기계에게 세상을 움직이는 법을 가르치는 강력한 방법임이 입증되었습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →