← 최신 논문
🤖 AI

Visual Navigation Transformer with Pose Attention

이 논문은 카메라 포즈를 깊이 키프레임을 인덱싱하기 위한 위치 인코딩으로 사용하여 서로 다른 궤적 전반에 걸쳐 공간적 경험의 효율적인 재사용을 가능하게 함으로써, 장기 지점 목표 내비게이션(long-horizon point-goal navigation)에서 최첨단 성능을 달성하는 트랜스포머 기반 내비게이션 플래너인 VNT-PA를 제안한다.

원저자: Beiming Li, Jaime Romero, Jonathan Diller, Vijay Kumar, Alejandro Ribeiro

게시일 2026-09-21
📖 4 분 읽기☕ 가벼운 읽기

원저자: Beiming Li, Jaime Romero, Jonathan Diller, Vijay Kumar, Alejandro Ribeiro

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

세상을 움직이는 로봇들은 근본적인 기억 문제에 직면합니다. A 지점에서 B 지점으로 이동하기 위해서 기계는 자신이 무엇을 보았는지 기억해야 할 뿐만 아니라, 그 기억들이 공간의 어디에 속하는지도 알아야 합니다. 전통적인 내비게이션 시스템은 로봇의 여정을 마치 비디오 테이프처럼 처리하여, 관찰된 내용을 발생한 순서 그대로 저장합니다. 이는 단 한 번의 여행에는 잘 작동하지만, 로봇이 과거의 경험을 재사용하려고 할 때 문제를 일으킵니다. 만약 로봇이 오늘 복도를 방문하고 일주일 뒤에 다시 돌아온다면, 비디오 방식의 기억은 이 두 번의 방문을 하나의 일관된 지도로 병합하는 데 어려움을 겪습니다. 어제 본 문이 오늘 본 문과 동일하다는 것을, 혹은 다른 순서로 했던 회전이 결국 같은 목적지로 이어진다는 것을 쉽게 파악하지 못하는 것입니다. 이를 해결하기 위해 엔지니어들은 종로가 움직이기 전에 격자나 그래프를 그려 세상의 명시적인 지도를 구축해 왔습니다. 그러나 이러한 지도들은 제작 과정이 복잡하며, 로봇의 센서가 아주 조금만 어긋나도 무너질 수 있습니다. 질문은 이것입니다: 로봇이 지도를 먼저 그릴 필요 없이, 단순히 무언가를 보았을 때 그곳이 어디였는지를 기억하는 것만으로 항해하는 법을 배울 수 있을까요?

펜실베이니아 대학교의 연구진은 '포즈 어텐션(Pose Attention)을 결합한 비주얼 내비게이션 트랜스포머(Visual Navigation Transformer)'라고 부르는, 로봇이 공간을 생각하는 새로운 방식을 개발했습니다. 이들은 로봇의 기억을 시간순이 아닌 위치순으로 정리합니다. 집 안을 산책하며 찍은 사진 모음을 상상해 보십시오. 표준적인 방식에서는 이 사진들을 찍힌 순서대로 더미로 쌓아둡니다. 하지만 이 새로운 시스템에서는 모든 사진에 촬영 당시의 카메라 위치와 각도가 태그로 붙습니다. 로봇은 사진 더미를 순서대로 보는 것이 아니라, 전체 컬렉션을 통틀어 "지금 나는 어디에 있고, 목표는 어디인가?"라고 묻습니다. 그런 다음 시스템은 모든 저장된 사진을 검색하여 현재 상황과 공간적으로 관련이 있는 사진들을 찾아내며, 언제 찍혔는지는 무시합니다. 이를 통해 로봇은 서로 다른 여행에서 얻은 기억들을 하나의 유연한 환경 이해로 융합할 수 있습니다.

연구진은 실제 건물의 3D 스캔 데이터를 포함하고 있는 Habitat-Matterport 3D 데이터셋을 사용하여 컴퓨터 시뮬레이션에서 이 아이디어를 테스트했습니다. 그들은 로봇에게 건물의 초기 탐사 중에 수집된 깊이 이미지(물체와의 거리를 포착하는 시각 데이터) 세트를 제공했습니다. 이 이미지들은 중복되는 벽의 모습이 아닌, 방의 새로운 부분을 보여주는 가장 유용한 스냅샷인 '키프레임(keyframes)'으로 필터링되었습니다. 로봇은 저장된 이미지들과 현재 위치만을 사용하여 임의의 위치에서 시작해 특정 목표 지점을 찾는 과제를 부여받았습니다. 로봇은 미리 만들어진 지도나 현재 움직임의 비디오 스트림에 의존하지 않았습니다. 대신, 정보의 중요도를 가중치로 결정하도록 설계된 인공지능의 일종인 트랜스포머를 사용했습니다. 이 경우, 트랜스포머는 카메라의 위치와 각도를 가이드로 삼아 어떤 기억에 주의를 기울일지 결정했습니다.

결과는 이 접근 방식이 매우 효과적임을 보여주었습니다. 일련의 테스트에서 로봇은 목표에 도달하는 데 93.3%의 성공률을 보였으며, 이는 동일한 기억을 시간 순서대로 취급했던 다른 방법들보다 크게 향상된 수치입니다. 목표가 멀리 있거나 길고 구불구불한 경로를 거쳐야 할 때도, 새로운 시스템은 높은 정확도를 유지한 반면, 다른 시스템들은 길을 잃거나 비효율적인 경로를 택하곤 했습니다. 연구진은 이 성공의 핵심이 로봇이 기억을 연결하는 방식에 있다는 것을 발견했습니다. 현재 위치와 저장된 이미지 사이의 시간 간격이 아니라 위치 차이에 집중함으로써, 로봇은 방의 기하학적 구조를 더 효과적으로 추론할 수 있었습니다. 로봇은 지금 하는 회전이 건물의 다른 부분에서 했던 회전과 관련이 있다는 것을, 단지 두 지점 사이의 공간적 관계가 일치한다는 이유만으로 인식하는 법을 배웠습니다.

가장 놀라운 발견 중 하나는 시스템이 자신의 위치 감각에 발생하는 오류를 얼마나 잘 처리하는가였습니다. 현실 세계에서 로봇은 종종 불완전한 센서를 가지고 있어 자신의 위치를 밀리미터 단위까지 정확히 알지 못할 수 있습니다. 연구진이 이러한 오류를 시뮬레이션하기 위해 노이즈를 도입했을 때, 새로운 시스템은 성능 저하가 미미할 정도로 견고함을 유지했습니다. 반면, 동일한 데이터로부터 경직된 지도를 구축하는 전통적인 시스템은 급격히 실패했습니다. 노이즈가 섞인 위치 데이터가 벽을 엉뚱한 곳에 배치하면서, 열린 복도를 막힌 벽으로 오인했기 때문입니다. 위치 기반의 유연한 기억 세트로 환경을 다루는 새로운 시스템은 이러한 부정확성을 견뎌내며 무너지지 않았습니다. 시스템은 세상의 단 하나의 완벽한 격자에 매몰될 필요 없이, 자신이 어디에 있다고 생각하는지에 따라 기억을 조회하며 이동하면서 경로를 조정할 수 있었습니다.

또한 연구진은 시스템이 초기 탐사 이상의 것에서도 학습할 수 있다는 것을 발견했습니다. 만약 로봇이 여정 중에 방의 새로운 각도를 마주하거나 이전에 보지 못한 구역을 발견한다면, 재학습 없이도 즉시 그 새로운 뷰를 자신의 기억 세트에 추가할 수 있습니다. 이는 로봇이 서로 다른 경로에서의 관찰을 사용하여 빈틈을 메움으로써, 현장에서 더 풍부한 환경 이해를 구축할 수 있음을 의미합니다. 시스템은 건물 내의 완벽한 경로를 알고 있는 전문가 플래너를 모방하도록 훈련되었으며, 주변의 공간적 맥락을 살펴 다음 움직임을 예측하는 법을 배웠습니다. 로봇은 결정을 내리기 위해 현재의 뷰를 볼 필요가 없었습니다. 단지 자신이 어디에 있는지, 그리고 어디로 가고 싶은지만 알면 되었고, 그 후 관련 있는 기억을 불러오면 되었습니다.

이 연구는 로봇이 복잡하고 변화하는 환경을 항해하기 위해 반드시 정적인 지도를 구축할 필요는 없다는 점을 시사합니다. 대신, 로봇은 발생한 위치에 따라 색인화된 역동적인 경험의 집합에 의존할 수 있습니다. 이 연구는 기억을 시간이 아닌 위치 중심으로 조직하는 것이 더 빠른 학습과 어려운 장기 과제 수행을 가능하게 한다는 것을 입증했습니다. 실험은 시뮬레이션에서 수행되었지만, 그 원리는 물리적 세계에 적용되는 기하학적 추론에 기반합니다. 연구진은 현재 시스템이 로봇이 평평한 바닥 위를 움직인다고 가정하여 2차원으로 작동하지만, 근본적인 방법론은 3차원 움직임으로 확장될 수 있다고 언급했습니다. 로봇이 포즈가 기록된 기억 세트만을 사용하여 효과적으로 항해할 수 있음을 보여줌으로써, 이 연구는 기계가 인간이 가진 것과 같은 유연성과 적응력을 가지고 세상을 움직일 수 있는 새로운 길을 제시합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →