← 최신 논문
💻 computer science

Beyond Transformers: Linear Attention Policy for Open-Vocabulary Object Goal Navigation

이 논문은 기존의 트랜스포머 기반 셀프 어텐션을 구조화된 선형 어텐션 메커니즘, 구체적으로는 가중 상태 확장 선형 어텐션(WSLA)으로 강화된 방식으로 대체하여, 기존 베이스라인 모델들과 비교해 우수한 오픈 보캐블러리 객체 목표 내비게이션 성능, 계산 효율성 및 견고한 심투리얼(sim-to-real) 전이 능력을 달성하는 내비게이션 정책인 LANav을 소개한다.

원저자: Jiahong Zhang, Yifan Lin, Yandong Zhang, Sijun Shen, Kexin Wang, Yuqi Pan, Hongjuan Pei, Wei Wang, Guoqi Li

게시일 2026-07-22
📖 6 분 읽기🧠 심층 분석

원저자: Jiahong Zhang, Yifan Lin, Yandong Zhang, Sijun Shen, Kexin Wang, Yuqi Pan, Hongjuan Pei, Wei Wang, Guoqi Li

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. ✨ 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 한 번도 본 적 없는 집 안에서 "빈티지 토스터기"와 같은 특정 물체를 찾으려고 노력하고 있다고 상상해 보세요. 당신은 오직 좁은 창문을 통해 바로 앞에 보이는 것만 볼 수 있으며, 다음 움직임을 결정하기 위해 자신이 어디를 지나왔는지, 무엇을 보았는지, 그리고 무엇을 찾고 있는지를 기억해야 합니다. 이것이 바로 로봇이 세상을 항해하는 일상이며, **체화된 AI(Embodied AI)**라고 불리는 과학 분야입니다. 이를 위해 로봇은 일종의 단기 기억 역할을 하는 "두뇌"(정책 네트워크)를 사용하며, 새로운 시각 및 청각 정보에 따라 내부 상태를 끊임없이 업데이트합니다. 오랫동안 과학자들은 이 기억을 구축하기 위해 두 가지 주요 방식을 시도했습니다. 하나는 역사를 하나의 작아지는 요약본으로 압축하는 방식(옛날 방식의 공책처럼)이고, 다른 하나는 최근에 본 모든 것을 긴 목록으로 유지하며 연결 고리를 찾기 위해 매번 전체 목록을 다시 읽는 방식(매우 조직적이지만 느린 사서처럼)입니다. 큰 질문은 이것이었습니다: 만약 로봇이 찾는 물체의 이름이 아주 특이하거나 완전히 새로운 집에 있을 때, 어떤 방법이 로봇이 길을 찾는 데 가장 도움이 될 것인가?

이 논문은 LANav(Linear Attention-based Navigation)라고 불리는 새로운 접근 방식과 WSLA라는 특별한 업그레이드를 소개합니다. 연구진은 최첨단 기술이라고 생각되었던 "슈퍼 사서" 방식(Self-attention을 사용하는 Transformer)이 로봇이 긴 여정을 기억해야 할 때 한계에 부딪힌다는 사실을 발견했습니다. 놀랍게도, 로봇에게 더 긴 역사를 보여주는 것이 Transformer의 성능을 향상시키지 못했습니다. 오히려 때로는 더 나빠지기도 했습니다. 대신, 연구팀은 **선형 주의 집중(Linear Attention)**이라는 방법이 훨씬 더 잘 작동한다는 것을 발견했습니다. 이 방법은 전체 목록을 다시 읽는 대신, 마치 일정한 흐름을 가진 구조적인 스트림처럼 기억을 업데이트합니다. 그들은 이 아이디어를 WSLA로 강화하여, 기억을 여러 개의 "하위 스트림"으로 나누고 각 스트림에 얼마만큼의 가중치를 줄지 학습하게 했습니다. 테스트 결과, 이 새로운 시스템은 도전적인 시뮬레이션에서 36.4%의 확률로 물체를 찾아내며, 기존의 최고 Transformer 모델들을 확실한 차이로 앞질렀습니다. 더욱 멋진 점은, 이를 실제 방 안에 있는 로봇 개에 적용했을 때 82%의 성공률을 기록하며, 이 "스트리밍 기억" 아이디어가 컴퓨터 속에서뿐만 아니라 실제 세상에서도 작동함을 증명했다는 것입니다.

문제점: 로봇의 기억 위기

당신이 "파란 의자"를 찾기 위해 거대하고 낯선 미로를 걷고 있다고 상상해 보세요. 당신은 몇 걸음 앞만 볼 수 있습니다. 코너를 돌 때마다 새로운 것을 보지만, 동시에 10초 전에 무엇을 보았는지 잊어버립니다. 의자를 찾기 위해 당신의 뇌는 "빨간 문을 지나왔다", "팬 소리를 들었다", "왼쪽으로 두 번 돌았다"와 같은 단서들을 붙잡고 있어야 합니다.

수년간 로봇 과학자들은 두 가지 주요 유형의 기억으로 이 문제를 해결하려 했습니다:

  1. 압축기 (RNNs): 이들은 로봇이 자신의 과거 기억을 하나의 작고 밀도 높은 공으로 찌그러뜨리는 것과 같습니다. 빠르긴 하지만, 여정이 길어질수록 공은 너무 작고 엉망이 되어 로봇은 중요한 세부 사항을 잊어버리게 됩니다.
  2. 재독자 (Transformers): 이들은 로봇이 자신이 본 모든 것을 담은 완벽하고 긴 두루마리를 가지고 있는 것과 같습니다. 다음 행선지를 결정할 때마다, 로봇은 연결 고리를 찾기 위해 시작부터 끝까지 전체 두루마리를 다시 읽습니다. 강력하지만, 두루마리가 너무 길어지면 느려지고 지저져집니다.

연구진은 다음과 같이 물었습니다: "만약 우리가 로봇에게 더 긴 두루마리(더 긴 역사)를 준다면, 물체를 더 잘 찾게 될까?" 그들은 Open-Vocabulary Object Goal Navigation이라는 작업(단순히 '냄비' 대신 '국물을 담는 것'처럼 들어본 적 없는 이상한 이름을 사용하더라도 설명된 물체를 찾는 방식)을 통해 Transformer 방식(Re-reader)을 테스트했습니다.

놀라운 사실: 더 많은 역사가 도움이 되지 않았다

연구팀은 일련의 통제된 실험을 수행했습니다. 로봇의 눈, 지도, 훈련 규칙 등 모든 것을 동일하게 유지하고 오직 기억 시스템만을 변경했습니다. 그들은 Transformer 로봇에게 더 긴 두를마리를 제공하면 물체를 더 자주 찾을 것이라고 예상했습니다.

하지만 반전이 있었습니다: 작동하지 않았습니다.

Transformer가 볼 수 있는 역사의 길이를 늘렸음에도 불구하고, 로봇의 성능은 향상되지 않았습니다. 사실, 어떤 경우에는 오히려 약간 더 나빠지기도 했습니다. 마치 로봇이 자신의 기억 속에 빠져 허우적거리며, 긴 두루마리의 어느 부분이 실제로 중요한지 파악하지 못하는 것 같았습니다. "재독자" 방식은 한계에 부딪힌 듯 보였습니다. 미로를 헤매는 로봇에게, 매번 전체 역사를 다시 읽는 것은 상태를 업데이트하는 데 최선의 방법이 아니라는 것이 밝혀졌습니다.

해결책: "스트리밍" 기억

연구진은 다른 접근 방식을 시도했습니다: 선형 주의 집중(Linear Attention). 전체 두루마리를 다시 읽는 대신, 로봇이 "스트리밍 기억"을 갖는 것을 상상해 보세요. 로봇이 걸을 때, 마치 흐르는 강물처럼 단계별로 내부 상태를 업데이트합니다. 전체 강을 다시 보는 것이 아니라, 새로운 비(새로운 관찰)와 현재의 흐름에 따라 수위를 업데이트하는 것입니다.

그들은 이 스트리밍 방식을 사용하여 LANav라는 시스템을 구축했습니다. 결과는 즉각적이고 인상적이었습니다.

  • 기존 방식보다 우수함: LANav는 "압축기"(RNN)와 "재독자"(Transformer) 모델을 모두 이겼습니다.
  • 길수록 좋다: Transformer와 달리, LANav 로봇에게 학습할 수 있는 더 긴 역사를 제공했을 때 로봇은 실제로 더 똑똑해졌습니다. 학습 역사가 길어질수록 로봇은 더 영리해졌습니다.

업그레이드: WSLA (다중 스트림 브레인)

연구진은 거기서 멈추지 않았습니다. 그들은 스트리밍 기억조차 개선될 수 있다는 것을 깨달았습니다. 그들은 다음과 같이 질문했습니다: "만약 우리 로봇이 단 하나의 스트림이 아니라 여러 개의 스트림을 가지고, 어떤 스트림에 귀를 기울일지 학습할 수 있다면 어떨까?"

그들은 WSLA(Weighted State-Expansion Linear Attention)를 만들었습니다.

  • 비유: 로봇의 뇌가 하나의 스트림 대신 네 개의 서로 다른 "노트북"(하위 상태)을 가지고 있다고 상상해 보세요. 하나는 색상을 추적하고, 다른 하나는 모양을, 또 다른 하나는 회전을, 마지막 하나는 소리를 추적합니다.
  • 마법: 특별한 "지휘자"(학습 가능한 가중치)가 매 순간 각 노트북에 얼마나 귀를 기울일지 결정합니다. 만약 로봇이 "빨간 상자"를 찾고 있다면, 지휘자는 "색상" 노트북의 볼륨을 높이고 "소리" 노트북의 볼륨을 낮출 것입니다.

이 WSLA 시스템은 챔피언이 되었습니다.

  • HM3D-OVON 시뮬레이션(거대하고 현실적인 3D 집 데이터셋)에서 WSLA 로봇은 **36.4%**의 성공률을 달ach했습니다.
  • 최고의 Transformer 모델은 **30.1%**를 기록했습니다.
  • 이는 6.3 퍼센트 포인트의 향상이며, 이 분야에서는 매우 큰 차이입니다.

왜 중요한가: 거리와 실제 세계

연구진은 또한 로봇이 어떻게 항해하는지도 살펴보았습니다. 그들은 새 시스템이 특히 긴 여정에서 뛰어나다는 것을 발견했습니다.

  • 짧은 여행: 두 로봇 모두 괜찮은 성적을 냈습니다.
  • 긴 여행: Transformer 로봇은 종종 길을 잃거나 일찍 포기했습니다. 반면 WSLA 로봇은 침착함을 유지했습니다. WSLA 로봇은 15미터 이상의 거리에서도 **14.36%**의 성공률을 기록하며 성공적으로 항해했지만, Transformer는 **6.68%**에 그쳤습니다.

하지만 진짜 테스트는 컴퓨터 밖 실제 세상으로 나가는 것이었습니다. 팀은 LANav 시스템을 Unitree Go2 로봇(실제 물리적 로봇 개)에 탑재했습니다. 그들은 실제 방 안에서 쓰레기통, 식물, 또는 의자를 찾도록 명령했습니다.

  • 그들은 50회의 실험을 진행했습니다.
  • 로봇은 41회 성공했습니다.
  • 그것은 실제 세상에서 82%의 성공률을 보여주었습니다!

이는 "스트리밍 기억" 아이디어가 단순히 멋진 컴퓨터 기술이 아니라, 실제 공간을 이동하며 실제 삶의 복잡함을 다루는 로봇에게도 실제로 작동한다는 것을 증명합니다.

핵심 요약

이 논문은 복잡하고 미지의 환경에서 길을 찾으려는 로봇에게, 기존의 "모든 것을 다시 읽는" 방식(Transformer)이 최선의 도구가 아닐 수 있음을 시示합니다. 대신, 기억을 구조화된 스트리밍 방식으로 업데이트하는 방식(Linear Attention), 특히 여러 개의 전문화된 하위 기억으로 강화된 방식(WSLA)이 훨씬 더 효과적입니다. 이 방식은 더 빠르고, 더 긴 여정에서도 더 잘 확장되며, 무엇보다도 실제 방 안의 로봇 개에 적용했을 때 실제로 작동합니다. 로봇 항해의 미래는 더 많은 역사를 기억하는 것이 아니라, 더 잘 기억하는 것에 달려 있을지도 모릅니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →