← 최신 논문
💻 computer science

MUSE: Multimodal Uncertainty Quantification of State Estimation

본 논문은 비전-관성 상태 추정에서 다중 모달 불확실성을 효과적으로 정량화하기 위해 Mamba 아키텍처를 활용하는 새로운 실시간 학습 기반 프레임워크인 MUSE 를 소개하며, 이는 기존 방법들보다 뛰어난 신뢰성과 강건성을 입증합니다.

원저자: Minkyung Kim, Henry Che, Bhargav Chandaka, Bhumsitt Pramuanpornsatid, Chengyu Yang, Sheng Cheng, Xiaofeng Wang, Naira Hovakimyan, Shenlong Wang

게시일 2026-05-19
📖 3 분 읽기☕ 가벼운 읽기

원저자: Minkyung Kim, Henry Che, Bhargav Chandaka, Bhumsitt Pramuanpornsatid, Chengyu Yang, Sheng Cheng, Xiaofeng Wang, Naira Hovakimyan, Shenlong Wang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. ✨ 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

두꺼운 안개 속에서 자동차를 운전한다고 상상해 보세요. 바로 앞의 도로만 보일 뿐, 더 멀리 바라보면 모든 것이 흐릿해집니다. GPS 가 있지만 약간 오작동을 일으키고 있죠. 움직이고 있다는 건 알지만, 정확히 어디에 있고 얼마나 빠르게 가고 있는지는 100% 확신할 수 없습니다.

로봇과 자율주행차의 세계에서는 이를 **상태 추정 (State Estimation)**이라고 부릅니다. 이는 로봇이 자신의 위치와 방향을 파악하는 방식입니다. 수년 동안 로봇은 카메라와 모션 센서를 이용해 위치를 추정하는 데 매우 능숙해졌습니다. 하지만 큰 문제가 하나 있습니다: 그들은 자신이 틀렸을 때를 모릅니다.

아마도 자신이 올바른 위치에 있을 확률이 99% 일지라도, 실제로는 100% 틀렸다면 충돌할 수 있습니다. 그들은 "꽤 확신한다"거나 "전혀 모르니 조심해 달라"고 말할 수 있는 방법이 필요합니다.

문제: "과신하는" 로봇

현재의 로봇은 시험을 치르고 한 문제를 틀렸음에도 여전히 자신 있게 'A'를 표시하는 학생과 같습니다.

  • **시각 오도메트리 (Visual Odometry, VO)**는 로봇이 사진을 보고 자신의 위치를 추정하는 것과 같습니다.
  • **관성 오도메트리 (Inertial Odometry)**는 로봇이 자신의 움직임을 느끼는 것과 같습니다 (예를 들어 빙글빙글 돌고 난 후 사람이 어지러움을 느끼는 것처럼).

이 두 가지가 불일치하거나, 카메라가 렌즈의 얼룩처럼 흐릿한 이미지를 포착하거나 모션 센서가 작동하지 않을 때, 로봇은 보통 추정을 계속합니다. 조건이 변했다는 사실을 깨닫지 못합니다. 로봇은 자신의 추정을 얼마나 신뢰해야 하는지 측정하는 불확실성 정량화 (Uncertainty Quantification) 능력이 부족합니다.

해결책: MUSE(로봇의 "두 번째 의견")

이 논문의 저자들은 MUSE(Multimodal Uncertainty Quantification of State Estimation, 상태 추정의 다중 모달 불확실성 정량화) 라는 새로운 시스템을 개발했습니다.

MUSE 를 로봇의 주요 항법 시스템 옆에 앉은 초지능 조종사로 생각하세요.

  1. 모든 것을 감시합니다: 로봇의 주요 시스템이 카메라만 본다면, MUSE 는 한 번에 모든 것을 봅니다. 카메라 이미지, 모션 센서 (IMU), 그리고 로봇의 자체 속도계 데이터 말입니다.
  2. 문제를 포착합니다: 카메라가 렌즈의 얼룩처럼 흐릿한 이미지를 보지만 모션 센서가 "hey, 우리는 방금 멈췄어"라고 말한다면, MUSE 는 이 충돌을 알아차립니다. 마치 증인의 진술이 물리적 증거와 맞지 않는 것을 탐정이 알아채는 것과 같습니다.
  3. 신뢰도 점수를 제공합니다: 단순히 위치만 알려주는 대신, MUSE 는 "여기가 당신의 위치이며, 그리고 이 숫자를 얼마나 신뢰해야 하는지 보여주는 '신뢰도 미터'가 여기 있습니다"라고 말합니다.
  4. 실수를 수정합니다: 로봇이 진로에서 벗어나고 있다면, MUSE 는 단순히 경고만 하는 것이 아니라 로봇의 위치를 올바른 곳으로 실제로 밀어붙여 수정합니다.

작동 원리: "맘바 (Mamba)" 뇌

이를 실시간으로 수행하기 위해 (로봇의 속도를 늦추지 않고) MUSE 는 Mamba라는 특수한 유형의 AI 뇌를 사용합니다.

  • 옛 방식 (Transformer): 한 문장을 떠올릴 때마다 전체 책을 읽으며 긴 이야기를 기억하려고 노력한다고 상상해 보세요. 정확하지만 매우 느리고 무겁습니다.
  • 맘바 방식: MUSE 는 긴 책장 사이를 즉시 스캔하여 중요한 부분은 기억하고 관련 없는 부분은 잊어버리는 사서와 같습니다. 드론의 비디오 피드와 같은 긴 데이터 스트림을 처리하는 데 놀라울 정도로 빠르고 효율적입니다.

이를 통해 MUSE 는 시간의 흐름에 따른 일련의 사건들을 볼 수 있습니다. "5 초 전에는 카메라가 정상적이었지만, 2 초 전에는 IMU 센서가 작동하지 않았고 지금은 이미지가 흐릿합니다. 따라서 현재 위치에 대한 내 신뢰도는 하락해야 합니다"라고 말할 수 있습니다.

결과: 더 나은 항법자

연구진은 MUSE 를 두 가지 유형의 데이터로 테스트했습니다.

  1. 표준 테스트: 로봇이 실내 경기장에서 비행하는 공개 데이터셋 사용.
  2. 하드 모드: 갑작스러운 움직임, 조명 변화, 센서 앞을 걷는 사람들 등 까다로운 상황을 포함한 자체 신데이터셋인 UnCal-Flight 사용.

결과는 명확했습니다:

  • 더 나은 정확도: MUSE 는 특히 로봇이 혼란스러울 때 이전 방법들보다 로봇의 위치를 더 잘 보정했습니다.
  • 정직한 신뢰도: 로봇이 까다로운 상황 (예: 흐릿한 이미지) 에 처했을 때, MUSE 는 신뢰도 점수를 올바르게 낮췄습니다. 다른 방법들은 틀렸을 때도 여전히 과신했습니다.
  • 속도: 슈퍼컴퓨터가 필요 없이 기존 로봇 시스템에 "플러그인"으로 사용될 만큼 충분히 빠르게 실행됩니다.

결론

MUSE 는 로봇에게 자신의 항법에 대한 "직감"을 부여하는 것과 같습니다. 이는 로봇의 모든 감각을 결합하여 문제가 발생했을 때를 감지하고, 로봇의 경로를 수정하며, 로봇이 언제 걱정해야 하는지 정직하게 알려줍니다. 이는 로봇을 특히 혼란스럽고 예측 불가능한 현실 세계에서 더 안전하고 신뢰할 수 있게 만듭니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →