← 최신 논문
💻 computer science

FlowMo-WM: A World Model with Object Momentum and Hidden Ambient Drift

FlowMo-WM은 흐름장(flow field)에 대한 직접적인 감독 없이 이미지-행동 이력을 단기 운동 상태와 장기 문맥 표현으로 분해함으로써, 숨겨진 주변 드리프트(ambient drift)의 영향을 받는 객체에 대한 장기 예측 정확도를 향상시키는 엔드 투 엔드 학습 가능한 시각적 월드 모델이다.

원저자: Yitao Jiang, Luyang Zhao, Muhao Chen, Devin Balkcom

게시일 2026-06-15
📖 3 분 읽기☕ 가벼운 읽기

원저자: Yitao Jiang, Luyang Zhao, Muhao Chen, Devin Balkcom

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 강물에 떠내려가는 나뭇잎이 1분 뒤에 어디에 있을지 예측하려고 한다고 상상해 보세요.

단순히 나뭇잎과 당신이 밀었던 방향만 본다면, 예측은 틀릴 수도 있습니다. 왜냐하면 나뭇잎에는 관성(밀어주는 힘을 멈춘 후에도 계속 미끄러지는 성질)이 있고, 강물의 흐름(숨겨된 힘)이 나뭇잎을 옆으로 실어 나르고 있기 때문입니다. 만약 보이지 않는 흐름을 고려하지 않는다면, 당신의 예측은 경로에서 벗어나게 될 것입니다.

이것이 바로 FlowMo-WM이라는 논문이 로봇, 특히 물 위에 떠 있는 보트를 위해 해결하고자 하는 문제입니다.

문제점: "보이지 않는 손"

대부분의 로봇 학습 모델은 운전대를 보는 데만 집중하는 운전자와 같습니다. 그들은 이렇게 생각합니다: "내가 왼쪽으로 핸들을 돌렸으니, 차는 왼쪽으로 갈 거야."

하지만 현실 세계(특히 물 위)는 훨씬 더 복잡합니다. 보트는 엔진을 멈추더라도 자신의 속도(관성) 때문에 계속 앞으로 나아갈 수 있습니다. 더 심각한 것은, 숨겨진 강물의 흐름이 보트를 옆으로 밀어낼 수 있다는 점입니다. 로봇은 보트를 볼 수는 있지만, 물살(수류)은 볼 수 없습니다. 로봇은 과거에 보트가 어떻게 움직였는지를 관찰함으로써 현재의 흐름을 추측해야만 합니다.

해결책: 두 개의 뇌 시스템

저자들은 FlowMo-WM이라는 새로운 AI 모델을 구축했습니다. 하나의 뇌가 모든 것을 처리하게 하는 대신, 두 개의 특화된 "시간적 분기(temporal branches)"(시간을 바라보는 방식)를 부여했습니다.

  1. "단기" 뇌 (단거리 선수):

    • 역할: 지난 몇 초간의 영상과 동작을 살펴봅니다.
    • 학습 내용: 보트의 즉각적인 행동에 집중합니다. 속도가 붙고 있는가? 회전하고 있는가? 엔진 반응이 늦어지고 있는가? 이는 관성과 로봇 제어의 직접적인 결과를 추적합니다.
    • 비유: 이는 마치 단거리 선수가 자신의 다리와 바로 앞의 트랙을 주시하는 것과 같습니다.
  2. "장기" 뇌 (탐정):

    • 역할: 훨씬 더 긴 기록(지난 30초 이상)을 살펴봅니다.
    • 학습 내용: 제어 명령과 일치하지 않는 패턴을 찾아냅니다. 만약 엔진을 똑바로 조작했음에도 보트가 계속 왼쪽으로 밀려났다면, 이 뇌는 *"아, 우리를 왼쪽으로 밀어내는 흐름이 있구나"*라고 파악합니다. 즉, **숨겨진 표류(drift)**의 지도를 그려냅니다.
    • 비유: 이는 마치 탐정이 발자국 흔적을 보고 바람이 어느 방향으로 불었는지 알아내는 것과 같습니다. 비록 바람 자체는 볼 수 없더라도 말입니다.

마법 같은 기술: "제로 컨텍스트(Zero-Context)" 스위치

이 설계의 영리한 점은 이 두 뇌를 결합하는 방식에 있습니다. 그들은 **"제로 컨텍스트 잔차 전이(zero-context residual transition)"**라는 수학적 기법을 사용합니다.

이것은 표준 엔진과 "바람 보조" 버튼이 달린 자동차와 같습니다.

  • **표준 엔진 (단기 뇌)**은 가속 페달을 기준으로 차가 어디로 갈지 예측합니다.
  • **바람 보조 (장기 뇌)**는 바람이 차를 얼마나 밀어낼지 예측합니다.
  • 기술적 핵심: 모델은 만약 "제로 버튼"(바람 보조를 끄는 것)을 누르면, 예측이 다시 순수하게 엔진의 움직임으로 돌아가도록 훈련됩니다. 이를 통해 연구자들은 다음과 같이 테스트할 수 있습니다: "만약 바람이 존재하지 않는다고 가정한다면 어떤 일이 벌어질까?"

실험 결과, "장기 탐정"을 껐을 때 로봇의 예측이 엉망이 된다는 것을 발견했습니다. 이는 모델이 "탐정"의 역할이 숨겨진 흐름을 다루는 데 실제로 필수적임을 입증한 것입니다.

결과: 더 나은 예측, 더 나은 계획

연구팀은 다양한 종류의 보트와 까다로운 물의 흐름(소용돌이, 직선 흐름, 난류 구역 등)이 있는 컴퓨터 시뮬레이션에서 이를 테스트했습니다.

  • 정확도: 60단계 앞의 미래를 예측하라는 요청에 대해, FlowMo-WM은 다른 모델들보다 훨씬 더 정확했습니다. 보트의 속도와 숨겨진 물의 흐름을 모두 이해했기에 실수를 훨씬 적게 했습니다.
  • 계획: 이 모델을 사용하여 보트의 경로 계획(예: 특정 부두에 도달하기)을 도왔을 때, 보트는 훨씬 더 성공적이었습니다. 전류에 휩쓸려 길을 잃지 않았습니다.
  • "셔플(Shuffle)" 테스트: 그들은 심지어 모델에 잘못된 기록(한 보트의 흐름을 다른 보트의 것으로 바꾼 것)을 제공하는 실험도 했습니다. 모델은 실패했는데, 이는 모델이 단순히 짐작하는 것이 아니라 환경의 특정 조건들을 실제로 학습하고 있었음을 증명합니다.

요점

이 논문은 로봇이 바다와 같이 무질서한 실제 환경에서 잘 작동하려면, 단지 '지금 당장' 하고 있는 일만 봐서는 안 된다는 것을 보여줍니다. 로봇은 자신을 밀어내는 보이지 않는 힘(바람이나 물살 등)을 파악하기 위해 과거를 기억해야 합니다.

FlowMo-WM은 로봇에게 훌륭한 탐정이 되는 법을 가르쳐주는 도구입니다. 즉, 자신의 행동과 자연의 숨겨진 힘을 구분하여 미래를 더 정확하게 예측하도록 돕는 것입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →