← 최신 논문
🤖 AI

Learning Visual Feature-Based World Models via Residual Latent Action

본 논문은 DINO 잔차에서 학습되고 흐름 매칭을 통해 예측되는 새로운 잔차 잠재 행동 표현을 활용하여 효율적이고 고충실도 시각 특징 예측을 달성하고, 온라인 상호작용이나 수동 설계 보상 없이 오프라인 비디오로부터 고급 로봇 학습을 가능하게 하는 RLA 세계 모델을 소개합니다.

원저자: Xinyu Zhang, Zhengtong Xu, Yutian Tao, Yeping Wang, Yu She, Abdeslam Boularias

게시일 2026-05-11
📖 3 분 읽기☕ 가벼운 읽기

원저자: Xinyu Zhang, Zhengtong Xu, Yutian Tao, Yeping Wang, Yu She, Abdeslam Boularias

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

로봇에게 컵, 공, 또는 도구를 어떻게 움직여야 하는지 가르치려 한다고 상상해 보세요. 이를 위해 로봇은 "세계 모델(world model)"이 필요합니다. 이는 로봇이 특정 방식으로 팔을 움직였을 때 다음에 어떤 일이 일어날지 추측할 수 있게 해주는 정신적 시뮬레이션입니다.

오랫동안 과학자들은 다음 비디오 프레임의 정확한 픽셀을 예측함으로써 이러한 정신적 시뮬레이션을 구축하려 했습니다 (예를 들어, 모래성이 쌓이기 전에 그 모래성 속의 모든 모래 알갱이를 예측하려는 시도와 같습니다). 이는 계산량이 매우 많고 느리며, 종종 로봇이 존재하지 않는 것들을 "환각"하게 만드는 결과를 초래합니다. 예를 들어, 컵이 갑자기 고양이로 변하는 것과 같은 현상입니다.

다른 연구자들은 원시 픽셀 대신 시각적 특징(객체의 일반적인 모양과 색상 등) 을 예측하려 했습니다. 이는 더 빠르지만, 종종 "흐릿한" 예측으로 이어집니다. 안개 낀 창문을 통해 사진을 보는 것과 같습니다. 복잡한 3 차원 작업에서 이러한 예측은 때때로 완전히 붕괴되어 로봇이 사물의 위치를 잃게 만들었습니다.

이 논문은 RLA-WM(Residual Latent Action World Model, 잔여 잠재 행동 세계 모델) 이라는 새로운 솔루션을 소개합니다. 간단한 비유를 들어 그 작동 원리를 설명하겠습니다.

1. "델타" 트릭 (잔여 잠재 행동)

저자들은 로봇이 세계의 다음 전체 그림을 예측하려 노력하는 대신, "현재"와 "나중" 사이의 차이만 학습하면 된다는 사실을 깨달았습니다.

  • 비유: 영화를 보고 있다고 상상해 보세요. 다음 장면의 모든 프레임을 처음부터 암기하려 노력하는 대신, 무엇이 변했는지만 기억하면 됩니다. 공이 왼쪽으로 움직였나요? 컵이 기울었나요?
  • 혁신: 저자들은 잔여 잠재 행동 (RLA) 이라는 컴팩트한 "변화 코드"를 만들었습니다. 현재 이미지와 미래 이미지 사이의 차이를 가져와 작고 효율적인 벡터 (짧은 숫자 목록) 로 압축한 후, 이를 "행동"이라고 부릅니다.
  • 도움 되는 이유: 이는 로봇에게 전체 새로운 책 대신 "변경 로그"를 주는 것과 같습니다. 훨씬 작고 처리 속도가 빠르며, 움직임에만 집중하기 때문에 "흐릿함" 문제를 피할 수 있습니다.

2. "흐름" 기계

로봇이 이 "변화 코드"를 갖게 되면, 미래에 그 코드가 어떻게 보일지 예측해야 합니다.

  • 비유: 강을 생각해 보세요. 강이 어디로 흐르는지 알기 위해 모든 물 분자를 시뮬레이션할 필요는 없습니다. 흐름방향만 알면 됩니다.
  • 혁신: 그들은 Flow Matching(흐름 매칭) 이라는 기술을 사용합니다. 이는 로봇의 행동에 기반하여 "현재"에서 "미래"로 가는 가장 매끄러운 경로를 계산하는 GPS 와 같습니다. 거대한 비디오 공간이 아닌 작은 "변화 코드" 공간에서 이 경로를 계산하기 때문에 매우 빠르고 정확합니다.

3. 로봇을 위한 두 가지 초능력

이 논문은 이 새로운 모델이 로봇이 다음 두 가지 구체적이고 강력한 방식으로 학습하는 데 도움을 준다고 보여줍니다.

A. "침묵" 비디오로부터 학습 (행동 레이블 불필요)

  • 문제: 일반적으로 로봇을 가르치려면 정확히 어떤 버튼이 눌렸는지 (행동 레이블) 를 아는 비디오가 필요합니다. 하지만 인터넷의 대부분의 비디오 (유튜브 등) 는 로봇이 어떻게 움직였는지 알려주지 않고 단순히 움직이는 모습만 보여줍니다.
  • 해결책: RLA 모델은 침묵하는 비디오를 보고 움직임만 관찰하여 "변화 코드 (RLA)"를 파악한 후, 로봇이 그 움직임을 모방하도록 가르칠 수 있습니다. 안무가가 단계들을 알려주지 않아도 다른 사람이 춤추는 비디오를 보고 춤을 배우는 것과 같습니다.

B. "꿈" 속에서 훈련 (시각적 강화 학습)

  • 문제: 실제 세계에서 로봇을 훈련시키는 것은 느리고 위험합니다. 로봇이 컵을 떨어뜨리면, 주워서 다시 시도해야 합니다.
  • 해결책: 저자들은 로봇이 시뮬레이션 (세계 모델) 내부에서 완전히 연습하는 시스템을 구축했습니다.
    • 로봇은 작업을 "꿈꿉니다".
    • 꿈속에서 움직임을 시도합니다.
    • RLA-WM 이 결과를 즉시 예측합니다.
    • 꿈속 결과가 이전에 본 성공적인 비디오와 유사하면 로봇은 "보상"을 받습니다.
    • 로봇은 실제 물체를 만지거나 인간이 수행 결과를 수동으로 평가할 필요 없이, 머릿속에서 이를 수백만 번 반복하며 완벽한 전략을 학습합니다.

결과

이 논문은 이 방법이 다음과 같다고 주장합니다.

  1. 더 정확함: 전체 비디오나 흐릿한 특징을 생성하려 했던 이전 방법들보다 미래 상태를 더 잘 예측합니다.
  2. 훨씬 더 빠름: 거대한 비디오 파일 대신 작은 "변화 코드"로 작동하기 때문에 비디오 생성 모델보다 수배 더 빠릅니다.
  3. 더 신뢰할 수 있음: 이상한 물체들을 "환각"하지 않으며, 장면의 물리 법칙에 충실합니다.

요약하자면, 이 논문은 로봇들이 미래를 "그려내는" 것을 멈추고, 그곳에 도달하기 위해 필요한 "단계"를 단순히 계산하도록 가르쳐, 로봇이 더 빠르고, 더 지능적으로, 그리고 더 다양한 비디오로부터 학습할 수 있게 합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →