← 최신 논문
🤖 AI

Imitation from Heterogeneous Demonstrations using Grounded Latent-Action World Models

이 논문은 액션 레이블이 가변적이거나 누락된 이질적인 데이터 소스로부터 견고한 모방 학습을 가능하게 하기 위해 예측에 기반한 공유된 잠재 액션 공간(latent action space)을 학습하는 프레임워크인 Grounded Latent-Action World Models (GLAM)를 소개하며, 이는 시뮬레이션과 실제 세계의 조작 작업 모두에서 기존 베이스라인 모델들을 유의미하게 능가한다.

원저자: Tianyou Wang, Anson Lei, Joe Watson, Ingmar Posner

게시일 2026-06-23
📖 4 분 읽기☕ 가벼운 읽기

원저자: Tianyou Wang, Anson Lei, Joe Watson, Ingmar Posner

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

로봇 팔에게 컵을 집어 서랍에 넣는 법을 가르치고 싶다고 상상해 보세요. 전통적인 방식은 사람이 로봇의 팔을 수백 번 직접 움직이며 동작을 유도하는 것입니다. 이는 느리고, 비용이 많이 들며, 지루한 작업입니다.

이 논문은 더 똑똑한 방법을 제안합니다. "저렴한" 연습과 "비싼" 실제 훈련을 혼합하여 로봇이 학습하게 하는 것입니다.

다음은 이들의 솔루션인 GLAM을 쉬운 비유를 사용하여 설명한 내용입니다.

문제점: 서로 다른 언어를 말하기

당신에게 두 종류의 학습 데이터가 있다고 상상해 보세요:

  1. "골드(Gold)" 데이터: 모터가 어떻게 움직였는지 정확히 알 수 있는 실제 로봇 기록(액션 라벨 포함). 이는 매우 희귀하고 얻기 어렵습니다.
  2. "실버(Silver)" 데이터: 시뮬레이션, 사람이 물체를 움직이는 영상, 또는 다른 로봇 팔의 영상 등 다른 소스에서 가져온 방대한 양의 영상들. 이 데이터는 풍부하고 무료이지만, 모터 명령(instruction)이 없으며, 카메라 각도나 로봇의 형태가 다릅니다.

만약 이 두 가지를 그냥 섞어서 로봇을 가르치려 한다면, 로봇은 혼란에 빠질 것입니다. 이는 마치 학생에게 영어로 된 교과서와 일본어로 된 강의 영상을 번역기 없이 섞어서 가르치는 것과 같습니다. 로봇은 시뮬레이션에서의 "팔을 위로 올리는 것"이 실제 세계에서의 "팔을 위로 올리는 것"과 같은 목표라는 것을 알지 못합니다.

해결책: "만능 번역기" (GLAM)

저자들은 GLAM(Grounded Latent-Action World Model)이라는 시스템을 만들었습니다. GLAM을 "골드" 데이터와 "실버" 데이터가 모두 이해할 수 있는 비밀스럽고 추상적인 언어를 구사하는 만능 번역기라고 생각하세요.

작동 방식은 다음과 같이 두 단계로 나뉩니다.

1단계: 비밀 언어 배우기 (월드 모델)

GLAM은 로봇의 특정 모터 움직임을 맞추려고 노력하는 대신, 원인과 결과에 집중합니다.

  • 핵심 아이디어: 만약 어떤 행동(예: 블록을 미는 것)이 블록을 테이블 위로 미끄러지게 만든다면, 그 행동은 특정한 "의미"를 갖습니다. 그 밀기 동작이 사람의 손에서 왔든, 시뮬레이션에서 왔든, 혹은 다른 로봇으로부터 왔든 상관없습니다. 만약 물체에 나타난 결과가 같다면, 그 행동의 "의미"는 같습니다.
  • 메커니즘: GLAM은 공유된 "사전"(잠재 공간, latent space)을 만듭니다.
    • 먼저 "실버" 데이터(모터 명령이 없는 영상)를 보고 묻습니다: "어떤 보이지 않는 행동이 이 물체를 움직이게 했는가?" 그리고 그 답을 추측하여 비밀 언어로 기록합니다.
    • 그다음 "골드" 데이터(실제 로봇)를 보고 묻습니다: "어떤 모터 움직임이 이것을 일으켰는가?" 그리고 이를 동일한 비밀 언어로 번역합니다.
    • 마법 같은 점: 이 두 번역이 서로 일치하도록 강제합니다. 즉, 영상 속의 "밀기"와 로봇의 "밀기"가 이 비밀 언어 안에서는 정확히 같은 의미를 갖도록 보장합니다.

2단계: 로봇 가르치기 (행동 복제)

비밀 사전이 구축되면, 로봇은 훨씬 빠르게 학습할 수 있습니다.

  • 시스템은 모든 "실버" 데이터(저렴하고 풍부한 영상)를 가져와 비밀 언어를 사용하여 다시 라벨을 붙입니다. 이제 로봇은 원래의 모터 명령을 직접 보지 않고도 거대한 지침 라이브러리를 갖게 됩니다.
  • 그런 다음 로봇이 장면을 보고, 필요한 "비밀 행동"을 추측한 뒤, 그 비밀을 실제 모터 명령으로 번역하여 과업을 수행하도록 훈련시킵니다.

창의적인 비유: 댄스 강사

당신이 특정 댄스 동작을 학생(로봇)에게 가르치고 싶다고 상상해 보세요.

  • 기존 방식: 당신이 학생 옆에 서서 1,000번 동안 직접 팔다리를 움직여 줍니다. (비싸고 느림).
  • GLAM 방식: 당신은 프로 무용수들의 영상(골드 데이터)과 집, 무대, 혹은 만화 속에서 춤추는 사람들의 수천 개 영상(실버 데이터)을 가지고 있습니다.
    • 실버 데이터에는 단계별 지침은 없지만, 댄서들이 바닥과 공기에 무엇을 하고 있는지는 볼 수 있습니다.
    • GLAM은 댄서의 신발이나 방의 크기를 무시하는 안무가 역할을 합니다. 대신, 리듬과 흐름에 집중합니다.
    • GLAM은 프로가 스튜디오에서 하든 아이가 거실에서 하든, "박자에 맞춰 앞으로 발을 내딛는 것"은 동일한 개념이라는 것을 깨닫습니다.
    • 그리고 "리듬 코드"를 만들어냅니다.
    • 이제 학생은 이 모든 영상을 보면서 "리듬 코드"를 이해하고, 그것을 자신의 몸에 적용하는 법을 배웁니다. 학생은 단지 몇 개의 예시가 아니라 수천 개의 예시에 접근할 수 있었기에 훨씬 빠르게 춤을 배울 수 있습니다.

연구 결과

연구진은 다섯 가지 작업(블록 쌓기나 병 쓰러뜨리기 등)에 대해 컴퓨터 시뮬레이션과 실제 환경에서 테스트를 진행했습니다.

  • 결과: GLAM으로 훈련된 로봇은 값비싼 "골드" 데이터로만 훈련된 로봇보다 현저히 뛰어난 성능을 보였습니다.
  • 이득: 어려운 작업의 경우, GLAM 방식은 표준 방식에 비해 성공률을 거의 50% 가까이 향상시켰습니다.
  • "오브젝트 마스크(Object Mask)" 기술: 연구진은 AI에게 배경과 로봇의 몸을 무시하고 오직 움직이는 물체에만 집중하라고 지시했을 때 학습이 더욱 정확해진다는 것을 발견했습니다. 이는 마치 학생에게 "방은 신경 쓰지 말고, 공만 봐"라고 말하는 것과 같습니다.

핵심 요약

GLAM은 로봇이 단순히 특정 모터 명령을 암기하는 것이 아니라 움직임의 물리 법칙을 이해하도록 가르침으로써 "데이터 부족" 문제를 해결합니다. 이를 통해 로봇이 저렴하고 무질서하며 다양한 데이터 소스(시뮬레이션이나 영상 등)로부터 학습하고, 그 지식을 실제 세계의 과업에 적용할 수 있게 함으로써, 수천 번의 비싼 인간 시연 없이도 더 똑똑하고 빠르게 훈련될 수 있도록 만듭니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →