← 최신 논문
🤖 AI

DiLA: Disentangled Latent Action World Models

DiLA는 라벨링된 데이터 없이 고품질 비디오 생성과 해석 가능한 행동 공간을 달성하기 위해 잠재 행동 학습과 콘텐츠-구조 분리를 시너지 효과로 활용함으로써 행동 추상화와 생성 충실도 간의 상충 관계를 해결하는 새로운 세계 모델을 제시합니다.

원저자: Tianqiu Zhang, Muyang Lyu, Yufan Zhang, Fang Fang, Si Wu

게시일 2026-05-18
📖 4 분 읽기☕ 가벼운 읽기

원저자: Tianqiu Zhang, Muyang Lyu, Yufan Zhang, Fang Fang, Si Wu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

DiLA 논문에 대한 설명을 일상적인 비유와 함께 간단한 개념으로 나누어 설명합니다.

큰 문제: "흐릿함 vs. 지루함"의 딜레마

로봇이 아무도 로봇이 무엇을 하는지 알려주지 않은 채, 비디오만 보고 세상을 이해하도록 가르친다고 상상해 보세요. 이를 **잠재 행동 모델 (Latent Action Model, LAM)**이라고 합니다.

로봇은 두 가지 사실을 파악해야 합니다:

  1. 행동: 무슨 일이 일어나고 있는가? (예: "손이 왼쪽으로 움직이고 있다.")
  2. 결과: 다음 프레임은 어떻게 보이는가? (예: "컵이 이제 왼쪽에 있다.")

트레이드오프:

  • 로봇이 행동에 너무 집중하면 (매우 추상적이고 단순하게 만들면), 생성된 비디오는 흐릿하고 저화질이 됩니다. 영화를 "한 남자가 걷는다"고 묘사하는 것과 같지만, 장면을 그려보려고 하면 세부 사항이 빠져나갑니다.
  • 로봇이 생성 품질에 너무 집중하면 (비디오를 완벽하게 보이게 만들면), 혼란에 빠집니다. 셔츠의 색이나 벽의 질감이 "행동"의 일부라고 생각하기 시작합니다. 실제 움직임을 배우지 못하게 됩니다.

현재의 방법들은 보통 둘 중 하나를 선택하거나, 서로 잘 어울리지 않는 복잡한 2 단계 프로세스를 사용합니다.

해결책: DiLA ("건축가와 화가")

저자들은 DiLA(Disentangled Latent Action world model)를 제안합니다. 그들의 핵심 아이디어는 로봇의 뇌를 **구조 (Structure)**와 **내용 (Content)**이라는 두 개의 전문 팀으로 나누어 함께 일하게 하는 것입니다.

집을 짓는다고 생각해보세요:

  • 구조 팀 (건축가): 이 팀은 청사진에만 관심을 가집니다. 벽은 어디에 있고, 문은 어디에 있으며, 문은 어떻게 움직일까요? 그들은 페인트 색상, 벽지, 또는 가구를 무시합니다. 그들의 임무는 운동배치를 파악하는 것입니다.
  • 내용 팀 (화가): 이 팀은 세부 사항을 중요하게 생각합니다. 벽의 색상은 무엇이며, 바닥은 나무인지 타일인지요? 그들은 청사진을 신경 쓰지 않고, 집의 모습을 기억하는 것만 중요합니다.

그들이 함께 일하는 방식:

  1. 건축가는 두 프레임을 보고 "문이 왼쪽에서 오른쪽으로 움직였다"고 말합니다. 그들은 모든 페인트와 질감을 제거하고 오직 운동만 남깁니다.
  2. 건축가는 페인트를 무시하도록 강요받기 때문에 ("병목" 현상), 순수한 움직임을 포착하는 데 매우 능숙해집니다.
  3. 화가는 원래의 색상과 질감을 기억합니다.
  4. 다음 프레임을 생성하기 위해, 그들은 건축가의 새로운 청사진 (문이 이제 오른쪽에 있음) 과 화가의 기억 (문은 여전히 붉은 나무임) 을 결합합니다.

마법: "공진화 (Co-Evolving)"

이 논문은 이 두 팀이 서로 더 똑똑해지도록 돕는다고 주장합니다. 이를 공진화라고 합니다.

  • 건축가는 화가를 밀어붙입니다: 건축가는 움직임을 예측하기 위해 세부 사항을 무시하도록 강요받기 때문에, 화가가 모든 시각적 세부 사항에 대한 책임을 지도록 만듭니다.
  • 화가는 건축가를 돕습니다: 화가가 모든 "노이즈"(색상, 질감) 를 처리하기 때문에, 건축가는 산만해지지 않고 순수한 운동에만 집중할 수 있습니다.

한 파트너가 발걸음을 이끌고 (구조), 다른 파트너가 의상을 담당하는 (내용) 춤과 같습니다. 둘 다 하려고 하면 넘어집니다. 일을 나누면 완벽하게 춤을 춥니다.

DiLA 가 할 수 있는 일 (논문에 기반)

연구자들은 사람 물체 이동부터 로봇이 방을 항해하는 것까지 다양한 유형의 비디오로 이를 테스트했습니다. 그들이 발견한 바는 다음과 같습니다:

  1. 우수한 비디오 생성: DiLA 는 운동과 질감을 동시에 예측하려고 혼란에 빠지지 않기 때문에 이전 방법들보다 더 선명하고 날카로운 비디오를 생성합니다.
  2. 교차 구현 전이 ("마법"): 이것이 가장 멋진 부분입니다. DiLA 는 한 비디오에서 행동을 학습하고 완전히 다른 비디오에 적용할 수 있습니다.
    • 예시: 사람이 컵을 들어 올리는 것을 보고, "들어 올리는 순수한 운동"을 추출한 후, 완전히 다른 비디오의 로봇 팔에 동일한 운동을 적용할 수 있습니다. 로봇 팔은 인간과 전혀 다르게 보이지만, 물체를 "들어 올립니다".
    • 다른 예시: 비디오 게임의 카메라 움직임을 가져와 실제 세계의 로봇 비디오에 적용할 수 있습니다.
  3. 시각적 계획: 로봇은 이 이해를 활용하여 미리 계획을 세울 수 있습니다. "버튼으로 가라"고 말하면, 로봇은 머릿속에서 미래 단계를 시뮬레이션하여 그곳에 가는 가장 좋은 방법을 파악할 수 있습니다.
  4. "순수한" 운동 이해: 연구자들은 DiLA 가 행동의 "지도"를 학습한다는 것을 보여주었습니다. 지도를 보면 "왼쪽으로 이동"은 한 곳에, "오른쪽으로 이동"은 다른 곳에 위치하며 매끄럽고 연속적인 경로를 형성합니다. 이는 "이동"이 "무엇이 이동하는가"와 별개의 개념임을 이해한다는 뜻입니다.

요약

DiLA는 로봇이 비디오를 통해 세상을 이해하도록 가르치는 문제를 운동(구조)과 외관(내용)이라는 두 부분으로 일을 나누어 해결합니다. 이 두 부분이 분리되지만 함께 일하도록 강제함으로써, 로봇은 높은 품질로 미래 비디오를 예측하면서도 그 안에서 일어나는 추상적인 "행동"을 이해하게 됩니다. 이를 통해 로봇은 인간에서 로봇으로 기술을 이전하고 자신의 움직임을 효과적으로 계획할 수 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →