← 최신 논문
🤖 AI

DWM: Separating World Effects from Actions in Latent World Models

이 논문은 행동에 의한 전이(action-driven transitions)와 행동 불변적 세계 효과(action-invariant world effects)를 잠재 세계 모델(latent world models)에서 명시적으로 분리함으로써 중력이나 관성과 같이 지속적인 역학이 존재하는 환경에서의 계획 성공도를 향상시키는 감독 수준의 프레임워크인 DWM(Decomposed World Model)을 소개한다.

원저자: Yi-Ge Zhang, Tianqi Du, Qi Zhang, Yisen Wang

게시일 2026-07-22
📖 3 분 읽기☕ 가벼운 읽기

원저자: Yi-Ge Zhang, Tianqi Du, Qi Zhang, Yisen Wang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 로봇에게 당구 게임을 가르치고 있다고 상상해 보세요. 당신은 로봇이 수구를 쳐서 8번 공을 포켓에 넣는 법을 배우길 원합니다. 하지만 한 가지 문제가 있습니다. 당구대가 완벽하게 평평하지 않습니다. 약간의 기울기가 있어서, 로봇이 아무것도 하지 않아도 중력이 끊임없이 공을 경사 아래로 미끄러뜨리려 합니다. 훌륭한 선수가 되기 위해서 로봇은 두 가지를 동시에 이해해야 합니다. 즉, 자신의 큐가 공의 경로를 어떻게 바꾸는지와, 테이블의 기울기가 스스로 공을 어떻게 움직이는지를 알아야 합니다. 이것이 바로 컴퓨터가 사물이 움직이는 방식을 정신적 지도로 구축함으로써 물리적 세계에서 행동하는 법을 배우는 분야인 '체화된 AI(embodied AI)'의 핵심입니다.

컴퓨터가 앞을 내다보고 계획을 세우기 위해, '잠재 세계 모델(latent world model)'이라는 것을 사용합니다. 이것을 로봇의 뇌 속에 있는 '꿈 생성 기계'라고 생각해 보세요. 로봇은 실제 세계를 프레임 단위로 관찰하는 대신, 미래에 대한 단순화되고 보이지 않는 스케치를 만듭니다. 로봇은 "내가 공을 이런 방식으로 밀면 어떤 일이 일어날까?"라고 자문합니다. 문제는 현재의 꿈 생성 기계들이 미래의 모든 변화를 하나의 덩어리진 복잡한 덩어리로 취급한다는 점입니다. 그들은 움직임의 어느 부분이 로봇의 밀기에서 왔고, 어느 부분이 테이블의 기울기에서 왔는지 구분하지 못합니다. 그들은 단지 공이 움직이는 것을 보고 그 전체를 한꺼번에 추측하려고 할 뿐이며, 이는 환경이 자신만의 고집스러운 습성을 가지고 있을 때 매우 혼란스러워집니다.

"DWM: 잠재 세계 모델에서 세계의 효과와 행동의 분리(DWM: Separating World Effects from Actions in Latent World Models)"라는 제목의 이 논문은 이러한 혼란을 정면으로 다룹니다. 베이징 대학교의 연구진인 저자들은 로봇을 더 똑똑하게 만들기 위해서는, 꿈 생성 기계가 미래를 두 가지 별개의 성분인 '행동 효과(Action Effect)'(로봇이 일으키는 것)와 '세계 효과(World Effect)'(중력이나 바람처럼 환경이 스스로 하는 것)로 나누도록 가르쳐야 한다고 주장합니다. 그들은 새로운 훈련 방법인 DWM(Decomposed World Model)을 소개합니다. DWM은 로봇에게 미래 전체를 한 번에 추측하도록 강요하는 대신, 로봇이 아무것도 하지 않아도 일어나는 일만을 예측하도록 학습하는 특수한 '세계 헤드(World Head)'를 부여합니다. 그런 다음, 별도의 '행동 헤드(Action Head)'가 나머지를 학습합니다. 이 두 헤드가 서로 협력하면서도 독립성을 유지하도록 강제함으로써, 로봇은 인과관계에 대한 훨씬 더 명확한 그림을 학습하게 됩니다.

연구진은 이 아이디어를 로봇이 블록을 밀 때 중력 때문에 경사면을 따라 미끄러지는 버전의 밀기 게임을 포함하여 여러 로봇 작업에 테스트했습니다. 그들은 새로운 방법인 DWM이 기존의 '단일적(monolithic)' 방식보다 훨씬 더 뛰어난 계획 능력을 갖추고 있음을 발견했습니다. 이러한 까다로운 중력 영향 작업에서, DWM은 로봇의 성공률을 평균 13.1% 향상시켰습니다. 예를 들어, PushT-W라고 불리는 작업에서 기존 방식은 32%의 성공률을 보였으나, DWM은 이를 44%까지 끌어올렸습니다. 이 논문은 로봇의 행동과 세계의 자연스러운 흐름을 분리함으로써, 로봇이 미래를 더 정확하게 상상하고 환경이 스스로 무언가를 움직이려 할 때도 더 나은 결정을 내릴 수 있다고 시사합니다. 중요한 점은, 이러한 개선이 중력이 변수가 되지 않는 평평하고 쉬운 작업에서 로봇의 성능을 저하시키지 않았다는 것입니다. 단지 세상이 스스로 움직이고 있을 때 로봇을 더 똑똑하게 만들었을 뿐입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →