← 최신 논문
🤖 machine learning

DriftWorld: Fast World Modeling through Drifting

DriftWorld는 드리프팅 생성 모델을 활용하여 단 한 번의 순전파(forward pass)로 미래 프레임을 생성하는 새로운 행동 조건부 월드 모델을 도입하며, 이를 통해 디퓨전 기반 베이스라인보다 17배 빠른 추론 속도를 달면서도 로봇 계획 및 정책 평가에서 최첨단 성능을 유지합니다.

원저자: Susie Lu, Haonan Chen, Weirui Ye, Yilun Du

게시일 2026-07-17
📖 3 분 읽기☕ 가벼운 읽기

원저자: Susie Lu, Haonan Chen, Weirui Ye, Yilun Du

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

로봇에게 블록 쌓기나 서랍 열기 같은 까다로운 작업을 가르치려고 한다고 상상해 보세요. 로봇이 현실 세계에서 수백만 번 부딪히고 깨지게 내버려 두고 싶지는 않을 것입니다. 그것은 느리고, 위험하며, 비용이 많이 드는 일입니다. 대신, 여러분은 로봇에게 "백일몽"을 꾸게 하고 싶을 것입니다. 로봇 공학의 세계에서 이 백일몽은 **세계 모델(world model)**이라고 불립니다. 이것은 디지털 수정구슬과 같아서, "내가 팔을 이렇게 움직이면, 다음 세상은 어떤 모습일까?"라고 상상하게 해줍니다. 만약 로봇이 실제로 움직이기 전에 그 움직임의 결과를 상상할 수 있다면, 최선의 움직임을 선택하고 실수를 피할 수 있습니다.

오랫동안 이러한 디지털 수정구슬은 느리고 사색적인 예술가와 같았습니다. 이들은 미래의 상세한 그림을 그려내는 데는 매우 뛰어나지만, 그림 한 점을 완성하는 데 시간이 아주 오래 걸립니다. 단 1초의 미래 영상을 생성하기 위해, 수십 번의 미세한 단계를 거치며 이미지를 반복해서 정교하게 다듬어야 할 수도 있습니다. 이것은 문제가 됩니다. 왜냐하면 로봇은 눈 깜짝할 사이에 결정을 내려야 하기 때문입니다. 로봇이 무언가를 하는 데 3초 동안 '상상'만 하고 있다면, 떨어지는 컵을 잡기에는 이미 너무 늦은 것입니다. 중요한 질문은 이것입니다. "우리는 기존의 세계 모델만큼 정교한 미래를 상상하면서도, 실제 로봇의 심장 박동 속도를 따라잡을 만큼 빠른 세계 모델을 만들 수 있을까?"

여기서 DriftWorld라는 영리한 해결책을 제시하는 새로운 논문이 등장하여 게임의 규칙을 바꿉니다. 이전 모델들이 사용하던 (소위 "확산(diffusion)"이라 불리는 기술에 의존하는) 느린 단계별 채색 과정 대신, DriftWorld는 "드리프팅(drifting, 표류)" 모델이라는 것을 사용합니다. 이것을 이렇게 생각해 보세요. 만약 확산 모델이 조각가가 돌덩이를 한 단계씩 깎아내어 조각상을 드러내는 방식이라면, 드리프팅 모델은 서퍼와 같습니다. 모델은 훈련하는 동안 물의 "흐름"이나 "표류(drift)"를 학습합니다. 일단 물이 흐르는 방향을 알게 되면, 출발점에서 목적지까지 단 한 번의 매끄러운 동작으로 미끄러져 갈 수 있습니다.

저자들은 로봇의 계획된 움직임을 지침으로 받아들여, 그 움직임의 결과로 나타날 미래 영상 프레임을 즉각적으로 생성하는 '행동 조건부(action-conditioned)' 세계 모델로 DriftWorld를 구축했습니다. 그들은 물체를 옮기는 작업(예: "Push-T" 작업)과 복잡한 주방 업무를 포함한 여러 실제 및 시뮬레이션 로봇 작업에서 이를 테스트했습니다. 결과는 놀랍습니다. DriftWorld는 단 한 번의 순전파(forward pass)로 미래 영상 프레임을 생성할 수 있으며, 초당 30프레임 이상의 속도에 도달했습니다. 이는 기존의 가장 뛰어난 확산 기반 세계 모델보다 평균 17배 더 빠른 속도입니다.

속도만이 전부가 아닙니다. 꿈은 정확해야 합니다. 연구진은 DriftWorld가 빠를 뿐만 아니라, 선명하게 본다는 것을 발견했습니다. 테스트 결과, 생성된 영상은 느린 모델들만큼이나 선명하고 사실적이었으며, 표준 품질 점수에서 대등하거나 더 높은 성적을 거두었습니다. 이 모델은 매우 빠르기 때문에, 로봇은 예전에 단 몇 가지의 미래를 상상하는 데 걸렸던 시간 동안 이제 수백 가지의 서로 다른 미래 시나리오를 상상할 수 있습니다. 연구진이 로봇에게 행동하기 전에 DriftWorld를 사용하여 "생각"하도록 했을 때, 로봇은 작업 수행 능력이 향상되었습니다. 예를 들어, Push-T 작업에서 로봇의 성공률은 DriftWorld를 사용하여 움직임을 계획했을 때 IoU(Intersection over Union) 점수가 0.635에서 0.781로 급증했습니다.

또한 이 논문은 DriftWorld가 로봇 정책을 오프라인으로 테스트하는 데 환상적인 도구임을 보여주었습니다. 예를 들어, 여러분에게 열 가지의 서로 다른 로봇 전략이 있고, 이를 실제 실험실에서 모두 실행해보지 않고도 어떤 것이 최선인지 알고 싶다고 가정해 봅시다. DriftWorld는 시뮬레이터 역할을 하여 각 전략의 결과를 실행하고 순위를 매길 수 있습니다. 연구진은 DriftWorld가 부여한 점수가 실제 결과와 최대 0.9916의 피어슨 상관 계수(Robomimic Lift 작업 기준)로 상관관계가 있음을 발견했습니다. 이는 디지털 백일몽이 현실과 거의 완벽하게 일치했음을 의미합니다.

하지만 저자들은 이것이 모든 것을 해결하는 마법 지팡이는 아니라는 점을 주의 깊게 언급합니다. 이 모델은 특히 복잡한 장면에서 이미지를 선명하게 유지하기 위해 사전 훈련된 "특징 추출기(feature extractor, 구체적으로 DINOv2/v3)"에 의존합니다. 또한 올바른 드리프트를 학습하기 위해 한 번에 많은 "부정적(negative)" 예시(잘못된 추측)를 생성해야 하므로 훈련 중에 더 많은 컴퓨터 메모리를 필요로 합니다. 이 논문은 드리프팅이 로봇 세계 모델링을 위한 강력한 토대임을 입증했지만, 향후 연구는 모델을 더 길고 일관되게 만들기 위해 이러한 메모리 제약을 해결해야 할 것임을 시사합니다.

요컨대, DriftWorld는 우리가 '느리고 완벽한 상상'과 '빠르고 흐릿한 상상' 사이에서 하나를 선택할 필요가 없음을 시사합니다. "디노이징(denoise, 노이즈 제거)" 대신 "드리프팅(drift, 표류)"을 학습함으로써, 로봇은 마침내 실제 세계에서 계획하고 행동하는 데 필요한 빠르고 고품질인 백일몽을 가질 수 있게 되었습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →