← 최신 논문
🤖 AI

Sword: Style-Robust World Models as Simulators via Dynamic Latent Bootstrapping for VLA Policy Post-Training

본 논문은 폐루프 롤아웃에서의 일반화 실패와 오차 누적을 완화하여 LIBERO 벤치마크에서 비전 - 언어 - 행동 정책의 충실도와 강화학습 사후 훈련 성공률을 크게 향상시키기 위해 구조 유도 스타일 증강과 동적 잠재 부트스트래핑을 활용하는 견고한 월드 모델 프레임워크인 Sword 를 제안합니다.

원저자: Jiaxuan Gao, Yongjian Guo, Zhong Guan, Wen Huang, Wanlun Ma, Xi Xiao, Junwu Xiong, Sheng Wen

게시일 2026-05-11
📖 3 분 읽기☕ 가벼운 읽기

원저자: Jiaxuan Gao, Yongjian Guo, Zhong Guan, Wen Huang, Wanlun Ma, Xi Xiao, Junwu Xiong, Sheng Wen

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

로봇에게 컵을 집어 올리는 것과 같은 작업을 가르친다고 상상해 보세요. 보통은 로봇이 실제 세계에서 연습하도록 해야 하는데, 이는 시간이 많이 걸리고 비용이 많이 들며, 무언가를 부수면 위험할 수 있습니다. 이를 해결하기 위해 과학자들은 '월드 모델 (World Models)'을 사용합니다. 월드 모델은 로봇이 자신의 마음속에서 연습할 수 있게 해주는 초지능 비디오 게임 엔진이라고 생각하면 됩니다. 로봇은 실제 팔을 움직이는 대신 미래를 '상상'합니다. "내가 팔을 이렇게 움직이면, 다음에 컵은 이렇게 보일 거야."

하지만 현재 로봇을 위한 비디오 게임 엔진에는 두 가지 큰 문제가 있습니다:

  1. 배경에 너무 까다롭습니다. 실제 세계의 조명이나 테이블 색상을 바꾸면 로봇의 상상이 혼란스러워져서 존재하지 않는 것을 보는 환각 (hallucination) 을 시작합니다.
  2. 오래 재생할수록 성능이 떨어집니다. 로봇이 긴 일련의 사건을 상상하려 하면, 처음 몇 초 동안의 사소한 실수들이 쌓여 나머지 비디오를 흐릿하고 터무니없는 망가진 이미지로 만들어 버립니다.

이 논문은 이러한 문제들을 해결하기 위해 Sword라는 새로운 시스템을 소개합니다. 간단한 비유를 들어 작동 방식을 설명하겠습니다.

1. "스타일 변경" 체육관 (구조 유도 스타일 증강, Structure-Guided Style Augmentation)

문제: 파란 벽과 밝은 조명만 있는 방에서 연습한 로봇을 상상해 보세요. 노란 벽과 어두운 조명이 있는 방에 넣으면, 로봇은 "벽"이 색과 상관없이 "벽"이라는 사실을 배운 적이 없어서 당황합니다. 로봇은 물리 법칙이 아니라 페인트를 외워버린 것입니다.

Sword 의 해결책: 저자들은 로봇을 "스타일 변경 체육관"에 넣습니다. 특수 도구를 사용해 훈련 비디오의 모습을 끊임없이 바꿉니다. 벽을 빨간색으로, 조명을 어둡게, 테이블을 나무 무늬로, 로봇 팔을 다른 색으로 만드는 식입니다.

  • 주의할 점: 단순히 색상을 무작위로 바꾸는 것이 아니라, 로봇이 물체의 위치를 잃지 않도록 하는 "안전망 (기하학적 안내, geometric guidance)"을 사용합니다. 테이블 색상은 바뀔 수 있지만, 갑자기 공중에 떠 있는 구름으로 변해서는 안 됩니다.
  • 결과: 로봇은 특정 색상을 외우는 것을 멈추고 실제 물리 법칙을 배우기 시작합니다. 컵이 어떻게 생겼든 상관없이 "컵을 밀면 미끄러진다"는 사실을 배우는 것입니다. 이로 인해 로봇은 새로운, 보지 못한 환경을 훨씬 잘 처리할 수 있게 됩니다.

2. "자기 수정 리허설" (동적 잠재 부트스트랩핑, Dynamic Latent Bootstrapping)

문제: 시험을 치르는 학생을 상상해 보세요. 수업 중 (훈련) 에는 선생님이 이전 문제의 정답을 알려주어 다음 문제에 집중하게 합니다. 이를 "Teacher Forcing"이라고 합니다. 하지만 실제 시험 (추론) 에서는 학생이 다음 문제를 풀기 위해 자신의 이전 답을 기억해야 합니다. 초반에 작은 실수를 하면 오류의 고리에 갇히게 됩니다.

Sword 의 해결책: 저자들은 **동적 잠재 부트스트랩핑 (Dynamic Latent Bootstrapping)**이라는 "자기 수정 리허설" 방법을 만들었습니다.

  • 훈련 중에는 로봇에게 항상 완벽한 "정답 (ground truth)"을 제공하는 대신, 점차 로봇이 다음 단계의 시작점으로 자신의 예측을 사용하도록 합니다.
  • 기억 트릭: 로봇의 기억이 폭발하여 막대한 컴퓨터 저장 공간이 필요하지 않도록, 로봇의 "생각"을 전체 비디오 프레임을 저장하는 대신 작고 효율적인 캐시 (고속 메모장 같은 것) 로 압축합니다.
  • 결과: 로봇은 학습하는 동안 자신의 실수에서 회복하는 법을 배웁니다. 로봇은 실제 세계에서 수행할 때와 정확히 같은 방식으로 연습하므로, 실제 작업을 수행할 때 몇 초 만에 무너지지 않습니다.

결과

팀원들은 LIBERO라는 표준 로봇 벤치마크에서 Sword 를 테스트했습니다.

  • 화질: 긴 일련의 사건을 상상하라고 요청했을 때, Sword 는 비디오를 선명하고 명확하게 유지했습니다. 기존 방법 (WoVR) 은 흐릿해지고 존재하지 않는 것을 보는 환각을 일으켰습니다.
  • 견고성: 조명이나 배경이 바뀌었을 때 Sword 는 완벽하게 작동했습니다. 기존 방법은 즉시 실패했습니다.
  • 성공률: 강화 학습을 사용하여 로봇 정책을 훈련할 때 Sword 를 사용하면, 기존 시뮬레이터로 훈련했을 때보다 로봇이 작업을 성공할 확률이 훨씬 높았습니다.

요약하자면: Sword 는 로봇을 위한 더 나은 "꿈 기계"입니다. 로봇이 조명 변화와 같은 피상적인 방해 요소를 무시하도록 가르치고, 자신의 실수를 처리하도록 훈련시켜, 로봇이 미래를 정확하게 상상하고 실제 세계에서 안전하게 행동할 수 있게 합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →