← 최신 논문
💻 computer science

SelfWAM: A Self-Grounded Unified World Action Model for Fast Robot Control

SelfWAM은 로봇의 셀프 마스크(self-mask)에 기반하여 행동과 행동 조건부 미래 관측치를 공동으로 예측함으로써, 예측이 특정 행동의 결과를 반영하도록 보장하는 동시에 빠른 추론 속도를 유지하며 로봇 정책 학습을 향상시키는 통합된 월드 액션 모델(unified world action model)입니다.

원저자: Bikang Pan, Fan Liu, Haotao Lu, Jingya Wang, Ye Shi

게시일 2026-08-04
📖 4 분 읽기☕ 가벼운 읽기

원저자: Bikang Pan, Fan Liu, Haotao Lu, Jingya Wang, Ye Shi

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. ✨ 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

로봇에게 샌드위치를 만드는 법을 가르치고 있다고 상상해 보세요. 당신은 사람이 토마토를 써는 영상을 로봇에게 보여줍니다. 단순한 로봇은 그저 토마토와 칼의 이미지를 암기한 뒤, 사람의 손동작을 그대로 따라 하려고 할 것입니다. 하지만 여기서 까다로운 점이 있습니다. 로봇이 영상만 본다면, 토마토가 왜 움직이는지 그 이유를 정말로 이해하지 못한다는 것입니다. 로봇은 칼을 더 세게 누르면 토마토가 더 빨리 썰린다는 것도, 반대로 잘못된 방향으로 누르면 토마토가 테이블 아래로 굴러떨어진다는 것도 알지 못합니다.

이것이 바로 로봇 공학에서의 '세계 행동 모델(World Action Models)'이 직면한 과제입니다. 이 모델들은 로봇이 지금 하고 있는 행동을 바탕으로 미래가 어떻게 보일지를 예측하려고 노력하는 특별한 AI 두뇌입니다. 이것들을 로봇의 '상상력'이라고 생각할 수 있습니다. 만약 로봇이 미래를 상상할 수 있다면, 더 나은 계획을 세울 수 있습니다. 하지만 오랫동안 이러한 상상력은 약간의 백일몽과 같았습니다. 장면이 몇 초 후에 어떻게 변할지는 추측할 수 있었지만, 그 추측을 로봇이 실제로 한 구체적인 움직임과 연결하는 데는 서툴렀습니다. 마치 영화를 보고 결말을 추측하면서도, 정작 등장인물들이 방금 무엇을 했는지는 모르는 것과 같았습니다. 과학자들의 큰 질문은 이것입니다. 어떻게 하면 로봇이 단순히 어떤 일이 일어나는지를 배우는 것을 넘어, 자신의 몸이 어떻게 사물에 영향을 미치는지 배우도록, 즉 자신의 행동의 결과로서의 미래를 구체적으로 상상하도록 가르칠 것인가 하는 점입니다.

여기, 로봇을 위한 '자기 인식형' 상상력 코치 역할을 하는 새로운 접근 방식인 SelfWAM이 등장했습니다. 이 연구의 개발자들은 이전 방식들이 결정적인 연결 고리를 놓치고 있다는 사실을 깨달았습니다. 즉, 로봇이 자신의 구체적인 움직임과 눈에 보이는 시각적 변화를 연결하도록 강제되지 않았던 것입니다. 이를 해결하기 위해, 그들은 로봇이 두 가지를 동시에 주목하도록 만드는 시스템을 구축했습니다. 하나는 장면의 미래 영상이고, 다른 하나는 그 장면 속을 움직이는 자신의 몸의 '유령 같은' 윤곽입니다.

SelfWAM이 어떻게 작동하는지 간단한 비유를 들어 설명하겠습니다. 여러분이 저글링을 배우고 있다고 상상해 보세요. 일반적인 AI는 사람이 저글링하는 영상을 보고 공이 다음에 어디로 갈지 예측하려고 할 것입니다. 하지만 그 과정에서 공의 색깔이나 배경 벽에 정신이 팔릴 수도 있습니다. Self-WAM은 다릅니다. 이 모델은 로봇이 방금 수행한 동작에 대한 '깨끗한' 복사본, 즉 던지기 동작의 완벽하고 노이즈 없는 청사진을 제공하며, 이 청사진을 사용하여 미래를 예측합니다. 결정적으로, 로봇은 '셀프 마스크(self-mask)', 즉 장면 속에서 움직이는 자신의 팔과 손의 흑백 실루엣을 예측하도록 요구받습니다.

이 실루엣이 왜 그렇게 중요할까요? 이것을 조명(spotlight)이라고 생각해 보세요. 저글링 동작의 미래를 예측하려 할 때, 배경 벽이나 조명의 변화는 노이즈일 뿐이며 저글링이 성공할지 여부를 알려주지 않습니다. 하지만 로봇 자신의 팔의 움직임은 신호입니다. 로봇이 (지저분한 배경 세부 사항은 무시하고) 다음 몇 초 동안 자신의 몸이 정확히 어떻게 움직일지를 예측하도록 훈련함으로써, 로봇은 "내가 이 동작을 했다"와 "그 결과로 이런 일이 일어났다" 사이의 훨씬 더 긴밀한 연결 고리를 학습하게 됩니다.

논문은 이 과정이 로봇의 속도를 늦추지 않고 작동하는 영리한 트릭을 설명합니다. 훈련 단계 동안 로봇은 움직임과 미래의 시각적 변화 사이의 연결을 배우기 위해 동작의 '깨끗한' 청사진을 볼 수 있습니다. 하지만 실제로 현장에서 작업할 때(추론 시), 로봇은 그 미래 영상이나 실루엣을 생성할 필요가 없습니다. 그저 동작을 학습한 가벼운 부분의 두뇌만을 사용하면 됩니다. 이는 마치 학생이 도표가 그려진 상세한 학습 가이드를 사용하여 시험 공부를 하지만, 실제 시험 날에는 그저 핵심 사실들을 빠르게 떠올리기만 하면 되는 것과 같습니다. 무거운 작업인 미래 예측은 실제 업무 중이 아니라 오직 연습 중에만 일어납니다.

연구진은 이 아이디어를 두 가지 주요 방식으로 테스트했습니다. 첫째, 두 개의 팔을 가진 로봇이 50가지 이상의 다양한 작업을 수행하는 RoboTwin 2.0이라는 복잡한 컴퓨터 시뮬레이션을 사용했습니다. 그 결과, SelfWAM은 배경이 바뀌거나 무작위로 변할 때(예: 가구 이동이나 조명 변경) 이전 방식들보다 더 뛰어난 성능을 보였습니다. 특히 평균 약 92.6%의 성공률을 기록하며 다른 상위 모델들을 앞질렀습니다. 둘째, 실험실의 실제 물리적 로봇 팔에 적용했습니다. 컵을 받침대에 놓거나 펜을 컵에 넣는 것과 같은 네 가지 특정 작업을 주었을 때, SelfWAM은 95%의 성공률을 보이며 다른 방법들을 능가했습니다.

아마도 가장 흥식한 발견은 이 '슈퍼 상상력'이 로봇을 느리게 만들지 않았다는 점일 것입니다. 논문에 따르면, 로봇이 다음 동작을 결정하는 데 걸리는 시간은 1% 미만(구체적으로 0.97%)으로 증가했습니다. 이는 로봇이 더 똑똑해지면서도 둔해지지 않는다는 것을 의미합니다. 또한, 연구진이 로봇의 '상상력'을 테스트했을 때, SelfWAM은 미래를 훨씬 더 잘 예측한다는 것을 발견했습니다. 만약 로봇에게 팔을 약간 위로 움직이라고 명령하면, SelfWAM의 상상력은 팔이 위로 움직이는 모습을 정확히 보여주었습니다. 기존 모델들은 혼란을 겪으며 동작이 변해도 예측을 크게 바꾸지 못하는 경우가 많았습니다.

요약하자면, Self-WAM은 로봇의 상상력을 자신의 신체 움직임에 근거하게 함으로써—즉, 세상 속을 움직이는 자신의 '그림자'를 시각화하도록 가르침으로써—로봇이 훨씬 더 잘 배울 수 있음을 시사합니다. 로봇은 자신이 한 행동과 우연히 일어난 일을 구분하는 법을 배웁니다. 그 결과, 로봇은 의사 결정 속도를 거의 동일하게 유지하면서도 더 빠르고, 정확하며, 환경 변화에 강인해졌습니다. 이는 로봇이 단순히 세상에 반응하는 것을 넘어, 자신의 행동이 세상을 어떻게 변화시키는지 진정으로 이해하는 단계로 나아가는 발걸음입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →