← 최신 논문
🤖 AI

WAM-OPD: On-Policy Distillation for World Action Models

이 논문은 비디오 우선 월드 액션 모델(video-first World Action Models)을 밀도 높은 교사 감독(dense teacher supervision) 하에 모델 스스로 생성한 이력(histories)으로 학습시켜, 희소 보상 강화 학습(sparse-reward reinforcement learning) 없이도 작업 성공률을 크게 향상시키는 온-폴리시 증류(on-policy distillation) 기반의 사후 학습 방법인 WAM-OPD를 소개한다.

원저자: Liuhaichen Yang, Zhuang Jiang, Chenchao Sheng, Zezhi Tang

게시일 2026-08-25
📖 3 분 읽기☕ 가벼운 읽기

원저자: Liuhaichen Yang, Zhuang Jiang, Chenchao Sheng, Zezhi Tang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

로봇들은 단순히 현재 일어나는 일에 반응하는 것을 넘어, 다음에 어떤 일이 일어날지를 상상함으로써 세상을 이해하려고 노력하는 새로운 종류의 지능을 통해 보고 움직이는 법을 배우고 있습니다. 수년 동안 연구자들은 방대한 양의 비디오와 지시 데이터를 사용하여 로봇을 훈련시켜 왔으며, 이를 통해 로봇이 보는 것과 팔을 어떻게 움직여야 하는지를 연결하도록 가르쳤습니다. 흔히 시각-언어-행동(vision-language-action) 모델이라 불리는 이러한 시스템들은 강력하지만, 실시간으로 복잡한 과업을 수행하도록 요청받았을 때 느리고 서투를 수 있습니다. 이들을 더 빠르게 만들기 위해 과학자들은 '증류(distillation)'라고 불리는 기술을 개발했는데, 이는 마치 느리지만 명석한 스승을 데려와 그 행동을 흉내 내는 빠르고 영리한 학생 버전을 훈련시키는 것과 같습니다. 목표는 단일하고 유연한 동작 속에서 생각하고 행동할 수 있는 로봇을 만드는 것입니다. 하지만 여기에는 함정이 있습니다. 로봇의 두뇌를 빠르게 만들면, 때때로 까다로운 상황을 처리하는 법을 잊어버리거나 초기 훈련 과정에서 보지 못했던 상태에서 길을 잃기도 합니다. 로봇은 빨라졌지만, 일을 완수하는 능력은 상실하게 되는 것입니다.

여기서 WAM-OPD라고 불리는 새로운 접근 방식이 등장합니다. 이 방법은 시행착오를 통해 처음부터 다시 배우기 위해 로봇을 밖으로 내보낼 필요 없이, 이러한 빠른 로봇들의 문제를 해결하기 위해 설계되었습니다. 미래의 비디오 프레임을 예측하여 움직임을 계획하는 시스템을 활용해 연구하던 팀은, 이러한 가속화된 로봇들을 훈련시키는 표준적인 방식에 결함이 있다는 것을 깨달았습니다. 문제는 빠른 로봇이 느린 스승의 완벽한 예측을 바탕으로 행동하도록 교육받고 있었지만, 실제 세상에서 빠른 로봇은 자신의 약간은 불완전한 예측을 바탕으로 행동해야 한다는 점이었습니다. 이는 마치 완벽한 운전자의 영상을 보여주며 학생에게 운전을 가르친 뒤, 학생의 차는 다르게 움직이고 있음에도 불구하고 스승과 똑같이 도로에 반응하기를 기대하며 핸들을 넘겨주는 것과 같았습니다. 로봇이 예상하는 모습과 실제로 보는 모습 사이의 불일치는 로봇을 실패하게 만드는 원인이 되었습니다.

이를 해결하기 위해 연구팀은 빠른 로봇이 실제로 시뮬레이션 환경 속으로 들어가 스스로 움직이는 훈련 루프를 만들었습니다. 로봇이 움직이면서, 로봇은 자신이 보고 행하는 것들의 기록을 생성합니다. 이때 고정된, 느리지만 매우 정확한 스승 로봇이 이러한 특정 순간들을 관찰하고 다음에 어떤 일이 일어나야 하는지에 대한 정답을 제공합니다. 결정적으로, 빠른 로봇은 자신의 불완전한 시각을 바탕으로 미래를 예측하고 행동을 선택하도록 배우는 동시에, 여전히 스승의 정답과 일치하도록 노력합니다. 이를 통해 로봇은 결코 보지 못할 수도 있는 시나리오가 담긴 교과서 목록을 암기하는 것이 아니라, 실제로 마주하는 구체적인 상황들을 다루는 법을 배웁니다. 연구진은 이 방법을 시뮬레이션 상의 두 가지 특정 과업, 즉 한 로봇 손에서 다른 로봇 손으로 마이크를 전달하는 것과 물체를 서랍 안에 넣는 작업에 테스트했습니다.

결과는 이 방법이 로봇의 과업 수행 능력을 유의미하게 향ло상시킬 수 있음을 보여주었습니다. 빠른 로봇이 처음에 완전히 실패했던 과업인 마이크 전달 작업의 경우, 새로운 훈련법은 성공률을 절반 이상으로 높였습니다. 이미 어느 정도 성공적이었던 서랍 과업의 경우, 개선 폭은 더 작았지만 여전히 눈에 띄었으며, 성공률을 약 6번 중 1번에서 3번 중 1번으로 높였습니다. 이러한 수치들은 매우 구체적인 테스트 세트와 적은 수의 시뮬레이션 장면을 사용한 결과이므로, 연구진은 이것이 보편적인 해결책이라기보다 개념 증명(proof of concept)이라고 신중하게 밝히고 있습니다. 그들은 이 방법이 이러한 특정 도전 과제들에 효과적이라는 것을 발견했으며, 이는 현명하지만 정적인 스승의 안내를 받아 로봇이 자신의 실시간 경험으로부터 배우도록 가르치는 것이 빠르고 가속화된 AI의 약점을 보완하는 유망한 방법임을 시사합니다. 이 연구는 모든 상황에 대한 로봇 학습을 해결했다고 주장하는 것이 아니라, 고속 시스템을 실제로 현장에 투입했을 때 더 신뢰할 수 있게 만들기 위한 명확한 경로를 제시하고 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →