GlanceWAM: Sparse Test-Time Imagination for World-Action Models
GlanceWAM은 단일 비디오 DiT 내에서 비동기적 배경 시각 상상(visual imagination)과 실시간 제어를 분리함으로써 로봇 학습의 지연 시간-성공 간의 트레이드오프를 해결하며, RoboCasa 및 LIBERO 벤치마크에서 최첨단 성능을 달성하는 동시에 동기식 베이스라인보다 24배 더 빠르게 실행됩니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
현실 세계를 움직이는 로봇에게는 단순히 명령 목록 이상의 것이 필요합니다. 로봇은 자신의 행동이 주변 환경을 어떻게 변화시킬지 이해해야 합니다. 만약 로봇이 컵을 향해 손을 뻗는다면, 컵이 움직일 것이라는 점, 테이블이 흔들릴 수 있다는 점, 그리고 선반으로 가는 경로가 바뀔 수 있다는 점을 예측해야 합니다. 수년 동안 과학자들은 기계에게 미래를 상상하도록 가르침으로써 이러한 종류의 예견 능력을 부여하기 위해 노력해 왔습니다. 그들은 비디오를 생성할 수 있는 강력한 컴퓨터 모델을 사용하여, 로봇이 실제로 움직이기 전에 다음에 일어날 일을 일종의 "꿈"을 꾸게 함으로써 미래를 시뮬레이션하게 합니다. 희망은 미래의 예고편을 봄으로써 로봇이 더 잘 계획하고 실수를 피하는 것입니다. 그러나 이 아이디어를 가로막은 주요한 문제가 있었습니다. 바로 이러한 비디오 예고편을 생성하는 데 시간이 너무 오래 걸린다는 점입니다. 로봇이 떨어지는 물체를 잡거나 액체를 따르려고 할 때, 로봇은 밀리초 단위로 결정을 내려야 합니다. 만약 컴퓨터가 미래의 장면을 꿈꾸는 데 몇 초를 소비한다면, 로로봇은 이미 행동하기에 너무 늦어버린 상태가 됩니다. 이는 엔지니어들에게 어려운 선택을 안겨주었습니다. 로봇이 앞을 내다보게 하되 반응 속도는 늦추게 할 것인지, 아니면 즉각적으로 반응하게 하되 미래를 보는 능력을 박탈하여 눈먼 추측만 남길 것인지의 문제였습니다.
한 연구팀이 이 교착 상태를 깨뜨릴 방법을 찾아냈습니다. 그들은 GlanceWAM이라는 새로운 시스템을 개발했는데, 이는 로봇이 실시간 속도로 움직이면서도 미래에 대한 시야를 유지할 수 있게 해줍니다. 핵심적인 통찰은 로봇이 업무를 수행하기 위해 매 초마다 끊임없이 미래의 비디오 스트림을 가질 필요는 없다는 사실을 깨달은 것이었습니다. 대신, 로봇은 몇 초 뒤의 경로가 어디인지를 보여주는 명확한 그림만을 필요로 합니다. 연구진은 "꿈을 꾸는" 부분과 "행동하는" 부분이 서로 다른 속도와 경로에서 작동하도록 설계했습니다. 로봇의 제어 시스템이 움직임을 부드럽게 유지하기 위해 48밀리초마다 빠르게 결정을 내리는 동안, 별도의 더 느린 프로세스가 백그라운드에서 실행됩니다. 이 백그운드 프로세스는 3초에 단 한 번씩, 미래의 모습이 어떠할지를 상상하기 위해 조용히 앞을 살짝 훑어봅니다. 이 상상된 프레임은 전체 비디오가 아니라, 목적지에 대한 압축되고 숨겨진 표현입니다.
이 접근 방식의 마법은 두 부분이 서로 소통하는 방식에 있습니다. 로봇의 제어 시스템은 백그라운드의 꿈꾸는 과정이 끝나기를 기다리지 않습니다. 대신, 제어 시스템은 단순히 가장 최근에 상상된 목적지를 가져와 다음 몇 번의 움직임을 안내하는 데 사용합니다. 로봇이 전체 비디오가 아닌 이 숨겨진 단순화된 버전을 사용하기 때문에, 정보를 거의 즉각적으로 처리할 수 있습니다. 연구진은 이 시스템을 서랍 열기, 손잡이 돌리기, 물건을 카운터 사이로 옮기기 등 24가지의 복잡한 주방 작업 세트에 대해 테스트했습니다. 이 테스트에서 새 시스템은 72.2%의 성공률을 보였습니다. 이는 비디오와 행동을 동시에 생성하려고 했던 기존 방법의 성공률인 67.1%보다 높으며, 미래를 상상하는 것을 포기한 시스템의 성공률인 64.4%보다 훨씬 뛰어난 성과입니다. 또한 이 시스템은 또 다른 표준 테스트 세트에서도 99.0%의 성공률을 달iah하며 매우 우수한 성능을 보여주었습니다.
이 결과가 특히 주목할 만한 이유는 시스템이 속도를 희생하지 않으면서도 높은 수준의 성공을 거두었다는 점입니다. 연구진은 로봇이 다음 움직임을 결정하는 데 걸리는 시간을 측정했으며, 새 시스템은 결정당 단 48밀리초밖에 걸리지 않았습니다. 이는 생각과 행동을 동시에 수행하려 했던 이전의 최고 방법들보다 24배나 빠른 속도입니다. 이 시스템이 잘 작동하는 이유는 "살짝 훑어본" 미래 정보가 사용될 때쯤에는 약간 오래된 정보가 될 수 있다는 점을 감안하여 훈련되었기 때문입니다. 운전자가 1분 전에 그려진 지도를 사용하는 것처럼, 로봇은 마지막 미래의 겉모습을 본 후 시간이 얼마나 흘렀는지에 따라 자신의 행동을 조정하는 법을 배웁니다. 연구진은 로봇이 실제로 이러한 미래의 겉모습을 사용하여 결정을 내린다는 것을 확인했습니다. 미래 정보를 인위적으로 제거했을 때 로봇의 성능이 크게 떨어졌는데, 이는 미래에 대한 예견이 단순히 수동적인 기능이 아니라 행동을 위한 결정적인 가이드였음을 증명합니다.
이 연구는 로봇 지능의 병목 현상이 더 많은 컴퓨팅 파워의 필요성이 아니라, 그 파워가 어떻게 사용되고 있는가에 있었음을 시사합니다. 미래를 상상하는 느리고 사려 깊은 과정과 신체를 제어하는 빠르고 긴박한 과정을 분리함으로써, 연구진은 빠르면서도 현명한 시스템을 만들어냈습니다. 로봇은 어디로 가야 할지 알기 위해 미래의 모든 프레임을 볼 필요가 없습니다. 단지 목적지에 대한 명확하고 시의적절한 스냅샷만 있으면 됩니다. 이 접근 방식은 로봇이 인간이 사용하는 것과 같은 유연함과 예견력을 갖추면서도, 현실 세계의 속도에 맞춰 빠르게 반응하며 복잡하고 변화하는 환경을 항해할 수 있는 실질적인 길을 제시합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.