← 최신 논문
🤖 AI

CLAP: Cross-Embodiment Video World Models are Zero-Shot Physical Simulators

CLAP은 이질적인 인터넷 규모의 비디오를 학습함으로써 다양한 로봇 및 인간 형태에 걸친 제로샷 물리 시뮬레이션을 가능하게 하고, 커리큘럼 기반 학습 레시피를 통해 서로 다른 액션 공간을 조화시켜 퓨샷 적응 및 일반화된 물리 이해 측면에서 최첨단 성능을 달성하는 새로운 프레임워크이다.

원저자: Kechen Liu, Ola Shorinwa

게시일 2026-08-28
📖 4 분 읽기☕ 가벼운 읽기

원저자: Kechen Liu, Ola Shorinwa

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

로봇은 오랫동안 인간이 하는 방식으로 물리적 세계를 이해하는 데 어려움을 겪어 왔습니다. 아이는 컵을 탁자 끝에서 밀면 떨어질 것이라는 점이나, 수건의 모서리를 잡아당겨 접을 수 있다는 점을 배우는 반면, 로봇은 이러한 단순한 규칙 하나를 배우기 위해서도 수천 개의 구체적인 사례가 필요한 경우가 많습니다. 이러한 어려움은 대부분의 로봇 학습 시스템이 단일 유형의 기계에서 나온 데이터로 학습된다는 사실에서 기인합니다. 길고 가는 팔을 가진 로봇은 그리퍼나 사람의 손을 가진 로봇과는 다르게 물리학을 학습하며, 이는 한 곳에서 얻은 지식을 다른 곳과 쉽게 공유할 수 없게 만드는 장벽을 만듭니다. 이를 극복하기 위해 과학자들은 장면에서 다음에 일어날 일을 상상할 수 있는 컴퓨터 프로그램인 비디오 생성 모델을 주목하기 시작했습니다. 만약 로봇이 영상을 보고 물체의 미래 움직임을 예측할 수 있다면, 물리적으로 먼저 시도해 보지 않고도 자신의 행동을 계획할 수 있을 것입니다. 그러나 이러한 예측 모델은 역사적으로 단일 로봇 유형에 국한되어 왔으며, 이로 인해 인터넷에 존재하는 방대하고 다양한 인간 및 로봇 영상으로부터 학습하는 데 한계가 있었습니다.

프린스턴 대학교의 연구진은 이 간극을 메우기 위해 CLAP이라는 새로운 프레임워크를 개발했습니다. 그들의 연구는 하나의 비디오 모델이 인간과 다양한 종류의 로봇이 등장하는 방대한 혼합 영상을 통해 학습함으로써 보편적인 물리 법칙을 배울 수 있음을 보여줍니다. 핵심 아이디어는 인간의 손, 로봇 팔, 그리고 그리퍼가 모두 다르게 생겼을지라도, 물체를 움직일 때는 모두 동일한 물리 법칙을 따른다는 것입니다. 누가 또는 무엇이 행동을 수행하느냐에 관계없이 장면의 미래를 예측하도록 컴퓨터를 가르침으로써, 연구진은 특정 기계의 구체적인 움직임이 아니라 세상의 근본적인 역학을 이해하는 시스템을 만들었습니다. 이러한 접근 방식은 명령어가 제공되지 않는 라벨 없는 인터넷 영상뿐만 아니라, 상세한 로봇 데이터를 통해 모델이 학습할 수 있게 하여, 사물이 어떻게 움직이고 상호작용하는지에 대한 훨씬 더 풍부한 이해를 가능하게 했습니다.

연구진은 사용하고자 하는 데이터가 무질서하고 일관되지 않다는 상당한 난관에 봉착했습니다. 인간의 영상에는 손이 어떻게 움직였는지에 대한 지침이 포함되어 있지 않으며, 서로 다른 로봇들은 움직임을 설명하는 방식이 제각각입니다. 이를 해결하기 위해 연구팀은 이 모든 서로 다른 움직임의 언어를 공통된 형식으로 번역하는 방법을 고안했습니다. 그들은 세 가지 주요 도구를 사용했는데, 바로 로봇 손의 정밀한 위치, 움직임에 대한 간단한 텍란 설명, 그리고 컴퓨터가 스스로 파악해내는 숨겨진 학습된 행동 표현입니다. 가장 효과적인 전략은 단계별 학습 과정을 포함했습니다. 먼저, 모델은 숨겨진 행동 표현을 사용하여 라벨 없는 영상을 관찰함으로써 기본적인 물리 법칙을 배웠습니다. 기초적인 역학을 이해한 후, 연구진은 라벨이 지정된 움직임을 가진 로봇의 정밀한 데이터를 사용하여 그 지식을 정교화했습니다. 이 2단계 접근 방식 덕분에 시스템은 실제 로봇을 제어할 만큼 정확성을 유지하면서도 방대한 양의 인터넷 영상을 활용하여 규모를 확장할 수 있었습니다.

이 연구의 결과는 새로운 시스템이 단일 유형의 로봇만을 대상으로 학습된 기존의 최고 모델들과 대등하거나 종종 더 나은 성능을 보여준다는 것을 입증합니다. 까다로운 테스트 환경에서 모델은 영상의 미래 프레임을 높은 정확도로 예측했으며, 물체가 어떻게 떨어지거나 미끄러지거나 조작되는지를 정확하게 시뮬레이션했습니다. 결정적으로, 이 시스템은 매번 새로운 로봇을 위해 재학습할 필요 없이 이 지식을 실제 작업에 일반화할 수 있었습니다. 단일 팔 로봇에 대해 테스트했을 때, 시스템은 테이프, 물고기, 혹은 바닷가재와 같은 다양한 물체를 집어 올리기 위해 로봇이 행동을 계획하는 것을 성공적으로 도왔으며, 표준적인 로봇 정책보다 뛰어난 성능을 보였습니다. 더욱 인상적인 점은, 해당 시스템이 학습 과정에서 본 적이 없는 다른 신체 구조를 가진 이중 팔 로봇과 휴머노이드 로봇에도 적용될 수 있었다는 것입니다. 단순히 모델의 마지막 레이어를 새로운 로봇의 움직임에 맞게 조정하는 것만으로도, 시스템은 물리에 대한 깊은 이해를 유지하며 정확한 예측을 계속할 수 있었습니다.

이 연구는 더 유능한 로봇을 만드는 길이 매번 새로운 기계를 위한 고유한 뇌를 구축하는 것을 요구하지 않는다는 점을 시사합니다. 대신, 다양한 혼합 데이터를 통해 학습함으로써 단일 모델이 거의 모든 에이전트에 적용될 수 있는 일반적인 물리 원칙을 배울 수 있습니다. 연구진은 텍스트 기반 지침에는 위치보다는 변화를 설명하는 상대적 움직임이 잘 작동하는 반면, 로봇 팔을 이용한 정밀한 제어에는 절대적 위치가 필수적이라는 것을 발견했습니다. 또한 인간의 영상은 모델에게 물리학의 기초를 가르치는 데는 훌륭하지만, 그 지식을 성공적인 실제 행동으로 변환하는 데는 실제 로봇의 데이터가 필수적이라는 점도 발견했습니다. 이 연구는 로봇을 훈련하는 새로운 방식을 확립하며, 고립된 단일 목적 시스템에서 벗어나 하나의 구현(embodiment)으로부터 얻은 학습이 다른 구현에 직접적인 도움을 줄 수 있는 더 통합된 접근 방식으로 나아가고 있습니다. 이 시스템이 완벽하지는 않아서 때때로 예측 오류를 범할 수도 있지만, 이는 관찰과 상상을 통해 물리적 세계를 이해하도록 기계를 가르치는 데 있어 중요한 진전을 의미합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →