LD4WAM: Learning Latent Dynamics from Human Videos for World Action Models
LD4WAM은 인간의 비디오 사전 지식과 실행 가능한 로봇 제어 사이를 연결하며, 다양한 물체, 배경 및 로봇 형태에 걸쳐 효과적으로 일반화할 수 있는 혼합 트랜스포머(mixture-of-transformers) 월드 모델을 가능하게 하는, 형태 불가지론적 동작 정렬 잠재 역학(embodiment-agnostic motion-aligned latent dynamics)을 학습하는 새로운 프레임워크입니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
로봇은 오랫동안 인간을 관찰하며 배우는 데 어려움을 겪어왔습니다. 기계는 단일 작업에 대해 정밀한 명령어를 입력받아 프로그래밍될 수 있지만, 인간의 움직임이 가진 유동적이고 불규칙한 현실을 이해하도록 가르치는 것은 거대한 도전 과제였습니다. 수년 동안 연구자들은 로봇에게 수천 시간의 영상을 입력하여, 기계가 관찰을 통해 물리 법칙과 인과관계를 스스로 학습하기를 바라며 이 간극을 메우려 노력해 왔습니다. 그러나 근본적인 문제가 지속되었습니다. 로봇이 인간의 손이 컵을 집어 올리는 것을 볼 때, 로봇은 화면상의 픽셀이 변하는 것을 볼 뿐입니다. 로봇은 손이 특정 목표를 달성하기 위해 특정한 방식으로 움직이고 있다는 사실을 본질적으로 알지 못하며, 그 시각적 관찰을 자신의 기계적 몸체를 움직이는 데 필요한 구체적인 모터 명령으로 어떻게 변환해야 하는지도 알지 못합니다. 시각적 세계는 매우 풍부한 세부 정보를 담고 있지만, 셔츠의 색상이나 테이블의 질감 같은 많은 세부 정보는 동작 자체의 역학과는 무관합니다. 로봇을 효과적으로 가르치기 위해서 과학자들은 시각적 노이즈를 제거하고 순수한 기저의 움직임을 추출하여, 인간의 영상과 로봇의 역학이 모두 이해할 수 있는 보편적인 언어를 만들어낼 방법이 필요합니다.
연구진은 로봇이 보는 것과 로봇이 하는 것 사이에 중간 이해 계층을 생성함으로써 이 문제를 해결하는 LD4WAM이라는 새로운 시스템을 개발했습니다. 다음 영상 프레임을 픽셀 단위로 예측하려고 시도하는 대신(이는 종종 이미지는 잘 예측하지만 움직임에는 서툰 모델을 초래합니다), 연구진은 시스템이 "모션 정렬 잠재 역학(motion-aligned latent dynamics)"에 집중하도록 훈련시켰습니다. 더 쉽게 말하면, 이 시스템은 물체의 외형이나 환경의 구체적인 모습은 무시하고, 한 순간과 다음 순간 사이의 본질적인 움직임 변화에 집중하는 법을 배웁니다. 이는 일종의 번역기 역할을 하여, 물체를 향해 손을 뻗는 인간의 복잡한 시각 데이터를 그 움직임의 압축된 추상적 표현으로 변환합니다. 이 표현은 로봇의 행동을 안내하는 데 사용되며, 이를 통해 로봇은 인간의 신체와 로봇 팔 사이의 차이점에 혼란을 느끼지 않고 인간의 영상으로부터 학습할 수 있습니다.
이 시스템을 구축하기 위해 연구진은 먼저 인간과 로봇의 영상을 결합한 5,000시간 이상의 방대한 데이터를 수집했습니다. 이 데이터셋에는 물건 분류와 같은 단순한 작업부터 섬세한 도구를 사용하는 복잡한 조작까지 다양한 시나리오가 포함되었습니다. 연구진은 카메라가 심하게 흔들리거나 손이 보이지 않는 클립을 엄격하게 제거하여 데이터를 정제함으로써, 시스템이 명확하고 관련성 있는 예시로부터만 학습하도록 보장했습니다. 이들의 혁신의 핵심은 데이터를 처리하는 방식에 있습니다. 연구진은 모델이 연속된 영상 프레임을 보고 위치의 변화인 "델타(delta)"를 식별하도록 훈련시켰으며, 이는 결과적으로 정지된 이미지와 움직이는 이미지 사이의 차이를 학습하게 합니다. 이러한 학습된 변화를 로봇으로부터 기록된 실제 물리적 움직임과 정렬함으로써, 인간의 세계와 물리적 세계를 연결하는 다리를 만들었습니다. 이 다리는 특정 시각적 패턴이 특정 기계적 동작에 대응한다는 것을 로봇이 이해할 수 있게 해주며, 원래 영상이 인간이든 기계이든 상관없이 작동합니다.
시스템은 두 가지 주요 단계로 작동합니다. 첫째, 특화된 모델이 영상을 분석하여 배경의 잡음이나 조명 변화와 같은 무관한 세부 사항을 버리고 이러한 움직임 패턴을 추출합니다. 둘째, 더 큰 "월드 액션 모델(world action model)"이 추출된 패턴을 사용하여 다음에 어떤 일이 일어날지 예측하고 어떤 행동을 취할지 결정합니다. 이 두 번째 모델은 유연하게 설계되었습니다. 물리 법칙이 타당한지 확인하기 위해 미래의 영상을 예측하는 동시에, 추출된 움직임 패턴을 사용하여 목표를 달성하는 데 필요한 정밀한 움직임을 결정합니다. 연구진은 두 가지 방식으로 이 접근법을 테스트했습니다: 50가지 서로 다른 작업이 포함된 고도로 현실적인 컴퓨터 시뮬레이션, 그리고 간단한 두 손가락 그리퍼와 복잡한 인간형 손을 갖춘 실제 물리적 로봇입니다. 시뮬레이션에서 이 시스템은 93.4%의 성공률을 달着하며 기존의 최첨단 방식들을 능가했습니다. 실제 로봇에 배치되었을 때, 시스템은 책상을 정리하거나 셔츠를 접는 것과 같은 길고 다단계적인 작업을 수행할 수 있었으며, 루빅스 큐브와 같은 물체를 조작하는 숙련된 손에서도 우수한 성능을 보였습니다.
가장 중요한 발견 중 หนึ่ง은 이 시스템이 한 번도 본 적 없는 상황에 일반화되는 능력이었습니다. 훈련 중에 접하지 못한 물체나 다른 배경 및 조명 환경에서 테스트했을 때도 로봇은 높은 수준의 성능을 유지했습니다. 이는 시스템이 단순히 특정 시각적 장면을 암기한 것이 아니라, 작업의 기저에 깔린 역학을 진정으로 학습했음을 시사합니다. 예를 들어, 머그컵을 새로운 위치로 옮기라는 요청을 받았을 때, 로봇은 머그컵의 모양이 다르거나 테이블의 질감이 다르더라도 이를 수행할 수 있었습니다. 연구진은 이러한 성공의 열쇠가 "모션 정렬" 방식의 훈련에 있었다는 것을 발견했습니다. 학습을 실제 물리적 움직임에 기반을 둠으로써, 시스템이 작업에 중요하지 않은 시각적 세부 사항에 과적합(over-fitting)되는 함정을 피할 수 있었던 것입니다. 결과는 이 접근 방식이 로봇이 인간의 영상 데이터를 실용적인 제어 가이드로 변환하여 학습할 수 있게 해준다는 것을 보여줍니다.
또한 이 연구는 어떤 방식이 새로운 방법만큼 효과적이지 않은지도 강조했습니다. 실제 움직임과 정렬하지 않고 픽셀 변화로부터 직접 학습하려고 했던 이전의 접근 방식들은 실행 가능한 결과를 만들어내는 데 실패하여, 로봇이 본 것을 무엇을 해야 할지로 변환하지 못하게 만들었습니다. 마찬가지로, 인간의 신체 부위를 로봇의 관절에 직접 매칭하는 데 크게 의존하는 방식은 로봇이 손 대신 그리퍼를 사용하는 등 물리적 구조가 다를 때 어려움을 겪었습니다. 새로운 시스템은 행위자의 구체적인 해부학적 구조가 아닌 움직임의 추상적인 역학에 집중함으로써 이러한 함정을 피합니다. 시스템이 배경 질감이 급격하게 변하는 상황에서 일부 한계를 보이기도 했지만, 여전히 이러한 까다로운 조건에서도 다른 모델들을 크게 앞질렀으며, 이는 모션 정렬 접근 방식이 로봇 학습의 견고한 토대를 제공함을 입증했습니다.
결국, 이 작업은 로봇이 관찰을 통해 학습하는 방식의 변화를 의미합니다. 행위를 수행하는 특정 신체와 무관한 표현을 생성함으로써, 연구진은 로봇이 인간의 영상을 통해 학습하고 그 지식을 자신의 독특한 기계적 형태에 적용할 수 있음을 보여주었습니다. 이 시스템은 로봇이 인간의 영상을 활용하기 위해 인간과 유사한 신체를 가질 필요가 없으며, 오직 동작 뒤에 숨겨진 의도와 움직임을 이해하는 방법만을 필요로 합니다. 2억 7천만 프레임 이상의 데이터셋과 실제 하드웨어에서의 성공적인 테스트를 통해, 연구진은 이 방법이 단순한 이론적 가능성이 아니라 더 유능하고 적응력 있는 로봇을 만들기 위한 실용적인 도구임을 입증했습니다. 방대한 양의 인간 데이터를 활용할 수 있는 능력은, 로봇이 마주칠 수 있는 모든 새로운 작업마다 비용이 많이 들고 시간이 오래 걸리는 시연을 할 필요 없이 다양한 작업을 학습할 수 있는 미래의 문을 열어줍니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.