← 최신 논문
💻 computer science

AnyWorld: Factorized Egocentric World Models for Cross-Embodiment Generalization

이 논문은 단일 인간 1인칭 시점 비디오로부터 동작, 카메라, 그리고 형태(embodiment) 요소를 분리함으로써 다양하고 교차적인 로봇 경험을 합성하는 인수형 세계 모델링 프레임框架인 AnyWorld를 소개하며, 이를 통해 시뮬레이션 및 실제 휴머노이드 로봇 모두에서 조작 정책을 유의미하게 개선하는 제어 가능한 데이터 생성을 가능하게 한다.

원저자: Cheng Chen, Jerry Bai, Jiacheng Wei, Boyu Chen, Xiaoji Zheng, Fan Wu, Minghao Yang, Tianrun Chen, Ruibo Li, Xiaoyu Yue, Xiaoyang Guo, Yixiao Ge, Guosheng Lin, Fayao Liu

게시일 2026-09-02
📖 4 분 읽기☕ 가벼운 읽기

원저자: Cheng Chen, Jerry Bai, Jiacheng Wei, Boyu Chen, Xiaoji Zheng, Fan Wu, Minghao Yang, Tianrun Chen, Ruibo Li, Xiaoyu Yue, Xiaoyang Guo, Yixiao Ge, Guosheng Lin, Fayao Liu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

로봇들은 단순히 직선으로 움직이는 것을 넘어, 물체를 집어 올리고, 문을 열고, 부품을 조립하는 등 주변 세계를 조작하는 법을 배우고 있습니다. 이러한 기술을 배우기 위해 로봇에게는 경험이 필요합니다. 로봇은 손이 컵을 향해 어떻게 뻗는지, 그리퍼가 스펀지를 어떻게 움켜쥐는지, 도구가 테이블 위를 어떻게 미끄러지는지에 대한 수천 가지의 사례를 보아야 합니다. 오랫동안 이 경험을 얻는 유일한 방법은 로봇이 스스로 그 과업을 반복해서 수행하게 하는 것이었습니다. 하지만 이는 느리고 비용이 많이 들며, 실험실이 보유할 수 있는 로봇의 수와 고장 없이 가동할 수 있는 시간이라는 한계에 부딪힙니다.

예상치 못한 곳에서 유망한 대안이 등장했습니다. 바로 인간의 영상입니다. 매일 사람들은 요리하고, 청소하고, 무언가를 만드는 자신의 모습을 영상으로 기록합니다. 이 영상들은 로봇이 배울 수 있는 풍부한 물리적 상호작용으로 가득 차 있습니다. 그러나 여기에는 중대한 문제가 있습니다. 인간이 요리하는 영상은 인간의 손, 인간의 몸, 그리고 인간의 시점을 보여줍니다. 로봇은 인간의 몸을 가지고 있지 않으며, 인간의 머리 위치에서 세상을 보지 않습니다. 만약 로봇이 인간의 영상을 그대로 복제하려고 시도한다면, 인간의 팔은 더 길거나, 로브의 카메라는 다른 위치에 있거나, 로봇의 그리퍼가 다르게 작동하기 때문에 실패할 수 있습니다. 과학자들의 과제는 인간 영상에서 일어나는 유용한 '이야기'를 추출하여, 로봇에게 적합한 방식으로 다시 들려주는 방법을 찾아내는 것입니다.

연구진은 이 문제를 해결하기 위해 '애니월드(AnyWorld)'라고 불리는 새로운 시스템을 개발했습니다. 이 시스템은 인간의 영상을 그대로 복사하는 대신, 영상을 세 가지 별개의 성분으로 분해합니다: 수행되는 동작(action), 카메라의 움직임(camera movement), 그리고 작업을 수행하는 몸과 장면(body and scene)입니다. 동작을 사건이 일어나는 '대본'으로, 카메라 움직임을 '촬영 디렉팅'으로, 몸과 장면을 '배우와 세트'로 생각해보십시오. 이 요소들을 분리함으로써, 연구진은 인간이 과업을 수행하는 단 하나의 영상을 가져와 이 성분들을 재조합하여 완전히 새로운 영상을 만들어낼 수 있습니다. 이 새로운 영상에서 '배우'는 로봇이고, '세트'는 로봇의 환경이며, '카메라'는 로봇의 눈이지만, 동작의 '대본'은 동일하게 유지됩니다.

연구진은 사람들이 사물과 상호작용하는 방대한 양의 인간 영상 모음집을 사용하여 이 시스템을 학습시켰습니다. 그들은 모델이 과업의 움직임과 그것을 수행하는 특정 신체의 차이점을 이해하도록 가르쳤습니다. 모델이 이를 학습하자, 연구진은 인간 영상을 입력값으로 넣어 동일한 과업을 수행하는 로봇 버전의 영상을 생성하도록 요청하며 테스트를 진행했습니다. 이 과정에서 인간과 로봇이 동일한 과업을 나란히 수행하는 영상은 전혀 필요하지 않았습니다. 시스템은 단순히 인간의 움직임과 카메라의 경로를 가져온 뒤, 로봇의 몸과 로봇의 장면을 끼워 넣었습니다. 그 결과, 해당 기계 특유의 관점과 물리적 제약 조건을 완벽히 갖춘 채 로봇이 과업을 수행하는 듯한 영상이 만들어졌습니다.

연구진은 몸, 카메라 각도, 그리고 장면을 변경하는 능력을 테스트했습니다. 그들은 시스템이 인간 영상을 가져와서 'RoboCasa GR1'이라는 이름의 로봇이 과업을 수행하는 버전과, 'IRON'이라는 다른 로봇이 수행하는 버전을 생성할 수 있음을 보여주었습니다. 또한 로봇과 과업은 동일하게 유지하면서 카메라 각도만 바꾸어 다른 관점에서의 뷰를 만들어낼 수 있음을 보여주었습니다. 결정적으로, 시스템은 상호작용의 논리를 보존했습니다. 만약 원본 영상 속의 인간이 컵을 집어 선반으로 옮겼다면, 생성된 로봇 영상에서도 로봇이 자신의 몸 형태와 카메라 위치에 맞게 조정된 상태로 정확히 동일한 일련의 움직임을 수행했습니다.

이 생성된 영상들이 실제로 유용한지 증명하기 위해, 연구진은 이를 실제 로봇을 훈련시키는 데 사용했습니다. 그들은 표준적인 로봇 학습 시스템을 가져와 애니월드가 만든 영상들로 추가 학습을 시켰습니다. 이 테스트는 로봇 팔 시뮬레이션과 실제 물리적인 휴머노이드 로봇을 대상으로 진행되었습니다. 시뮬레이션에서 로봇의 물체 집기 및 놓기 성공률은 생성된 데이터를 통한 훈련 후 유의미하게 향상되었습니다. 실제 로봇에서의 개선 효과는 더욱 극적이었습니다. 바나나를 잡는 데 성공률이 20%에 불고했던 로봇이 인간-로봇 변환 영상을 통해 훈련받은 후 55%의 성공률로 급증했습니다. 이는 시스템이 단순히 예쁜 그림을 만드는 것이 아니라, 로봇이 더 잘 배울 수 있도록 돕는 유효한 훈련 데이터를 생성하고 있음을 보여주었습니다.

연구진은 정확히 왜 이런 결과가 나왔는지도 조사했습니다. 그들은 단순히 로봇에게 어떤 동작을 취하라고 지시하는 것만으로 충분한지, 아니면 시각적인 장면을 보는 것도 필수적인지 알고 싶었습니다. 그들은 로봇에게 올바른 동작 명령은 주되, 수정되지 않은 원래의 로봇 영상으로부터 얻은 시각적 훈련 데이터를 그대로 유지한 채 테스트를 진행했습니다. 이 방식은 로봇이 특정 지시(예를 들어, 오른쪽 바나나 대신 왼쪽 바나나를 선택하는 것)를 따르는 법을 가르치는 데 실패했습니다. 그러나 전체 시스템을 사용하여 새로운 시각적 장면과 올바른 동작을 모두 생성했을 때는, 로봇이 지시를 안정적으로 따르는 법을 배웠습니다. 이는 시각적 재구성이 필수적임을 입증했습니다. 로봇이 동작을 적용하는 법을 이해하려면 자신의 관점에서 본 세상을 볼 필요가 있었던 것입니다.

이 연구는 상호작용을 별개의 요소로 분해하는 이 방법이 단 한 번의 인간 경험을 여러 번 재사용할 수 있게 해준다는 점을 시사합니다. 한때 인간의 몸과 인간의 카메라에 국한되었던 인간 영상이 이제는 다양한 유형의 로봇과 다양한 환경을 위한 훈련 데이터의 원천이 될 수 있습니다. 연구진은 이 시스템이 강력하지만 한계도 있다고 언급했습니다. 이 시스템은 아직 촉각의 느낌이나 부드러운 물체를 쥐는 데 필요한 정확한 힘을 포착할 수는 없는데, 이는 영상 생성만으로는 제공할 수 없는 물리적 센서가 필요하기 때문입니다. 또한, 시스템은 인간의 움직임을 명확하게 추적할 수 있어야 합니다. 영상이 너무 흔들리거나 사람이 물체 뒤에 숨겨져 있다면 시스템은 어려움을 겪습니다.

이러한 제한 사항에도 불구하고, 이 연구는 로봇 학습을 위한 새로운 길을 제시합니다. 이는 인터넷에 존재하는 방대한 인간 영상 라이브러리가, 몸과 관점의 차이 때문에 로봇에게 활용하기 어려웠던 문제를 해결할 수 있음을 시사합니다. 동작을 행위자로부터 분리하는 모델을 사용함으로써, 과학자들은 모든 과업을 모든 종류의 로봇으로 일일이 녹화할 필요 없이 인간의 경험을 로봇의 경험으로 전환할 수 있습니다. 이는 로봇이 인간의 일상생활이라는 풍부한 데이터를 기초 삼아 훨씬 더 빠르게 복잡한 기술을 습득할 수 있게 해줄 것입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →