← 최신 논문
💻 computer science

Open-AoE: An Open Egocentric Manipulation Dataset and Toolchain for Embodied Learning

Open-AoE는 2,000시간의 구조화된 조작 데이터와 더불어 다양한 로봇 학습 모델을 처리, 리타겟팅 및 학습시키기 위한 포괄적인 파이프라인을 제공함으로써, 확장 가능한 스마트폰 기반 1인칭 시점 비디오 캡처와 체화된 AI(embodied AI) 훈련 사이의 간극을 메우는 개방형 커뮤니티 주도 데이터셋이자 툴체인입니다.

원저자: Zishuo Li, Bowen Yang, Changtao Miao, Kai Zhu, Hao Chen, Qingze Guan, Zhengxing Wu, Wanke Zhan, Yang Sun, Zhiyi Huang, Zitong Shan, Zhenchao Jin, Jiadong Hong, Taowen Wang, Yushi Feng, You Liu, Yibo W
게시일 2026-07-21
📖 3 분 읽기☕ 가벼운 읽기

원저자: Zishuo Li, Bowen Yang, Changtao Miao, Kai Zhu, Hao Chen, Qingze Guan, Zhengxing Wu, Wanke Zhan, Yang Sun, Zhiyi Huang, Zitong Shan, Zhenchao Jin, Jiadong Hong, Taowen Wang, Yushi Feng, You Liu, Yibo Wang, Yifan Yang, Zhaowen Zhou, Man Luo, Hao Cheng, Bo Zhang, Jianshu Li, Jiansheng Cai, Guocai Yao, Jize Zhang, Chenhao Lin, Renjing Xu, Lequan Yu, Chao Shen, Chunhua Shen, Zhe Li

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

로봇에게 샌드위치를 만드는 법, 새는 수도꼭지를 고치는 법, 또는 옷을 접는 법을 가르친다고 상상해 보십시오. 단순히 도서관에 있는 교과서들을 입력해 주는 것만으로는 부족합니다. 로봇은 인간이 이 일들을 어떻게 하는지 직접 '보고' '느껴야' 합니다. 이것이 바로 컴퓨터가 우리처럼 물리적 세계와 상호작용하며 배우는 **체화된 지능(embodied intelligence)**의 세계입니다. 하지만 여기에는 함정이 있습니다. 로봇은 우리와 세상을 다르게 봅니다. 만약 선반 위에 놓인 카메라로 찍은 영상(즉, "3인칭" 시점)을 녹화한다면, 로봇은 방 전체를 볼 수는 있지만 미세한 손가락의 움직임은 놓치게 됩니다. 만약 로봇 자신의 눈에서 본 영상("1인칭" 시점)을 녹화한다면, 올바른 관점을 얻을 수는 있지만, 이를 학습시키기 위한 고품질의 데이터를 충분히 확보하는 것이 매우 어렵고 비용이 많이 듭니다. 보통은 사람의 머리에 특수하고 비싼 카메라를 장착해야 하거나, 컴퓨터에게 지금 무슨 일이 일어나고 있는지 알려주기 위해 모든 영상의 매 초마다 수동으로 라벨을 붙여야 합니다. 이러한 "인간의 눈" 영상을 담은 거대하고 사용하기 쉬운 라이브러리가 없다면, 로봇은 일상생활의 미묘한 기술들을 배우는 데 어려움을 겪습니다.

이 지점에서 Open-AoE라는 새로운 프로젝트가 등장하여, 로봇을 가르치기 위한 거대한 오픈 소스 툴킷 역할을 수행합니다. 연구진은 누구나 이미 주머니 속에 완벽한 카메라를 가지고 있다는 사실을 깨달았습니다. 바로 스마트폰입니다. 그래서 그들은 수천 명의 평범한 사람들이 데이터 수집가가 될 수 있도록 시스템을 구축했습니다. 그들은 사람들이 자신의 스마트폰을 사용하여 커피를 따르거나 키보드를 치는 것과 같은 일상적인 과업을 수행하는 영상을 기록하는 앱을 만들었습니다. 하지만 그들은 단순히 녹화하는 데 그치지 않았습니다. 그들은 가공되지 않은 무질서한 영상들을 가져와서, 로봇이 학습할 수 있는 매우 체계적인 레슨으로 바꾸어 놓는 거대한 클라우드 기반 자동화 공장을 구축했습니다.

연구팀은 500명 이상의 서로 다른 사람들400종 이상의 서로 다른 스마트폰을 사용하여 수집한, 무려 2,000시간 분량의 영상을 모았습니다. 이는 엄청난 양입니다! 영상은 주방에서 사무실에 이르기까지 400개 이상의 서로 다른 장면8,000개 이상의 서로 다른 과업을 다룹니다. 이 프로젝트가 특별한 이유는 단순히 양 때문이 아니라, 시스템이 영상에 더하는 "마법" 때문입니다. 첨단 AI를 사용하여, 시스템은 손이 정확히 어디에서 움직이는지(손가락의 21개 관절까지), 카메라가 어디로 움직이는지 파악하고, 영상을 의미 있는 아주 작은 동작 단위로 나눕니다. 심지어 무슨 일이 일어나고 있는지에 대한 텍스트 설명까지 작성합니다.

이렇게 생각해 보십시오. 이전에는 로봇을 가르치고 싶다면 영화 제작팀을 고용하고, 비싼 장비를 사고, 영상 편집에 수년을 소비해야 했습니다. Open-AoE는 마치 모두에게 스마트폰을 쥐여주며 "당신의 하루를 촬영하세요"라고 말한 뒤, 마법 같은 로봇 편집기가 그 영상들을 로봇이 학습하기에 완벽한 교과서로 즉시 변환해 주는 것과 같습니다. 논문은 이 방식이 효과적임을 보여주며, 로봇이 단순히 무엇을 해야 하는지뿐만 아니라, 그 일을 하기 위해 손과 눈을 어떻게 움직여야 하는지 이해할 수 있도록 돕는 풍부하고 다양한 데이터셋을 제공한다고 설명합니다.

또한 연구진은 과학자들이 이 데이터를 가져와 멋진 일들을 할 수 있는 도구 세트("툴체인")를 구축했습니다. 과학자들은 이 데이터를 통해 손의 3D 움직임을 시각화하거나, 인간의 움직임을 다른 로봇의 몸에 맞게 "리타겟팅"(예: 인간의 팔을 로봇 팔으로 변환)하고, 다양한 유형의 AI 모델을 훈련할 수 있습니다. 그들은 이렇게 다양하고 스마트폰 기반의 데이터를 사용함으로써, 백만 달러 규모의 장비 없이도 로봇이 실제 세계로부터 배울 수 있는 훨씬 강력한 토대를 만들 수 있다는 것을 발견했습니다. 이는 로봇이 우리의 일상적인 집안일을 실제로 도울 수 있게 만드는 큰 진전이며, 이제 로봇은 학습할 수 있는 인간 경험의 거대한 오픈 라이브러리를 갖게 되었기 때문입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →