ActiveGlasses: Learning Manipulation with Active Vision from Ego-centric Human Demonstration
이 논문은 스마트 글라스에 장착된 스테레오 카메라를 통해 인간이 직접 수행하는 조작 및 능동적 시야 데이터를 수집하고, 이를 로봇의 6 자유도 팔에 장착된 동일한 센서로 제로샷 전이하여 복잡한 조작 과제를 성공적으로 수행하는 'ActiveGlasses' 시스템을 제안합니다.
원저자:Yanwen Zou, Chenyang Shi, Wenye Yu, Han Xue, Jun Lv, Ye Pan, Chuan Wen, Cewu Lu
기존 방식: 로봇 팔을 조종하려면 사람이 무거운 원격 조종기나 특수 장비를 들고 있어야 했습니다. 마치 마라톤 선수가 무거운 철제 갑옷을 입고 달리는 것과 비슷해요. 피곤해서 오래할 수 없고, 자연스러운 손놀림도 나오지 않죠.
이 문제의 해결책: '액티브 글래스'는 **맨손 (Bare-hand)**으로 일을 하게 해줍니다. 사람이 평소에 물건을 집거나 옮길 때처럼, 그냥 손으로 자연스럽게 일을 하면 됩니다. 로봇은 그 모습을 그대로 따라 배우는 거죠.
눈이 고정되어 있었다 (Perception):
기존 방식: 로봇의 카메라는 손목에 붙어 있거나, 방 구석에 고정되어 있었습니다. 손목 카메라는 눈이 손에 묶여 있는 상태라, 손이 움직이지 않으면 시야도 움직이지 않아요. 물체가 가려지면 (예: 책장 뒤쪽) 절대 볼 수 없습니다.
이 문제의 해결책: 인간은 물체가 가려지면 고개를 돌리거나 몸을 숙여 구경을 하죠. 이 시스템은 스마트 안경에 카메라를 달아서, 사람이 고개를 움직일 때 로봇도 똑같이 고개를 돌리게 합니다. 이를 **'액티브 비전 (Active Vision, 능동적 시야)'**이라고 합니다.
🧠 2. 해결책: "안경 쓴 로봇이 사람을 따라 한다"
이 시스템은 크게 두 단계로 작동합니다.
1 단계: 데이터 수집 (사람이 가르치는 시간)
상황: 사람이 스마트 안경 (카메라 부착) 을 쓰고 책상 앞에서 책을 정리하거나 빵을 토스터에 넣는 일을 합니다.
특징:
맨손 작업: 아무런 장갑이나 조종기 없이 자연스러운 손동작을 합니다.
고개 움직임 기록: 안경이 사람의 **눈동자 움직임과 고개 회전 (6 자유도)**을 정밀하게 기록합니다. "아, 사람이 이 물건을 볼 때 고개를 이렇게 돌렸구나"라는 데이터를 모으는 거죠.
2 단계: 로봇 실행 (로봇이 따라 하는 시간)
상황: 로봇이 그 데이터를 바탕으로 똑같은 일을 합니다.
마법 같은 부분 (제로 샷 전이):
사람의 손은 5 개 손가락이지만, 로봇은 2 개 손가락 (그리퍼) 일 수도 있습니다. 보통 이걸 맞추려면 복잡한 재설정이 필요하지만, 이 시스템은 물체 자체의 움직임을 예측합니다.
비유: 요리사가 "소스 냄비를 왼쪽으로 10cm 옮기세요"라고 지시하는 것과 같습니다. 요리사 (사람) 가 손가락을 어떻게 움직이든, 로봇은 **냄비 (물체)**가 어디로 가야 하는지만 알면 됩니다. 그래서 사람과 로봇의 몸체 (Embodiment) 가 달라도 한 번도 가르치지 않아도 (Zero-shot) 바로 따라 할 수 있습니다.
액티브 비전 구현: 로봇의 카메라는 고정된 게 아니라, **별도의 로봇 팔 (머리 역할)**에 달려 있습니다. 사람이 안경으로 고개를 돌렸던 대로, 이 로봇 팔이 카메라를 들고 고개를 돌리며 가려진 물체를 찾아냅니다.
🎯 3. 왜 이 방식이 더 잘할까? (실제 실험 결과)
연구팀은 세 가지 어려운 미션을 테스트했습니다.
책장 정리: 책장 옆벽에 가려진 빈 공간을 찾아 책을 넣기.
물 따르기: 스크린 뒤에 가려진 컵을 찾아 물병으로 물 따르기.
빵 굽기: 토스터 구멍이 처음엔 안 보일 때, 고개를 돌려 구멍을 찾은 뒤 빵 넣기.
결과:
기존 방식 (고정 카메라): 가려진 물체를 못 보고 실패했습니다.
액티브 글래스: 사람이 고개를 돌리듯 로봇도 고개를 돌려 가려진 물체를 발견하고 성공했습니다.
성공률: 기존 로봇 학습 모델 (Pi0.5) 보다 30~35% 더 높은 성공률을 보였습니다.
💡 4. 핵심 요약 (한 줄 정리)
"로봇에게 일을 가르칠 때, 무거운 장비를 들고 조종하는 대신 사람이 맨손으로 자연스럽게 일을 하고, 안경으로 고개 움직임을 기록해 주면, 로봇은 그 '눈의 움직임'까지 따라 하며 가려진 물체도 찾아내는 똑똑한 일을 해냅니다."
이 기술은 로봇이 인간의 직관적인 행동과 시야를 완벽하게 모방할 수 있게 하여, 앞으로 우리 집이나 공장에서 더 자연스럽게 일할 수 있는 로봇을 만드는 중요한 첫걸음이 될 것입니다.
1. 문제 정의 (Problem Statement)
기존의 로봇 조작 (Manipulation) 학습을 위한 대규모 데이터 수집은 다음과 같은 심각한 한계점을 가지고 있습니다:
비효율적인 데이터 수집: 기존 파이프라인은 종종 특수한 핸드헬드 장치나 원격 조종 (Teleoperation) 장비를 사용하여 인간과 로봇의 신체적 차이 (Embodiment Gap) 를 극복하려 합니다. 이는 운영자의 부담을 증가시키고 확장성을 제한합니다.
자연스러운 행동의 부재: 이러한 방식은 인간의 자연스러운 운동 감각 (Kinematics) 과 조작 행동을 왜곡시킵니다.
수동적 시야 (Passive Vision) 의 한계: 기존 시스템은 고정된 3 인칭 카메라나 손목에 장착된 카메라를 주로 사용합니다. 손목 카메라는 수동적 (Passive) 으로 손의 움직임에만 종속되어, 인간이 장애물을 피하거나 정밀한 작업을 위해 고개를 돌리며 능동적으로 시야를 조절하는 (Active Vision) 행동을 포착하지 못합니다.
배포의 어려움: 인간 데이터 (맨손, 고개 움직임) 를 로봇 (그립퍼, 고정된 시야) 에 직접 적용할 때 발생하는 형태적 차이 (Morphological Gap) 로 인해 제로샷 (Zero-shot) 전이가 어렵습니다.
2. 방법론 (Methodology)
저자들은 ActiveGlasses라는 시스템을 제안하여 위 문제들을 해결합니다. 이 시스템은 인간 중심 (Ego-centric) 의 능동적 시야를 가진 데이터 수집과 로봇 배포를 가능하게 합니다.
A. 하드웨어 및 인터페이스 설계
웨어러블 장치: 스마트 안경 (XREAL Air 2 Ultra) 에 스테레오 카메라 (ZED Mini) 를 장착합니다.
데이터 수집: 운영자는 장비를 착용하고 맨손 (Bare-hand) 으로 자연스러운 작업을 수행합니다. 안경은 인간의 고개 움직임 (6-DoF 헤더 트래젝토리) 과 스테레오 영상을 동시에 기록합니다.
배포 (Deployment): 수집된 데이터는 로봇에 적용됩니다.
조작 팔: 예측된 물체 궤적을 실행합니다.
지각 팔 (Perception Arm): 인간의 고개 움직임을 모방하는 6-DoF 로봇 팔에 동일한 카메라를 장착하여 능동적 시야를 재현합니다.
B. 데이터 처리 파이프라인
3D 포인트 클라우드 생성: 스테레오 영상을 기반으로 FoundationStereo 를 사용하여 깊이 맵 (Depth Map) 을 추정하고 3D 포인트 클라우드를 재구성합니다.
마스크 생성: Grounded-SAM 과 SAM2 를 사용하여 인간의 손과 조작 대상 물체를 분할 (Segmentation) 하여 포인트 클라우드에서 불필요한 노이즈를 제거하고 물체 포즈를 추정합니다.
좌표계 정합 (Calibration): 테이블 위의 기준 구 (Spheres) 를 사용하여 카메라 좌표계를 세계 좌표계 (World Frame) 로 변환합니다.
C. 정책 알고리즘 (Object-Centric 3D Policy)
입력: 세계 좌표계 기준의 3D 포인트 클라우드.
출력: 두 개의 별도 확산 헤드 (Diffusion Heads) 를 사용하여 다음 두 가지를 동시에 예측합니다.
조작 팔 행동: 작업 공간 (Task Space) 에서의 물체의 6-DoF 궤적 (절대 좌표).
지각 팔 행동: 인간의 고개 움직임에 해당하는 상대적 고개 궤적.
핵심 설계 철학:
객체 중심 (Object-Centric): 인간의 손 모양이나 로봇의 관절 각도를 직접 매핑하는 대신, '물체의 궤적'을 예측하여 다양한 로봇 플랫폼 간 전이를 가능하게 합니다.
조건 입력 제거: 현재 물체 포즈를 추가 조건으로 넣지 않아, 모델이 시각적 입력을 통해 장면 변화를 추론하도록 유도합니다 (과적합 방지).
3. 주요 기여 (Key Contributions)
확장 가능한 맨손 데이터 수집: 핸드헬드 장비나 원격 조종 없이 운영자가 맨손으로 자연스러운 데이터를 수집할 수 있게 하여 물리적 부담을 줄이고 데이터 수집 효율을 극대화했습니다.
능동적 시야 전용 입력 (Active-Vision-Only): 고정된 외부 카메라나 손목 카메라 없이, 오직 하나의 능동적 시야 카메라 (고개 움직임 포함) 만으로 학습 및 배포를 수행하여 가려짐 (Occlusion) 이나 원거리 정밀 작업을 해결했습니다.
크로스 임버디먼트 (Cross-Embodiment) 제로샷 전이: 인간과 로봇의 형태적 차이를 극복하기 위해 '물체 궤적'을 기반으로 한 3D 정책을 설계하여, 별도의 미세 조정 (Fine-tuning) 없이 서로 다른 로봇 플랫폼 (UR5, Flexiv 등) 에 제로샷으로 배포할 수 있음을 입증했습니다.
4. 실험 결과 (Results)
저자들은 책 꽂기 (Book Placement), 가려진 먼 곳 물 붓기 (Occluded Distant Water Pouring), 빵 넣기 (Bread Insertion) 의 3 가지 어려운 과제를 통해 시스템을 평가했습니다.
성능 비교:
ActiveGlasses 는 동일한 하드웨어 설정 (단일 능동 카메라) 에서 기존 베이스라인인 Pi0.5보다 성공률이 35%, 25%, 30% 각각 향상되었습니다.
능동 시야를 제거한 변형 모델 (w/o active vision) 에 비해 가려짐이 있는 환경에서 훨씬 우수한 성능을 보였습니다.
정책 설계 분석 (Ablation Study):
절대 좌표 vs 상대 좌표: 물체 궤적을 절대 좌표 (Absolute) 로 예측하는 것이 상대 좌표보다 성능이 우수했습니다. 상대 좌표는 실시간 물체 포즈 추정이 필요하여 오차 누적과 계산 부하를 유발합니다.
현재 물체 포즈 조건: 현재 물체 포즈를 추가 조건으로 입력하면 모델이 시각적 입력을 무시하고 고정된 궤적 패턴을 학습하여 성능이 저하되었습니다.
크로스 플랫폼 전이: Flexiv Rizon4 와 UR5 로봇 모두에서 성공적인 제로샷 전이가 확인되었으며, 작업 공간이 더 작은 UR5 에서도 초기 단계에서는 유사한 성능을 보였습니다.
5. 의의 및 결론 (Significance)
데이터 수집 패러다임의 전환: 로봇 학습을 위한 데이터 수집을 위해 고가의 장비나 복잡한 원격 조종이 아닌, 인간의 자연스러운 행동 (맨손 + 고개 움직임) 을 그대로 포착하는 새로운 접근법을 제시했습니다.
능동적 시야의 중요성 증명: 고정된 시야만으로는 해결하기 어려운 가려짐 (Occlusion) 과 정밀 조작 문제를 해결하기 위해, 로봇이 인간의 고개 움직임을 모방하여 시야를 능동적으로 조절하는 것이 필수적임을 입증했습니다.
실용적 확장성: 객체 중심 (Object-centric) 3D 정책을 통해 다양한 로봇 하드웨어에 대한 제로샷 배포를 가능하게 함으로써, 로봇 학습의 확장성과 실용성을 크게 높였습니다.
이 연구는 로봇이 인간과 유사한 지각 - 조작 (Perception-Manipulation) 행동을 학습하고, 복잡한 실세계 환경에서 유연하게 작동할 수 있는 강력한 프레임워크를 제공합니다.