상상해 보세요. 당신이 요리사 (로봇) 이고, 옆에 친구 (사람) 가 요리를 하다가 찍은 영상을 보고 배우고 있다고 가정해 봅시다.
1. 문제점: "친구의 시선을 그대로 따라가면 실패한다"
친구가 요리를 할 때, 그는 자신의 눈으로 재료를 보고 손으로 만집니다.
친구의 행동: 친구는 재료를 잡을 때 고개를 푹 숙이거나, 갑자기 눈을 크게 뜨거나 (눈이 빠르게 움직이는 '사카드' 현상), 재료가 가려지면 고개를 살짝 돌립니다.
로봇의 딜레마: 로봇이 이 영상을 보고 "친구처럼 고개를 움직여야지!"라고 따라 한다면? 로봇은 불필요하게 고개를 흔들거나, 재료가 가려진 상태에서도 고개를 돌리지 못해 재료를 놓쳐버릴 수 있습니다.
왜? 사람의 눈은 뇌와 목 근육이 복잡하게 연결되어 있지만, 로봇 카메라는 고정되어 있거나 기계적으로 움직이기 때문입니다. 사람의 '시선'을 그대로 복사하는 것은 로봇에게는 오히려 방해가 될 수 있습니다.
2. 해결책: "스마트한 카메라 조종사" (EgoAVFlow)
이 연구는 로봇에게 **"친구의 손동작은 배우되, 카메라 위치는 스스로 판단해라"**라고 가르칩니다.
3D Flow (3 차원 흐름):
기존 방법은 2D 영상 (평면 사진) 을 보며 "저기 손이 움직였네"라고 추측합니다.
이 연구는 3D Flow라는 기술을 씁니다. 마치 **공중에 떠 있는 수많은 점들 (입자)**이 움직이는 흐름을 3 차원 공간에서 추적하는 것과 같습니다.
비유: 요리사가 재료를 잡을 때, 로봇은 "재료가 앞으로 10cm 이동할 거야"라고 3 차원 공간에서 미래의 움직임을 예측합니다.
가시성 (Visibility) 을 위한 카메라 조절:
로봇은 "내가 재료를 잡으려고 하면, 테이블이 재료를 가릴까? 내 팔이 시야를 가릴까?"를 미리 계산합니다.
핵심 전략: 로봇은 친구가 찍은 영상 속 카메라 위치를 그대로 따라가는 게 아니라, **"내가 재료를 가장 잘 볼 수 있는 위치로 카메라를 움직여야겠다"**라고 판단합니다.
비유: 요리사가 재료를 잡으려 할 때, 친구는 고개를 숙였지만 로봇은 "아, 고개를 숙이면 재료가 가려지겠네. 대신 옆으로 살짝 비켜서 위에서 내려다봐야겠다"라고 스스로 결정합니다.
3. 어떻게 작동할까? (마법 같은 과정)
이 시스템은 **확산 모델 (Diffusion Model)**이라는 AI 기술을 사용합니다.
예측: 로봇은 "내가 앞으로 2 초 동안 이렇게 움직이면, 재료가 이렇게 움직일 거야"라고 시뮬레이션합니다.
검토: "그런데 내가 이 위치에서 보면 재료가 가려지는데?"라고 스스로 물어봅니다.
수정 (보상 최대화): "가려지면 안 되니까, 카메라를 조금 더 왼쪽으로 움직여서 재료가 잘 보이게 해보자!"라고 실시간으로 카메라 각도를 수정합니다.
실행: 이렇게 수정된 각도로 로봇이 재료를 잡습니다.
🏆 결과: 왜 이것이 중요한가요?
연구팀은 실제 로봇을 이용해 실험했습니다.
기존 방법 (친구의 시선 그대로 따라가기): 재료가 가려지거나 시야에서 사라져서 실패율이 높았습니다.
EgoAVFlow (스스로 시야 확보): 재료가 가려지지 않도록 카메라를 움직이며, 성공률이 기존 방법보다 2 배 이상 높았습니다.
💡 한 줄 요약
**"로봇이 사람의 영상을 보고 배우되, 사람의 '고개 움직임'을 맹목적으로 따라 하는 게 아니라, '무엇을 볼 것인가'를 스스로 판단하여 가장 잘 보이는 위치로 카메라를 움직여 작업을 성공시키는 똑똑한 로봇 기술"**입니다.
이 기술은 로봇이 사람의 눈 (카메라) 을 단순히 복사하는 것을 넘어, 자신의 몸 (로봇 팔) 과 환경 (테이블, 장애물) 을 고려하여 스스로 최적의 시야를 확보하는 능력을 갖게 해줍니다. 앞으로 로봇이 우리 집이나 공장에서 더 자연스럽게 일할 수 있는 중요한 발걸음입니다.
1. 문제 정의 (Problem)
로봇 조작 (Manipulation) 을 학습하기 위해 인간의 시점 (Egocentric) 비디오를 활용하는 것은 확장 가능한 데이터 소스로 각광받고 있습니다. 그러나 인간 비디오를 로봇에 직접 적용할 때 다음과 같은 근본적인 한계가 존재합니다.
능동적 시점 제어의 부재: 로봇은 작업을 수행하는 동안 중요한 정보를 계속 볼 수 있도록 카메라 시점을 능동적으로 조절해야 합니다. 하지만 인간은 시선 고정 (Gaze stabilization) 이나 빠른 안구 운동 (Saccades) 등 인간 고유의 생리적 특성 (Prior) 을 따르기 때문에, 로봇이 인간의 카메라 움직임을 단순히 모방 (Imitation) 하는 것은 최적의 시야를 보장하지 못합니다.
시각적 불일치: 인간의 시점 데이터는 로봇의 작업 공간 (Workspace) 제약이나 기구학적 특성과 맞지 않아, 단순히 시점을 따라가는 것만으로는 작업 실패 (Object loss) 로 이어질 수 있습니다.
3D 정보의 부족: 기존 2D 시각 특징은 시점과 결합되어 있어, 미래의 3D 공간에서 물체가 어디에 위치할지 예측하고 가시성 (Visibility) 을 계산하는 데 적합하지 않습니다.
따라서, 로봇 데이터 없이 인간 비디오만으로 학습하면서도, 작업 수행 중 가시성을 유지하기 위해 시점을 능동적으로 조절할 수 있는 정책을 개발하는 것이 핵심 과제입니다.
2. 방법론 (Methodology)
저자들은 EgoAVFlow라는 프레임워크를 제안하며, 이는 공유된 3D Flow(3 차원 흐름) 표현을 기반으로 합니다.
A. 핵심 표현: 3D Flow
인간 비디오에서 2D 픽셀 추적 (CoTracker3) 과 깊이 정보를 결합하여 3D 공간에서의 물체 및 장면 요소의 운동을 나타내는 3D Flow를 생성합니다.
이 표현은 시점에 의존적인 외관 (Appearance) 을 배제하고 기하학적 운동 정보만 남기므로, 인간과 로봇의 embodiment(구현체) 차이를 극복하고 제로샷 (Zero-shot) 전이가 가능합니다.
B. 세 가지 확산 모델 (Diffusion Models) 구성
EgoAVFlow 는 세 가지 확산 모델을 공유 3D Flow 를 통해 결합합니다:
로봇 조작 정책 (πr): 과거의 3D Flow 추적 데이터와 로봇의 고유 감각 (Proprioception) 을 입력받아 미래의 로봇 행동 (Action) 을 예측합니다.
Flow 생성 모델 (f): 로봇의 예상 행동과 카메라 시점 이력을 기반으로, 미래의 3D Flow(물체의 운동) 를 예측합니다. 이는 "무엇이 어디로 움직일지"에 대한 예측을 제공합니다.
시점 정책 (πv): 미래의 카메라 시점을 예측합니다. 단순히 시점을 모방하는 것이 아니라, **가시성 인식 보상 (Visibility-aware Reward)**을 기반으로 테스트 시간 (Test-time) 에 최적의 시점을 찾도록 조정합니다.
C. 보상 최대화 디노이징 (Reward-Maximizing Denoising)
문제: 가시성 계산은 레이 캐스팅 (Raycasting) 을 필요로 하므로 미분 불가능 (Non-differentiable) 합니다.
해결: 학습된 확산 모델의 사전 분포 (Prior) 를 유지하면서, 테스트 시간에서 Soft Value-Based Denoising 기법을 적용합니다.
예측된 3D Flow 와 환경 지오메트리 (Mesh) 를 기반으로 가시성 보상 (Rvis) 을 계산합니다.
이 보상을 최대화하는 방향으로 디노이징 과정을 재샘플링하여, 인간 시점과 다를지라도 작업에 필요한 가시성을 확보하는 카메라 시점을 생성합니다.
3. 주요 기여 (Key Contributions)
공유 3D Flow 표현: 로봇 데이터 없이 인간과 로봇 간의 구현체 격차 (Embodiment Gap) 를 해소하고, 조작과 시점 제어를 통합하는 새로운 표현 방식을 제안했습니다.
가시성 최적화 시점 조정 전략: 인간의 시점을 단순히 모방하지 않고, 미래의 3D 운동과 기하학적 가시성을 고려하여 능동적으로 시점을 조절하는 전략을 도입했습니다.
성능 입증: 능동적으로 변화하는 시점 환경에서 기존 인간 모방 기반 방법론들을 압도하는 성능을 보여주었으며, 로봇 데이터 없이도 견고한 조작 능력을 입증했습니다.
4. 실험 결과 (Results)
실험 설정: 스프레이, 인형, 화장지, 수건 등 4 가지 조작 작업을 수행하며, Trossen WidowX(조작 로봇) 와 Unitree Z1(시점 조절 로봇) 을 사용했습니다. 학습 데이터는 150 개의 인간 시점 비디오만 사용했습니다.
비교 대상:
HVI (Human Viewpoint Imitation): 인간 시점을 직접 모방하는 방법.
AMPLIFY, EgoZero, Phantom: 기존 인간 비디오 기반 로봇 학습 방법론들.
성과:
성공률: EgoAVFlow 는 모든 작업에서 가장 높은 성공률 (20/25 ~ 18/25) 을 기록했습니다. 이는 두 번째로 좋은 방법론 (EgoZero 등) 대비 1.8 배 ~ 2.5 배의 개선을 보였습니다.
가시성 유지: HVI 는 종종 물체가 시야에서 사라지거나 (Out-of-FoV) 가려지는 (Occlusion) 실패를 겪은 반면, EgoAVFlow 는 작업 내내 핵심 포인트를 명확히 비추었습니다.
고장 분석: 기존 2D 기반 방법론들은 시점 변화에 따른 분포 이동 (Distribution Shift) 에 취약했으나, EgoAVFlow 는 3D 흐름 정보를 활용하여 조작 실패 (Grasping failure) 를 크게 줄였습니다.
5. 의의 및 결론 (Significance)
이 논문은 인간 시점 비디오를 로봇에 적용할 때 발생하는 "시점 불일치" 문제를 3D Flow 와 능동적 비전 (Active Vision) 을 통해 해결했다는 점에서 의의가 큽니다.
데이터 효율성: 실제 로봇 데이터 수집 없이도 인간 비디오만으로 고도화된 조작 정책을 학습할 수 있음을 증명했습니다.
실용성: 로봇이 작업 환경의 변화에 맞춰 스스로 시점을 최적화할 수 있게 함으로써, 복잡한 조작 작업에서의 실패율을 획기적으로 낮췄습니다.
미래 방향: 현재는 초기 시점에서 추적 포인트가 관측 가능하다는 가정이 필요하지만, 향후 관심 포인트를 스스로 탐색하고 추적하는 능력까지 확장한다면 더욱 자율적인 로봇 조작이 가능해질 것입니다.
요약하자면, EgoAVFlow는 인간이 보는 그대로를 따라가는 것이 아니라, **"로봇이 무엇을 볼 필요가 있는가"**를 3D 공간에서 추론하여 시점을 능동적으로 조절함으로써, 인간 데이터 기반 로봇 학습의 한계를 극복한 획기적인 접근법입니다.