One-Policy-Fits-All: Geometry-Aware Action Latents for Cross-Embodiment Manipulation
이 논문은 다양한 로봇 엔드이펙터 간의 구조적 차이와 행동 공간의 불일치를 해결하여 단일 정책을 학습할 수 있도록 3D 합성곱 신경망과 트랜스포머를 활용한 기하학적 인식 잠재 표현 (GaLR) 과 통일된 잠재 리타게팅 디코더를 제안한 'One-Policy-Fits-All(OPFA)' 프레임워크를 소개하며, 이를 통해 이종 데이터의 공동 학습이 가능해지고 소량의 새로운 데이터로도 높은 성능을 달성할 수 있음을 11 가지 다른 엔드이펙터 실험을 통해 입증했습니다.
다섯 손가락 인간형 손 (덱스터스 핸드) 은 "엄지손가락을 구부려서 잡아야 해!"라고 따로 배웠습니다.
문제는 데이터가 너무 부족하고 비싸다는 점입니다. 새로운 로봇이 나오면 처음부터 다시 데이터를 모아야 하니까요.
이 논문은 "로봇의 손 모양 (기하학적 구조) 을 이해하는 공통된 언어 (잠재 표현)" 를 만들어냈습니다. 마치 모든 로봇이 사용하는 '만능 번역기' 를 개발한 것과 같습니다.
🧩 비유로 이해하기
1. 기존 방식: "각자 다른 언어로 노래 부르기"
기존 연구들은 로봇마다 다른 '해석기 (Decoder)'를 썼습니다.
로봇 A 는 "나를 위한 노래"를 부르고, 로봇 B 는 "나를 위한 노래"를 따로 부릅니다.
서로의 노래를 공유할 수 없어서, 로봇 A 가 배운 지식을 로봇 B 가 쓸 수 없었습니다.
결과: 데이터를 엄청 많이 모아야만 로봇이 제 기능을 했습니다.
2. OPFA 의 방식: "모두가 이해하는 '제스처'로 소통하기"
OPFA 는 로봇의 손가락이 움직이는 구체적인 숫자 (각도) 를 직접 외우는 대신, "손이 닿을 수 있는 공간의 모양 (기하학적 구조)" 을 3D 점 구름 (Point Cloud) 으로 만들어 공통된 언어로 변환합니다.
비유: 로봇 A 와 로봇 B 가 서로 다른 악기 (피아노 vs 바이올린) 를 연주하더라도, 악보 (잠재 표현, GaLR) 는 똑같은 '음표'로 기록합니다.
이 '음표'는 로봇의 손 모양과 상관없이 공간의 모양을 담고 있기 때문에, 어떤 로봇이든 이 음표를 보고 자신의 악기에 맞게 연주할 수 있습니다.
🚀 OPFA 가 어떻게 작동할까요? (3 단계 과정)
공통 언어 만들기 (Geometry-Aware Latent Representation):
다양한 로봇 (2 손가락, 3 손가락, 5 손가락 등) 의 데이터를 모아서, "손이 닿을 수 있는 공간"을 3D 점 구름으로 만듭니다.
AI 가 이 점 구름을 보고 모든 로봇이 공통으로 이해할 수 있는 '핵심 개념 (잠재 표현)' 을 추출합니다.
예시: "물건을 잡으려면 손가락이 이 모양으로 모여야 해"라는 공간적 개념만 남기고, 로봇마다 다른 손가락 개수는 무시합니다.
만능 번역기 (Unified Decoder):
추출된 '핵심 개념'을 다시 각 로봇의 구체적인 손가락 움직임으로 바꿔줍니다.
중요한 점: 로봇마다 별도의 번역기를 따로 훈련할 필요가 없습니다. 하나의 번역기가 모든 로봇을 다 처리합니다.
비유: 같은 영어 원서 (핵심 개념) 를 가지고, 한국인에게는 한국어로, 일본인에게는 일본어로 번역해주는 하나의 AI 번역기가 있는 셈입니다.
데이터 효율성 극대화 (Few-Shot Learning):
새로운 로봇이 생겼을 때, 기존에 72 개의 데이터로 훈련된 모델과 비슷한 성능을 내려면 보통 많은 데이터가 필요합니다.
하지만 OPFA 는 새 로봇의 데이터가 8 개만 있어도 (기존 모델의 1/9 수준), 이미 배운 '공통 개념'을 바탕으로 빠르게 적응합니다.
🌍 실험 결과: 얼마나 잘할까요?
연구진은 11 가지 종류의 서로 다른 로봇 손 (2 손가락 집게부터 5 손가락 인간형 손까지) 으로 실험을 했습니다.
공간 일반화: 로봇 A 가 배운 공간 (예: 책상 왼쪽) 에서 로봇 B 가 배운 공간 (예: 책상 오른쪽) 으로 넘어가도, OPFA 는 90% 이상의 성공률을 보였습니다. (기존 방식은 거의 실패했습니다.)
소량 학습: 새로운 로봇에게 단 8 개의 데이터만 주어도, 기존에 72 개 데이터로 훈련한 모델과 비슷한 성능을 냈습니다.
실제 세상: 실제 로봇 팔과 다양한 도구 (비행기, 바구니, 주사기 등) 를 이용해 실험했는데, 복잡한 작업 (물 붓기, 서랍 닫기) 에서도 다른 로봇들의 지식을 공유하며 훨씬 잘 수행했습니다.
💡 요약: 왜 이것이 중요한가요?
이 기술은 "로봇을 가르치는 비용"을 획기적으로 낮춥니다.
이제 새로운 로봇을 만들 때마다 처음부터 데이터를 모으고 훈련할 필요가 없습니다.
이미 배운 다른 로봇들의 지식을 공통된 '기하학적 언어'로 공유하면, 아주 적은 데이터로도 새로운 로봇이 즉시 제 기능을 할 수 있게 됩니다.
마치 모든 로봇이 하나의 '두뇌'를 공유하되, 자신의 손 모양에 맞춰 자유롭게 움직이는 세상을 만드는 기술이라고 할 수 있습니다.
1. 문제 정의 (Problem)
로봇 조작 (Manipulation) 분야에서 시뮬레이션 및 실제 데이터의 부족은 큰 병목 현상입니다. 이를 해결하기 위해 다양한 로봇 팔과 그리퍼 (End-effectors) 의 데이터를 통합하여 학습하는 크로스-에임바디먼트 (Cross-Embodiment) 학습이 중요해졌으나, 다음과 같은 근본적인 어려움이 존재합니다.
행동 공간의 이질성: 단순한 2 지 그리퍼부터 복잡한 5 지 인체공학적 손 (Dexterous Hands) 까지, 각 로봇의 자유도 (DOF) 와 관절 구조가 크게 다릅니다. 이로 인해 행동 공간 (Action Space) 의 차원과 구조가 일치하지 않아 단일 정책을 학습하기 어렵습니다.
데이터 부족 및 과적합: 새로운 로봇에 적용할 때 소량의 데이터만으로는 개별 로봇 전용 디코더를 학습시키기 어렵고, 과적합 (Overfitting) 이 발생하여 일반화 성능이 떨어집니다.
기존 방법의 한계: 기존 연구들은 주로 그리퍼 중심이거나, 각 로봇마다 별도의 디코더를 사용하는 방식 (Embodiment-specific decoders) 을 취했습니다. 이는 공유된 기하학적 정보를 활용하지 못하게 하거나, 구조적 차이로 인한 행동 충돌을 유발하여 데이터 효율성을 저하시킵니다.
2. 제안 방법 (Methodology: OPFA)
저자들은 OPFA (One-Policy-Fits-All) 라는 통합 프레임워크를 제안합니다. 이는 다양한 로봇 팔과 손의 데이터를 단일 정책으로 학습하고, 새로운 로봇에 빠르게 적응할 수 있도록 설계되었습니다. OPFA 는 크게 두 단계로 구성됩니다.
A. 기하학적 인지 잠재 표현 학습 (Geometry-Aware Latent Representation, GaLR)
개념: 다양한 엔드 이펙터의 도달 가능한 상태 (Reachable States) 를 3D 점군 (Point Cloud) 으로 변환하고, 이를 공통된 잠재 공간 (Latent Space) 으로 매핑합니다.
아키텍처:
인코더: 3D 합성곱 신경망 (3D CNN) 과 기하학적 트랜스포머 (Geometric Transformer) 를 사용합니다.
특징 추출: 점군을 다중 스케일 (Multi-scale) 로 다운샘플링하여 국소적 기하학적 특징을 추출한 후, '초점 (Superpoints)' 수준에서 전역적 제스처 정보를 포착합니다.
위치 임베딩: 단순 좌표뿐만 아니라, 손가락 구조 (엄지, 검지 등) 와 세그먼트 레벨을 반영하는 의미론적 위치 임베딩 (Semantic Positional Embedding) 을 도입하여 로봇의 구조적 차이를 무시하고 공통된 기하학적 구조를 학습합니다.
결과: 모든 로봇의 행동이 동일한 차원의 잠재 벡터 (GaLR) 로 통일됩니다.
B. 통합 잠재 리타게팅 디코더 (Unified Latent Retargeting Decoder)
가상 보편적 손 모델: 모든 가능한 관절을 포함하는 가상의 보편적 손 모델 (Hypothetical Universal Hand Model) 을 정의합니다.
단일 디코더: 각 로봇 전용 디코더를 학습하는 대신, 하나의 통합 디코더가 잠재 벡터에서 해당 로봇에 존재하는 관절 각도만 추출하도록 설계합니다.
장점: 이 방식은 특정 로봇에 대한 추가 튜닝 없이도, 학습된 GaLR 에서 해당 로봇의 구체적인 행동 (Joint Angles) 을 복원할 수 있게 하여 데이터 효율성을 극대화합니다.
C. 크로스-에임바디먼트 정책 공동 학습 (Co-Training)
학습된 GaLR 인코더와 디코더는 DP3(Diffusion Policy 3) 와 같은 기존 행동 예측 모델에 통합됩니다.
정책은 시각적 관찰을 입력받아 직접 행동을 예측하는 대신, GaLR 을 예측하도록 변경됩니다. 이후 사전 학습된 디코더를 통해 실제 로봇의 관절 각도로 변환됩니다.
이를 통해 다양한 로봇의 데이터가 단일 잠재 공간에서 공동 학습 (Co-training) 되어, 로봇 간 지식 전이가 원활하게 이루어집니다.
3. 주요 기여 (Key Contributions)
GaLR (Geometry-Aware Latent Representation) 구축: 수동 주석 없이 3D 점군을 기반으로 다양한 엔드 이펙터의 행동 공간 차원을 정렬하고 기하학적 정보를 공유하는 잠재 표현을 학습했습니다.
엔드 - 투 - 엔드 공동 학습 프레임워크: 각 로봇별 디코더 튜닝이 필요 없는 통합 리타게팅 디코더를 제안하여, 소량의 데이터로도 새로운 로봇에 대한 효과적인 전이 학습이 가능하도록 했습니다.
광범위한 실험 검증: 11 가지 서로 다른 엔드 이펙터 (2 지 그리퍼부터 5 지 손까지) 와 14 가지 다양한 조작 과제를 대상으로 시뮬레이션 및 실제 환경에서 광범위한 실험을 수행했습니다.
4. 실험 결과 (Results)
OPFA 는 시뮬레이션과 실제 환경 (Real-world) 에서 기존 방법 (단일 로봇 학습, Naive Co-training) 을 압도적으로 능가했습니다.
성능 향상: 다양한 크로스 - 에임바디먼트 설정에서 단일 소스 학습 대비 성공률 50% 이상 향상을 기록했습니다. (예: 스프레이 픽킹 작업에서 19.8% 평균 향상)
소수 샷 학습 (Few-Shot Learning): 새로운 로봇에 대해 8 개의 데모 데이터만 추가하여 학습했을 때, 72 개의 데모로 잘 훈련된 모델과 유사한 성능을 달성했습니다. 이는 데이터 효율성이 매우 높음을 의미합니다.
공간 및 객체 일반화: 학습 데이터와 완전히 다른 공간 영역이나 다른 객체를 대상으로 한 테스트에서도 높은 성공률을 보였습니다. (예: 바구니 들어 올리기 90% 이상 성공)
실제 환경 검증: UR5e 로봇 팔에 4 가지 다른 엔드 이펙터 (XHand, Inspire Hand, Leap Hand, Robotiq-2F) 를 부착하여 7 가지 복잡한 작업 (도구 사용, 변형 가능 물체 조작 등) 을 수행한 결과, OPFA 는 모든 로봇에서 가장 높은 성공률을 기록했습니다. 특히 'Pot (냄비 들기)'이나 'Drawer (서랍 닫기)'와 같은 정밀 제어가 필요한 작업에서 기존 방법의 실패를 극복했습니다.
5. 의의 및 중요성 (Significance)
이 논문은 로봇 조작 분야에서 데이터의 희소성 문제를 해결하고 확장성을 높이는 중요한 이정표입니다.
실용적 배포: 새로운 로봇을 도입할 때 대량의 데이터 수집 없이도 기존 로봇들의 지식을 활용하여 빠르게 적응할 수 있게 하여, 로봇 기술의 실제 현장 적용 비용을 크게 절감합니다.
범용성: 단순한 그리퍼뿐만 아니라 복잡한 다관절 손 (Dexterous Hands) 까지 포괄하는 통합 솔루션을 제시하여, 로봇의 형태 (Morphology) 에 구애받지 않는 범용 정책 학습의 가능성을 열었습니다.
지식 전이의 효율성: 기하학적 구조를 명시적으로 모델링함으로써, 서로 다른 형태의 로봇 간에도 미세한 행동 (Fine-grained actions) 을 효과적으로 전이할 수 있음을 증명했습니다.
결론적으로, OPFA 는 "하나의 정책으로 모든 로봇을 제어한다 (One-Policy-Fits-All)"는 비전을 실현하기 위한 강력한 기술적 기반을 마련했습니다.