REAL: Robust Extreme Agility via Spatio-Temporal Policy Learning and Physics-Guided Filtering
이 논문은 시각적 노이즈나 지연과 같은 감각 왜곡 상황에서도 1 미터의 시각적 맹점을 극복하고 13.1ms 이내의 실시간 제약을 준수하며 Unitree Go2 사족보행 로봇이 극한의 파쿠르 장애물을 안정적으로 통과할 수 있도록 하는 'REAL'이라는 강인한 극한 민첩성 학습 프레임워크를 제안합니다.
이 논문은 **"눈이 안 보여도 몸이 기억하고, 물리 법칙을 믿어라"**는 세 가지 핵심 아이디어로 문제를 해결했습니다.
① "눈 (카메라) 보다 몸 (관절) 을 더 믿어라" (FiLM & Mamba)
비유: 눈을 감고 계단을 내려갈 때, 우리는 발바닥의 느낌 (관절 감각) 과 "아까 계단이 몇 개였지?"라는 단기 기억을 활용합니다.
기술: 로봇은 카메라 (눈) 가 흐릿해지면, 즉시 **관절의 움직임과 가속도 (몸의 느낌)**를 통해 "지금 내가 어디에 서 있는지"를 추측합니다.
Mamba (메모리): 로봇에게 **'단기 기억'**을 심어줍니다. 과거 10 초간의 발자국과 몸의 움직임을 기억해서, 지금 눈앞이 캄캡해도 "아까 저기 계단이 있었으니, 지금 이걸로 뛰어넘어야지"라고 판단하게 합니다.
FiLM (필터): 카메라가 흐릿한 정보를 보여줄 때, "이건 믿을 수 없어, 무시해!"라고 자동으로 필터링하는 역할을 합니다. 마치 안개가 낀 날에 눈보다 귀를 더 크게 쓰는 것과 같습니다.
② "물리 법칙을 믿어라" (Physics-Guided Filtering)
비유: 로봇이 공중제비를 돌 때, 카메라는 흔들려서 "내가 어디에 있나?"를 못 알아냅니다. 하지만 **물리 법칙 (중력, 관성)**은 변하지 않습니다. "아, 지금 공중에 떠있으니 떨어지기 직전일 거야"라고 추측할 수 있습니다.
기술: 로봇은 신경망 (AI) 의 예측과 **물리 법칙 (EKF)**을 섞어서 상태를 계산합니다. AI 가 "아마도 여기일 거야"라고 말하면, 물리 법칙이 "아니, 지금 그 속도로는 저기 있을 수 없어"라고 정정해 줍니다. 이렇게 하면 넘어지거나 미끄러져도 로봇이 "내가 미끄러졌구나"라고 정확히 인지하고 균형을 잡습니다.
③ "선생님과 제자의 게임" (Consistency-Aware Loss Gating)
비유: 로봇을 가르칠 때, **완벽한 정보 (Privileged Info)**를 가진 '선생님'과 **실제 정보만 가진 '제자'**를 둔다고 상상해 보세요.
처음에는 제자가 엉뚱한 행동을 하면, 선생님에게 "너 지금 내가 한 대로 따라 해"라고 강하게 가르칩니다 (안정성).
제자가 점점 잘하면, "자, 이제 네가 상황에 맞춰서 스스로 판단해 봐"라고 더 자유롭게 탐색하게 합니다 (적응력).
기술: 이 두 가지 학습 방식을 로봇의 실력에 따라 자동으로 조절합니다. 실수가 많을 때는 선생님을 따라 하고, 실력이 늘면 스스로 적응하게 만들어, 실제 세상에서도 잘 작동하도록 만듭니다.
🚀 3. 실제 결과: "Unitree Go2 로봇의 활약"
이 기술을 **Unitree Go2(4 발 로봇)**에 적용해 실험했습니다.
1 미터 시야 차단 테스트: 로봇이 장애물 1 미터 앞부터 카메라가 아예 안 보이게 (블라인드) 했을 때, 기존 로봇들은 바로 넘어졌습니다. 하지만 REAL 로봇은 "아까 계단을 봤으니, 지금 이걸로 뛰어넘어야지"라고 기억을 활용해서 안정적으로 장애물을 넘었습니다.
빠른 반응: 이 모든 계산이 로봇 몸속 (Jetson 칩) 에서 13.1 밀리초 만에 끝납니다. 이는 인간이 깜빡이는 시간보다 훨씬 빠르며, 로봇이 실시간으로 균형을 잡을 수 있게 해줍니다.
💡 요약
이 논문은 **"로봇이 카메라에 의존하지 않고, 몸의 감각과 기억, 그리고 물리 법칙을 믿고 극한의 상황에서도 넘어지지 않게 만든 방법"**을 제시했습니다.
마치 눈이 가려진 상태에서도 몸의 감각으로 계단을 오르는 마술사처럼, 로봇이 어떤 상황에서도 넘어지지 않고 뛰어넘을 수 있게 된 것입니다.
1. 문제 정의 (Problem Definition)
기존의 학습 기반 로봇 파쿠르 (Parkour) 시스템은 뛰어난 민첩성을 보이지만, 지각 (Perception) 의 열화에 매우 취약하다는 근본적인 한계를 가지고 있습니다.
취약성: 시각적 노이즈, 지연 (Latency), 모션 블러, 또는 일시적인 센서 신호 손실이 발생하면 로봇이 즉각적으로 실패하거나 치명적인 붕괴 (Catastrophic Failure) 를 겪습니다.
현재 기술의 부족: 대부분의 기존 방법은 시각 정보를 직접적인 피드포워드 입력으로만 사용하며, 관측 불확실성을 모델링하거나 시간적 기억 (Temporal Memory) 을 활용하지 않습니다. 또한, 상태 추정기가 강체 역학 (Rigid-body dynamics) 을 따르지 않아 높은 충격이나 미끄러짐 상황에서 불안정해집니다.
목표: 시각 정보가 심각하게 손상되거나 완전히 차단된 상황 (예: 1 미터의 시각 맹점) 에서도 로봇이 지형 정보를 기억하고 물리 법칙에 따라 안정적으로 극한의 장애물을 넘나들 수 있는 강건한 제어 프레임워크 개발.
2. 제안 방법론: REAL (Methodology)
저자들은 **REAL (Robust Extreme Agility Learning)**이라는 엔드 - 투 - 엔드 프레임워크를 제안합니다. 이는 시각, 고유감각 (Proprioception), 시간적 기억을 긴밀하게 결합한 단일 학습 파이프라인입니다.
A. 스펙트럼 - 시간 정책 학습 (Spatio-Temporal Policy Learning)
Teacher-Student 아키텍처:
Privileged Teacher: 시뮬레이션 환경에서 지형 스캔 포인트, 고유감각, 그리고 추가적인 특권 정보 (Privileged Info) 를 사용하여 강화학습 (RL) 으로 훈련됩니다. 교차 모달 어텐션 (Cross-modal Attention) 을 통해 로봇의 신체 상태와 지형 기하학 사이의 구조적 연관성을 학습합니다.
Deployable Student: 실제 배포를 위해 훈련되며, 특권 정보 없이 온보드 깊이 카메라와 고유감각만 사용합니다.
FiLM-Modulated Mamba Backbone:
FiLM (Feature-wise Linear Modulation): 고유감각 신호가 시각 특징 (Depth Image) 을 동적으로 조절 (Modulate) 하여, 충격이나 빠른 회전 시 발생하는 불신뢰한 시각적 노이즈를 필터링합니다.
Mamba Backbone: Transformer 기반 모델의 계산 복잡도 한계를 극복하고, 선형 시간 복잡도 O(1)로 효율적인 시퀀스 모델링을 수행합니다. 이를 통해 시각 정보가 끊겨도 로봇의 과거 운동 이력을 기반으로 단기간의 지형 기억을 유지하며 의사결정을 내립니다.
B. 물리 유도 필터링 (Physics-Guided Filtering)
불확실성 인식 신경 속도 추정기: 10 프레임의 고유감각 시퀀스를 1D ResNet 으로 처리하여 속도와 그 불확실성 (Gaussian 분포) 을 예측합니다.
확장 칼만 필터 (EKF) 융합: 신경망 예측값을 강체 역학 모델 (IMU 가속도 및 각속도 기반) 과 융합합니다.
신경망이 높은 불확실성을 보고할 때 (예: 공중 도약, 발 미끄러짐), EKF 는 물리 모델의 예측을 더 신뢰하도록 가중치를 조정합니다.
이는 높은 충격 상황에서도 물리적으로 일관된 상태 추정을 보장하고 드리프트를 방지합니다.
C. 일관성 인식 손실 게이팅 (Consistency-Aware Loss Gating)
동적 학습 전략: 학생 정책과 교사 정책 간의 행동 차이 (Action Discrepancy) 를 기반으로 행동 복제 (BC) 손실과 강화학습 (RL) 손실의 비율을 동적으로 조절합니다.
차이가 클 때: BC 손실 우위 (안정성 유지).
차이가 작을 때: RL 손실 우위 (탐색 및 적응성 강화).
이 메커니즘은 시뮬레이션 - 실제 (Sim-to-Real) 전이 과정을 안정화합니다.
3. 주요 기여 (Key Contributions)
REAL 프레임워크: 구조화된 교차 모달 proprioception-지형 연관성을 포착하는 새로운 시공간 정책 학습 프레임워크 제안.
물리 유도 필터링 모듈: 불확실성을 명시적으로 모델링하고 강체 일관성을 강제하여 고동적 기동 중 신뢰할 수 있는 상태 추정을 보장.
일관성 인식 손실 게이팅: 모방 학습과 강화 학습을 적응적으로 균형 있게 조절하여 정책 증류 (Distillation) 를 안정화하고 Sim-to-Real 강건성을 향상.
실제 검증: Unitree Go2 4 발 로봇에서 제로샷 (Zero-shot) 전이를 성공적으로 수행하며, 심각한 지각 열화 조건에서도 극한의 지형 통과를 입증.
4. 실험 결과 (Results)
실험은 시뮬레이션 (Isaac Gym) 과 실제 하드웨어 (Unitree Go2) 에서 수행되었습니다.
극한 지형 통과 능력:
장애물 (Hurdles), 계단 (Steps), 간격 (Gaps) 등 다양한 환경에서 기존 최첨단 방법론 (Extreme Parkour, RPL, SoloParkour) 대비 **약 2 배 높은 성공률 (Success Rate)**을 기록했습니다.
평균 에지 위반 (Mean Edge Violations, 발이 장애물 가장자리에 걸리는 빈도) 이 기존 방법 대비 현저히 낮았습니다.
지각 열화에 대한 강건성:
프레임 드롭, 가우시안 노이즈, 시야 (FoV) 가려짐 등 다양한 센서 손상 조건에서 성능 저하가 미미했습니다.
특히 시각 맹점 (1 미터 전 시각 차단) 조건에서 기존 방법론이 즉시 실패한 반면, REAL 은 과거 운동 이력을 활용하여 성공적으로 장애물을 통과했습니다.
실시간 추론 성능:
Mamba 백본을 사용하여 13.14 ms/스텝의 일관된 추론 시간을 달성했습니다. 이는 20 ms 의 실시간 제어 예산을 만족하며, Transformer 기반 베이스라인 (23.07 ms) 보다 빠르고 확장성이 뛰어납니다.
Ablation Study:
Mamba 제거 시 성공률이 급감하고 에지 위반이 5 배 증가하여 시간적 기억의 중요성을 입증했습니다.
FiLM 제거 시 시각 노이즈를 신뢰하여 실패율이 크게 증가했습니다.
5. 의의 및 결론 (Significance)
이 논문은 로봇이 시각 정보가 불완전하거나 손상된 상황에서도 물리 법칙과 과거 경험을 활용하여 극한의 민첩성을 발휘할 수 있음을 증명했습니다.
기술적 혁신: Mamba 와 같은 상태 공간 모델 (State Space Models) 을 로봇 제어에 적용하여 실시간성과 장기 기억을 동시에 해결했습니다.
실용적 가치: 재난 대응, 산업 점검, 행성 탐사 등 비정형 환경에서 로봇이 센서 고장이나 열화 상황에서도 안전하고 신뢰할 수 있게 작동할 수 있는 기반을 마련했습니다.
향후 영향: 시뮬레이션에서 실제 로봇으로의 전이 (Sim-to-Real) 를 안정화하는 새로운 패러다임을 제시하며, 향후 강건한 지상 로봇 제어의 표준으로 자리 잡을 가능성이 큽니다.