기술 요약: RAPT – 시뮬레이션-실제(Sim-to-Real) 휴머노이드 배포를 위한 모델 예측 기반 분포 외(OOD) 탐지 및 고장 진단
문제 정의
학습된 제어 정책을 시뮬레이션에서 실제 로봇으로 배포하는 과정(Sim-to-Real)은 상당한 위험을 수반한다. 시뮬레이션에서는 견고해 보이는 정책이라도, 미모델링된 역학, 센서 노이즈, 지연 시간, 페이로드 변화, 지형 변화 또는 구현 오류로 인해 실제 배포 시 분포 외(Out-of-Distribution, OOD) 상태에 자신 있게 진입할 수 있다. 이러한 OOD 이벤트는 "침묵의 실패(silent failures)", 낙하, 자기 충돌 또는 하드웨어 손상으로 이어질 수 있다.
기존의 이상 탐지 방법들은 고빈도 휴머노이드 제어(50 Hz)의 특정 제약 조건을 충족하지 못하는 경우가 많다:
- 계산 비용: 불확실성 및 앙상블 방법은 실시간 제어 루프에 사용하기에는 너무 비용이 많이 들 수 있다.
- 교정(Calibration) 문제: 생성 모델(예: LSTM-VAE)은 가능도 오교정(likelihood miscalibration) 및 입력 복잡도 편향 문제를 겪을 수 있다.
- 해석 가능성 부족: 많은 접근 방식이 이진(binary) 정지 신호만을 제공하며, 실행이 정상 동작에서 언제, 어디서, 왜 벗어났는지에 대한 통찰을 제공하지 못한다.
- 상태 결합(State Coupling): 일반적인 시계열 방법은 고유 수용 감각 채널을 결의된 로봇 상태가 아닌 독립적인 신호로 취급하는 경 경우가 있다.
방법론
본 논문은 사전 학습된 제어 정책과 함께 실행되도록 설계된 경량 자가 지도 학습형 모니터링 시스템인 **RAPT (Recurrent Anomaly Probabilistic Trajectory Model)**를 소개한다. RAPT는 네 단계로 작동한다:
1. 명목 데이터 수집 (Nominal Data Collection)
RAPT는 대규모 시뮬레이션(NVIDIA Isaac Lab)에서 실행된 전문가 정책으로부터 명목 고유 수용 궤적을 수집한다. 이 궤적들은 시스템이 배포 중에 보존해야 할 "명목 동작 매니폴드(nominal behavior manifold)"를 정의한다. 훈련 전 관측값은 정규화된다.
2. 확률적 순환 궤적 모델 (Probabilistic Recurrent Trajectory Model)
RAPT는 자가 지도 학습형 순환 재구성 모델로서 훈련된다. 아키텍처는 다음을 포함한다:
- 잔차 상태 인코더 (Residual State Encoder): 관측 이력을 처리한다.
- GRU 기반 시간적 브리지 (GRU-based Temporal Bridge): 시간적 의존성을 포착한다.
- 잠재 병목 (Latent Bottleneck): 상태 표현을 압축한다.
- 확률적 디코더 (Probabilistic Decoder): 대각 가우시안 재구성 분포 [μt,logσt2]를 출력한다.
모델은 명목 관측값의 음의 로그 가능도(Negative Log-Likelihood, NLL)를 최소화한다. 이 공식은 **이분산성 알레아토리 불확실성(heteroscedastic aleatoric uncertainty)**을 포착하여, 자연스럽게 변동성이 큰 차원은 더 큰 예측 분산을 갖게 하고, 일관된 차원에서의 편차에는 더 엄격하게 패널티를 부여한다. 속도 추적 작업의 경우, ot−1,at−1에 조건화하여 ot를 예측하는 순방향 역학 변형(forward-dynamics variant)이 사용되며, 그렇지 않은 경우에는 순수 재구성이 선호된다.
3. 시뮬레이션 훈련 및 배포 교정 OOD 탐지
배포 시, RAPT는 차원별 예측 편차를 평가한다. Sim-to-Real 간극을 처리하기 위해 RAPT는 두 가지 교정 모드를 지원한다:
- 시뮬레이션 교정 (Simulation Calibration): 시뮬레이션에서 훈련된 분포로부터의 편차를 측정하여, 잔여 Sim-to-Real 불일치를 가시화한다.
- 실제 환경 교정 (Real-World Calibration): 검증된 짧은 명목 실행을 사용하여 정적 오프셋(센서 노이즈, 지연 시간, 하드웨어 역학)에 적응함으로써, 특정 하드웨어와 관련된 새로운 OOD 이벤트를 탐지할 수 있게 한다.
탐지는 계층적 게이팅 메커니즘을 활용한다:
- 로컬 게이트 (Local Gate): 비정상적으로 큰 차원별 편차(ℓt,i>τmax+5σi)를 감지한다.
- 글로벌 게이트 (Global Gate): 평균 예측 편차의 광범위한 변화(ℓˉt>τglobal+3σglobal)를 감지한다.
- 하이브리드 안전 엔벨로프 (Hybrid Safety Envelope): 선택적으로 결정론적 범위 탐지기와 결합된다. 최종 이상 결정은 로컬, 글로벌, 범위 게이트의 논리적 OR 연산이다.
4. 실패 국소화 및 진단
- 시간적 돌출성 (Temporal Saliency): 이상이 감지되면, RAPT는 순환 모델을 통한 적분 기울기(integrated gradients)를 사용하여 히스토리 윈도우에 대한 NLL의 기울기를 계산한다. 이를 통해 시공간적 속성 맵(spatio-temporal attribution map)을 생성하여, 언제 그리고 어떤 고유 수용 채널이 처음으로 명목 동작에서 벗어났는지 강조한다.
- 의미론적 진단 (Semantic Diagnosis): 다중 모달 대규모 언어 모델(LLM)은 구조화된 증거(시간적 돌출성 요약, 관절 운동학 궤적, 작업 맥락, 시각적 키프레임)를 전달받아, 탐지기 훈련 중 레이블링된 실패 데이터 없이도 실패 원인(예: 충돌, 센서 결함, 지형 변화)에 대한 제로샷 분류를 수행한다.
주요 기여
- 시뮬레이션 훈련, 배포 교정 모니터링: RAPT는 대규모 시뮬레이션으로부터 학습하고 시뮬레이션 또는 짧은 실제 데이터를 사용하여 임계값을 교정하며, 이는 디버깅과 하드웨어 시간의 OOD 탐지를 모두 지원한다.
- 고 자유도 휴머노이드를 위한 저-오탐(Low-FPR) OOD 탐지: 교정된 차원별 및 글로벌 게이트를 갖춘 확률적 예측 편차 모델링을 사용함으로써, RAPT는 엄격한 오탐률 제약 조건 하에서 고주파 호환 베이스라인보다 우수한 성능을 보인다.
- 진단을 위한 국소적 증거 제공: RAPT는 차원별 NLL 신호와 시간적 돌출성을 생성하여, 레이블링된 실패 데이터 없이도 사후 의미론적 실패 진단을 가능하게 한다.
실험 결과
저자들은 NVIDIA Isaac Lab과 실제 하드웨어 모두에서 Unitree G1 휴머노이드를 대상으로 RAPT를 검증하였다.
- 시뮬레이션 성능: 네 가지 작업(속도 추적, 동작 모방, 탄도 투척)과 15가지 OOD 카테고리에 대해, RAPT는 0.5% 에피소드 수준의 오탐률(FPR)에서 가장 강력한 베이스라인보다 TPR(True Positive Rate)을 37% 향상시켰다.
- 하드웨어 성능: 물리적 Unitree G1을 대상으로 한 78회의 실험에서, RAPT는 고주파 호환 베이스라인보다 적은 오탐을 기록하며 89%의 TPR을 달성했다.
- 진단 정확도: 도전적인 OOD 서브셋에 대해, RAPT는 제로샷 LLM 접근 방식을 사용하여 21가지 실패 카테로리에 대해 75%의 의미론적 실패 진단 정확도를 달고했다.
- 지연 시간: 모니터링 파이프라인은 약 1.6ms로 작동하여 50 Hz 제어 루프와 호환된다.
의의 및 주장
본 논문은 RAPT를 도메인 무작위화(domain randomization)나 시스템 식별(system identification)의 대체재가 아니라, 전이(transfer) 후에도 남아있는 **잔여 불일치(residual mismatch)**와 예기치 못한 OOD 이벤트를 모니터링하는 보완적인 계층으로 규정한다.
- 안전 및 디버깅: RAPT는 하부 제어기를 수정하지 않고도 안전 모니터링 및 디버깅을 위한 관측 가능한 배포 시점 신호를 제공한다. 이는 OOD 탐지 시 사전 정의된 안전 응답(예: 안전 정지, 제어된 낙하, 회복)을 트리거한다.
- 해석 가능성: 이진 정지 신호를 넘어 국소적 차원별 증거와 의미론적 추론을 제공함으로써, RAPT는 학습된 정책의 "블랙박스"적 특성을 해결하여 운영자가 외부 교란, 액추에이터 저하, 센서 결함을 구분할 수 있도록 한다.
- 재현성: 저자들은 향유 벤치마킹을 지원하기 위해 훈련 파이프라인, 레이블링된 실제 데이터셋, C++ 배포 코드를 공개할 것을 약속한다.
이 연구는 경량화된 자가 지도 학습형 확률 모델이 복잡한 휴머노이드 시스템에서 즉각적인 안전 개입과 사후 진단 통찰력을 모두 제공함으로써, 시뮬레이션과 실제 사이의 간극을 효과적으로 메울 수 있음을 입증한다.