DiSPo: Diffusion-SSM based Policy Learning for Coarse-to-Fine Action Discretization
이 논문은 Mamba 기반의 확산-상태 공간 모델 (DiSPo) 을 제안하여 다양한 coarse 기술을 학습하고 추론 효율성을 높이면서도 정밀한 coarse-to-fine 행동 생성을 가능하게 함으로써 시뮬레이션 및 실제 로봇 조작 작업에서 기존 방법보다 뛰어난 성능을 입증합니다.
원저자:Nayoung Oh, Jaehyeong Jang, Moonkyeong Jung, Daehyung Park
상상해 보세요. 당신이 낯선 도시에서 길을 찾아야 합니다. 친구가 "저기 큰 건물을 지나서 오른쪽으로 꺾어"라고 대략적인 (Coarse) 말만 해줍니다.
기존 로봇들: 이 말만 듣고는 "오른쪽이 어디지? 얼마나 가야 하지?"라고 헤매다가 벽에 부딪히거나 길을 잃습니다. 정밀한 동작 (예: 구석진 곳의 버튼을 누르는 것) 을 하려면 친구가 "3 걸음 전진, 15 도 회전, 2cm 전진"처럼 매우 상세한 (Fine) 지시를 줘야만 했습니다.
기존 방식의 한계: 로봇이 정밀한 작업을 하려면 사람이 아주 세세한 동작을 수천 번씩 기록해 줘야 하는데, 이는 시간도 많이 들고 데이터 저장도 어렵습니다.
2. DiSPo 의 해결책: "스마트한 상상력"
DiSPo 는 이 문제를 해결하기 위해 두 가지 강력한 기술을 섞었습니다.
확산 모델 (Diffusion): 소음 속에서 그림을 점점 선명하게 그려내는 기술 (노이즈 제거).
SSM (Mamba): 긴 문맥을 기억하고 흐름을 파악하는 기술 (기억력).
비유로 설명하자면: DiSPo 는 **"대략적인 스케치북을 보고, 그 빈 공간을 스스로 채워 넣는 예술가"**와 같습니다.
친구가 "오른쪽 구석에 있는 빨간 버튼을 눌러"라고 대략적인 말만 해줘도 (Coarse), DiSPo 는 그 말의 맥락을 이해하고, "아, 그 버튼은 아주 정밀하게 조심스럽게 눌러야겠구나"라고 상상하여 정밀한 동작 (Fine) 을 만들어냅니다.
3. 핵심 기술: "단계별 확대 (Coarse-to-Fine)"
DiSPo 의 가장 멋진 점은 사용자가 원하는 정밀도를 조절할 수 있다는 것입니다.
일반적인 상황 (평지): 로봇이 넓은 공간을 이동할 때는 "대략적으로" 빠르게 움직입니다. (데이터를 아끼고 빠르게 처리)
위험한 상황 (구석): 로봇이 좁은 구멍을 통과하거나 버튼을 누를 때는 자동으로 "정밀 모드"로 전환되어 아주 세밀하게 움직입니다.
이를 사진을 확대하는 것에 비유할 수 있습니다.
처음엔 전체 지도 (저해상도) 를 보고 큰 방향을 잡습니다.
목표 지점에 가까워지면, 자동으로 그 부분만 고해상도로 확대해서 (고해상도) 정밀하게 작업을 수행합니다.
기존 로봇들은 처음부터 고해상도 지도를 받아야 했지만, DiSPo 는 저해상도 지도만 받아도 스스로 고해상도 부분을 그려냅니다.
4. 실제 실험 결과: "실제 로봇도 성공했다!"
연구진들은 이 기술을 실제 로봇 (UR5e) 에 적용해 보았습니다.
과제 1: 좁은 파이프를 통과하며 클램프를 옮기는 작업.
과제 2: 벽에 부딪히지 않고 아주 작은 버튼을 누르는 작업.
기존 방법들은 대략적인 지도만 주면 파이프에 부딪히거나 버튼을 누르지 못했지만, DiSPo 는 대략적인 지도만으로도 성공적으로 작업을 완료했습니다. 특히, 불필요한 구간에서는 빠르게 움직이고 중요한 구간에서만 정밀하게 움직여 시간과 에너지를 아끼면서도 정확도를 높였습니다.
💡 요약: 왜 이것이 중요한가요?
데이터 절약: 로봇에게 정밀한 동작을 가르치기 위해 수천 번의 시뮬레이션이나 인간 실습이 필요했던 과거와 달리, 적은 양의 대략적인 데이터로도 정밀한 작업을 배울 수 있습니다.
유연성: 로봇이 상황에 따라 "느긋하게" 또는 "정밀하게" 움직임을 스스로 조절할 수 있습니다.
실용성: 공장이나 가정에서 로봇이 더 복잡하고 섬세한 일을 할 수 있는 길이 열렸습니다.
한 줄 요약:
"DiSPo 는 로봇에게 '대략적인 지도'만 주면, 스스로 '정밀한 길'을 찾아내어 실수 없이 작업을 끝내는 똑똑한 상상력을 심어주는 기술입니다."
1. 문제 정의 (Problem)
로봇 조작 (Manipulation) 작업은 종종 **다중 해상도 (Multi-granularity)**의 행동을 요구합니다. 예를 들어, 큰 위치 이동 (Coarse) 과 나사 조임, 용접, 삽입과 같은 정밀한 미세 조작 (Fine) 이 혼합되어 있습니다. 기존 학습 방법들은 다음과 같은 한계를 가집니다:
데이터 의존성: 정밀한 제어를 위해서는 고주파수 (High-frequency) 의 세밀한 데모 데이터가 필수적이지만, 이를 수집하는 것은 비용이 많이 들고 비효율적입니다.
해상도 고정: 기존 확산 정책 (Diffusion Policy) 이나 행동 트랜스포머 (Behavior Transformer) 는 특정 주파수나 시간 척도에서 학습된 데이터를 기반으로 하여, 학습된 주파수와 다른 해상도의 행동을 생성하거나 다양한 해상도의 데모를 통합하여 학습하는 데 어려움을 겪습니다.
보간 및 동역학 모델의 한계: 기존 방법은 단순 보간이나 동역학 모델에 의존하여 다양한 해상도의 행동을 인코딩/디코딩하는 데 한계가 있습니다.
핵심 목표: coarse (거친) 데모 데이터로부터 학습하여, 사용자의 의도에 따라 fine-grained (세밀한) 행동을 생성할 수 있는 다중 해상도 학습 (Multi-granularity Learning) 및 **재생 (Reproduction)**을 가능하게 하는 정책 개발.
2. 제안 방법론: DiSPo (Methodology)
저자들은 **Diffusion-SSM 기반 정책 (DiSPo)**을 제안합니다. 이는 확산 모델 (Diffusion Model) 의 표현력과 상태 공간 모델 (SSM, 구체적으로 Mamba) 의 유연한 이산화 (Discretization) 능력을 결합한 하이브리드 아키텍처입니다.
A. 핵심 아키텍처
Mamba 기반 확산 과정: 기존 확산 모델이 CNN 또는 Transformer 를 백본으로 사용하는 반면, DiSPo 는 **Mamba(최신 SSM)**를 기반으로 합니다. 이는 긴 시퀀스 처리에 효율적이며 메모리 사용량이 적습니다.
Step-scaling Mechanism (단계 스케일링): DiSPo 의 가장 큰 혁신입니다. Mamba 의 이산 파라미터 (특히 단계 크기 Δ) 를 사용자 정의 **단계 스케일 팩터 (Step-scale factor, rt)**에 따라 동적으로 조정합니다.
입력: 확산 단계 (k), 관찰 (ot), 노이즈가 있는 행동 (at(k)), 그리고 단계 스케일 벡터 (rt).
rt는 관찰 및 행동 시퀀스의 시간적 해상도 (Granularity) 를 조절합니다. 예를 들어, rt=0.5는 2 배 더 정밀한 행동을, rt=2는 2 배 더 거친 행동을 의미합니다.
아키텍처 구성:
DiSPo Block: Mamba 블록의 변형으로, 적응형 레이어 정규화 (adaLN) 를 사용하여 확산 단계 임베딩에 조건부 (Conditioned) 로 노이즈 관련 특징을 정제합니다.
Step-scaled SSM: 입력 시퀀스와 rt를 기반으로 SSM 의 단계 크기 (Δ) 를 예측하고, 이를 통해 이산화된 SSM 파라미터 (Aˉ,Bˉ) 를 업데이트합니다.
B. 다중 해상도 학습 전략 (Multi-granularity Learning)
고주파수 데이터가 없는 상황에서도 정밀한 행동을 생성하기 위해 두 단계의 학습 전략을 사용합니다.
샘플률 증강 (Sample-rate Augmentation) 프리트레이닝:
기존 데모 데이터에 무작위 단계 스케일 팩터를 적용하여 다양한 주파수의 시퀀스를 인위적으로 생성하고, 이를 통해 모델이 다양한 해상도를 학습하도록 합니다.
가짜 데모 (Pseudo Demonstration) 를 통한 파인튜닝:
학습된 모델을 사용하여 저주파수 데모를 고주파수 타겟으로 변환합니다.
반복적 노이즈 제거 및 교체: 확산 과정에서 생성된 행동 시퀀스 중, 원본 데모와 일치하는 부분 (저주파수 성분) 은 실제 데모 데이터로 교체하고, 나머지 부분만 모델이 생성하도록 하여 고주파수 정밀도를 높입니다.
이를 통해 추가 데이터 수집 없이 고주파수 행동 생성 능력을 향상시킵니다.
3. 주요 기여 (Key Contributions)
Coarse-to-Fine 행동 생성: coarse 데모로부터 fine-grained 행동을 생성하는 최초의 확산-SSM 기반 정책 제안.
동적 해상도 조절 (Online Modulation): 학습된 예측기 (Predictor, ϕr) 를 통해 작업 상황에 따라 실시간으로 행동의 이산화 수준 (Step size) 을 조절할 수 있습니다. 이는 불필요한 구간에서는 coarse motion 을, 정밀한 구간에서는 fine motion 을 생성하여 추론 효율성을 극대화합니다.
데이터 효율성: 고주파수 데이터 없이도 coarse 데이터만으로 정밀한 제어를 학습할 수 있으며, 가짜 데모 생성 기법을 통해 성능을 추가적으로 향상시킵니다.
새로운 벤치마크: 다양한 주파수의 데모에서 coarse-to-fine 성능을 평가하는 새로운 시뮬레이션 및 실세계 벤치마크를 구축했습니다.
성능: 2.5Hz ~ 20Hz 의 다양한 주파수 데모로 학습하여 20Hz 타겟으로 테스트한 결과, DiSPo 는 81% 이상의 성공률을 기록했습니다.
비교: 기존 Diffusion Policy (DP-C, DP-T), Mamba 기반 모델 (D-Ma), VQ-BeT 등 최첨단 베이스라인보다 성능이 월등히 높았습니다. 특히 2.5Hz 같은 저주파수 데모에서는 베이스라인이 급격히 성능이 떨어지는 반면, DiSPo 는 안정적인 성능을 유지했습니다.
혼합 주파수 학습: 2.5Hz 와 5Hz 가 섞인 데이터로 학습했을 때, DiSPo 는 93% 의 성공률로 모든 베이스라인을 압도했습니다.