Tube Diffusion Policy: Reactive Visual-Tactile Policy Learning for Contact-rich Manipulation
이 논문은 접촉이 빈번한 조작 작업에서 발생하는 불확실성에 신속하게 대응하기 위해, 확산 기반 모방 학습(Diffusion Imitation Learning)과 튜브 기반 피드백 제어(Tube-based Feedback Control)를 결합하여 시각 및 촉각 피드백을 통한 실시간 반응형 제어를 가능하게 하는 'Tube Diffusion Policy(TDP)' 프레임워크를 제안합니다.
원저자:Teng Xue, Alberto Rigo, Bingjian Huang, Jiayi Shen, Zhengtong Xu, Nick Colonnese, Amirhossein H. Memar
기존의 똑똑한 로봇(Diffusion Policy 등)은 마치 **'미리 짜인 대본'**대로 움직이는 배우와 같습니다.
기존 방식 (Action Chunking): 로봇이 동작을 시작하기 전에 "앞으로 5초 동안은 이렇게 움직여야지!"라고 아주 정교한 계획(대본)을 세웁니다. 그리고 그 계획이 끝날 때까지는 중간에 무슨 일이 생겨도 눈을 감고 그 계획대로만 움직입니다.
문제점: 만약 로봇이 컵을 옮기다가 누군가 실수로 컵을 툭 쳤다면? 기존 로봇은 "어? 컵이 밀렸네?"라고 인지하기 전에 이미 계획된 동작(허공을 휘젓는 동작)을 끝까지 수행해 버립니다. 즉, **'반응 속도'**가 느리고 **'유연함'**이 부족합니다.
2. TDP의 해결책: "내비게이션과 핸들링의 만남" 🚗🗺️
이 논문에서 제안한 **TDP (Tube Diffusion Policy)**는 이 문제를 **'튜브(Tube)'**라는 개념으로 해결했습니다.
비유하자면: 기존 방식이 "정해진 경로로만 가!"라고 명령하는 것이라면, TDP는 **"이 길(튜브) 안에서만 움직이되, 상황 봐서 핸들은 네가 실시간으로 꺾어!"**라고 말하는 것과 같습니다.
TDP는 두 가지 단계를 동시에 수행합니다:
거시적 계획 (Diffusion Phase - "지도 보기"): 먼저 로봇은 전체적인 목표를 달성하기 위한 큰 흐름(대본)을 만듭니다. 하지만 이건 아주 완벽할 필요는 없습니다. 대략적인 길만 잡아주는 거죠.
미시적 반응 (Streaming Phase - "실시간 핸들링"): 이제 로봇은 움직이면서 눈(카메라)과 손가락 끝의 감각(촉각 센서)을 통해 실시간으로 상황을 살핍니다. 만약 물체가 미끄러지면, 미리 정해진 '튜브(안전 범위)' 안에서 즉각적으로 손가락 힘을 조절하거나 방향을 틀어 물체를 다시 잡습니다.
3. 왜 '튜브(Tube)'인가요? 🍩
'튜브'라는 이름이 붙은 이유는 로봇이 움직이는 경로 주위에 **'안전한 통로'**를 설정했기 때문입니다.
로봇은 이 통로(튜브) 밖으로 벗어나지 않으려고 노력하면서, 통로 안에서는 아주 빠르게(초당 수십~백 번 이상) 미세하게 움직임을 수정합니다.
이 덕분에 로봇은 "전체적인 목표는 잊지 않으면서도, 눈앞의 돌발 상황에는 즉각 반응하는" 아주 영리한 움직임을 보여줍니다.
4. 요약하자면 (결론) 🌟
이 논문의 핵심 성과는 다음과 같습니다:
더 똑똑한 반응: 물체가 밀리거나 손가락에 예상치 못한 힘이 가해져도 당황하지 않고 즉시 대처합니다. (실제 실험에서 컵을 열거나 물체를 돌리는 동작을 성공적으로 수행!)
더 빠른 속도: 예전에는 완벽한 계획을 세우느라 로봇이 '생각(연산)'하느라 멈칫거렸다면, TDP는 대략적인 계획만 세우고 나머지는 실시간 흐름에 맡기기 때문에 훨씬 빠르고 부드럽게 움직입니다.
한 줄 요약: "미리 정해진 대본대로만 움직이던 로봇에게, **실시간 감각을 통해 대본 안에서 유연하게 대처할 수 있는 '순발력'**을 선물한 기술"이라고 할 수 있습니다.
[기술 요약] Tube Diffusion Policy (TDP): 접촉 중심 조작을 위한 반응형 시각-촉각 정책 학습
1. 문제 정의 (Problem Statement)
로봇의 **접촉 중심 조작(Contact-rich manipulation)**은 물체의 기하학적 불확실성, 마찰력 변화, 외부 방해(disturbance) 등 복잡한 물리적 상호작용을 포함합니다. 이를 해결하기 위해서는 시각(Vision)과 촉각(Tactile) 피드백을 결합한 고주파수의 **반응형 제어(Reactive Control)**가 필수적입니다.
기존의 생성형 모방 학습(예: Diffusion Policy)은 다음과 같은 한계가 있습니다:
액션 청킹(Action Chunking)의 한계: 추론 속도를 높이기 위해 미래의 액션 시퀀스를 한꺼번에 생성하고 실행하는 '청킹' 방식을 사용하지만, 이는 실행 과정에서 발생하는 예기치 못한 관측값에 대응하지 못하는 개루프(Open-loop) 방식으로 작동합니다.
높은 추론 지연(Inference Latency): 매 타임스텝마다 확산 모델(Diffusion model)을 통해 액션을 생성하는 것은 계산 비용이 너무 커서, 실시간 고주파 피드백 제어에 부적합합니다.
2. 제안 방법론 (Methodology: Tube Diffusion Policy)
본 논문은 확산 기반 모방 학습과 **튜브 기반 피드백 제어(Tube-based feedback control)**를 결합한 **TDP(Tube Diffusion Policy)**를 제안합니다. 핵심 아이디어는 액션 시퀀스를 고정된 덩어리로 실행하는 대신, 명목 궤적(Nominal trajectory) 주변에 **'액션 튜브(Action Tube)'**를 형성하여 그 안에서 실시간으로 액션을 수정하는 것입니다.
A. 이중 시간 공식화 (Dual-Time Formulation)
TDP는 두 가지 서로 다른 시간 척도를 사용하여 하나의 네트워크로 두 가지 모드를 수행합니다:
확산 시간 (t1): 시스템이 정지된 상태에서 확산 모델을 통해 전체 비선형 역학을 고려한 초기 액션(명목 궤적)을 생성하는 단계입니다.
궤적 시간 (t2): 물리적 시스템이 움직이는 동안, 매 타임스텝마다 새로운 관측값(ht2)을 조건으로 하여 액션의 속도장(Velocity field)을 따라 액션을 미세 조정하는 스트리밍 단계입니다.
B. 핵심 메커니즘
Diffusion Phase (Chunk-level): 확산 모델이 복잡한 비선형 접촉 역학을 반영하여 액션 궤적의 초기값을 생성합니다. 이는 시스템의 큰 흐름을 잡는 역할을 합니다.
Streaming Phase (Step-wise): 학습된 **관측 조건부 피드백 흐름(Observation-conditioned feedback flow)**을 사용하여, 실행 중 발생하는 오차를 명목 궤적(튜브 중심)으로 다시 끌어당깁니다. 이는 마치 제어 이론의 Tube MPC와 유사하게 작동하여 국부적인 안정성을 보장합니다.
Action Tube: 확산 모델이 생성한 궤적을 중심으로, 스트리밍 흐름이 액션을 허용 범위(Tube) 내에서 실시간으로 조정함으로써 반응성을 확보합니다.
3. 주요 기여 (Key Contributions)
Action Tube 개념 도입: 액션 청킹에 학습된 국부 피드백 흐름을 결합하여, 실행 중 실시간 반응이 가능한 새로운 제어 패러다임을 제시했습니다.
TDP 아키텍처 제안: 확산 기반 액션 생성과 스트리밍 피드백 흐름을 통합한 이중 시간 구조의 신경망 아키텍처를 설계했습니다.
이론적 안정성 분석: 확산 모델이 주기적으로 오차를 수정하고, 스트리밍 단계가 국부적인 수렴을 보장함으로써 시스템이 균등 최종 유계(Uniformly Ultimately Bounded) 상태를 유지함을 수학적으로 증명했습니다.
효율성 증대: 튜브 구조 덕분에 확산 단계에서 매우 적은 수의 디노이징(Denoising) 단계만으로도 안정적인 실행이 가능해져 추론 지연 시간을 획기적으로 줄였습니다.
4. 실험 결과 (Results)
A. 시뮬레이션 (Push-T 및 Dexterous Manipulation)
Push-T 벤치마크: 기존의 Diffusion Policy(DP), Flow Matching, SFP 등 최신 모델보다 높은 성공률을 기록했으며, 특히 적은 단계로도 성공적인 과업 수행이 가능함을 보였습니다.
Dexterous Manipulation (Unreal Engine): 안정적인 파지(Stable Grasping) 및 물체 재배향(Reorientation) 작업에서 기존 모델들을 압도하는 성능을 보였습니다. 특히 확산 단계 없이 스트리밍만 사용할 경우 성능이 급격히 저하되는 것을 통해 두 단계의 상호보완성을 입증했습니다.
B. 실제 로봇 실험 (Real-world Experiments)
Jar Opening & On-table Reorientation: 실제 Allegro 손과 Franka 로봇을 사용하여 실험한 결과, TDP는 외부 방해(손가락을 구부리거나 물체 위치를 옮기는 등)에 대해 매우 빠르게 반응하여 성공적으로 과업을 완수했습니다.
지연 시간 감소: DP가 높은 성공률을 위해 많은 디노이징 단계가 필요한 반면, TDP는 단 2~3단계의 디노이징만으로도 높은 성공률을 유지하며, 훨씬 높은 제어 주파수(100Hz 이상)를 달 수 있음을 확인했습니다.
5. 의의 (Significance)
본 논문은 **생성형 모델의 표현력(Expressiveness)**과 **전통적 제어 이론의 강건성(Robustness)**을 성공적으로 결합했습니다. 특히, 고차원 로봇 제어에서 고질적인 문제였던 '생성 모델의 느린 속도'와 '청킹 방식의 반응성 부족'이라는 두 마리 토끼를 모두 잡았습니다. 이는 향후 시각-촉각 피드백이 중요한 복잡한 로봇 조작 분야에서 매우 실용적이고 강력한 프레임워크가 될 것으로 기대됩니다.