FAVLA: A Force-Adaptive Fast-Slow VLA model for Contact-Rich Robotic Manipulation
이 논문은 고주파 힘/토크 피드백과 저주파 비전 - 언어 - 행동 (VLA) 모델의 주파수 불일치 문제를 해결하기 위해, 느린 VLM 이 힘 변이를 예측하고 빠른 액션 전문가 (AE) 가 이를 기반으로 적응적으로 실행 주기를 조절하는 'FAVLA'를 제안하여 접촉이 많은 로봇 조작의 반응성과 성공률을 크게 향상시킨다는 내용입니다.
이 논문은 로봇이 물건을 만지고 조립할 때, 마치 유능한 마술사처럼 정교하게 움직일 수 있게 해주는 새로운 기술인 **'FAVLA'**를 소개합니다.
기존의 로봇은 눈으로 보고 언어로 지시를 받으면 "이렇게 움직여라"라고 명령을 내렸는데, 실제 손이 닿는 순간의 미세한 변화 (충격, 미끄러짐, 압력) 를 실시간으로 반영하지 못해 실패하거나 물건을 부러뜨리는 경우가 많았습니다.
이 문제를 해결하기 위해 FAVLA 는 '느린 두뇌'와 '빠른 반사 신경'을 분리하는 독특한 방식을 사용합니다.
🧠 1. 느린 두뇌 (Slow VLM): "큰 그림을 그리는 지휘자"
역할: 카메라로 주변을 보고, 언어 지시를 이해하며, "앞으로 어떤 일이 일어날지" 큰 흐름을 파악합니다.
속도: 생각에 시간이 걸리므로 느리게 작동합니다 (예: 1 초에 1 번).
비유: 마치 오케스트라의 지휘자 같습니다. 전체적인 곡의 흐름 (시각, 언어) 을 보고 "이제부터 바이올린 소리가 강해질 거야"라고 미리 예측합니다. 하지만 악보 하나하나를 매 순간 다 바꾸지는 않습니다.
⚡ 2. 빠른 반사 신경 (Fast Action Expert): "순간 반응하는 수석 연주자"
역할: 로봇의 손끝에 달린 힘 센서 (Force Sensor) 의 데이터를 실시간으로 받아, "아! 지금 힘이 너무 세졌다!"라고 느끼면 즉시 손을 빼거나 힘을 조절합니다.
속도:매우 빠르게 작동합니다 (예: 1 초에 100 번 이상).
비유: 지휘자의 지시를 받지만, 실제 악기를 연주하는 수석 연주자입니다. 지휘자가 "강하게"라고 신호를 보내기 전에, 연주자가 악기의 진동 (힘의 변화) 을 느끼고 즉흥적으로 음을 조절합니다.
🔄 3. FAVLA 의 핵심 비법: "예측에 따른 속도 조절"
기존 방식은 무조건 느린 속도로만 모든 데이터를 처리하거나, 반대로 무조건 빠른 속도로만 작동해서 비효율적이었습니다. FAVLA 는 이 두 가지를 스마트하게 섞습니다.
상황 1: 공중을 날아갈 때 (접촉 전)
로봇이 물건을 잡으러 가는 중이라면, 힘의 변화가 거의 없습니다.
이때는 '느린 두뇌'가 주도하고, '빠른 반사 신경'은 쉬면서 에너지를 아낍니다. (비유: 지휘자가 지휘봉을 천천히 움직일 때, 연주자는 편안하게 숨을 고릅니다.)
상황 2: 물건에 닿을 때 (접촉 중)
로봇이 USB 를 꽂거나 나사를 조일 때, 힘의 변화가 급격히 일어납니다.
이때는 '느린 두뇌'가 "지금부터 힘이 변할 거야!"라고 미리 예측하면, '빠른 반사 신경'이 순식간에 속도를 높여 (1 초에 여러 번) 힘을 조절합니다. (비유: 지휘자가 "지금부터 클라이맥스!"라고 외치자, 연주자들이 악보를 넘기며 속주 (빠른 연주기법) 를 시작합니다.)
🎯 왜 이것이 중요한가요? (실제 효과)
이 기술을 적용한 로봇은 다음과 같은 놀라운 성과를 냈습니다.
부드러운 터치: USB 를 꽂거나 기어를 조립할 때, 너무 세게 꽉 잡아서 부러뜨리지 않고 정확하게 끼워 넣습니다. (기존 로봇보다 성공률이 13.8% 나 높음)
안전한 작업: 물체가 깨지지 않도록 힘을 아주 정교하게 조절합니다. (최대 힘 사용량이 크게 줄어듦)
효율성: 불필요하게 빠르게 움직일 때는 에너지를 아끼고, 필요한 순간에만 폭발적인 반응력을 발휘합니다.
📝 한 줄 요약
FAVLA는 로봇에게 "생각은 차분하게, 반응은 번개처럼" 하도록 가르친 기술입니다. 마치 유능한 요리사가 큰 냄비 (시각/언어) 를 천천히 저으면서도, 뜨거운 기름이 튀는 순간 (접촉/힘) 에는 손놀림을 순식간에 바꿔서 요리를 완벽하게 해내는 것과 같습니다. 이로 인해 로봇이 공장에서 정밀한 조립 작업을 할 때 훨씬 더 안전하고 똑똑해졌습니다.
1. 문제 정의 (Problem Definition)
기존의 비전 - 언어 - 행동 (VLA, Vision-Language-Action) 모델은 대규모 언어 모델 (VLM) 의 의미론적 일반화 능력과 연속 제어 정책 (Action Expert) 을 결합하여 로봇 조작을 수행합니다. 그러나 접촉이 풍부한 (Contact-Rich) 작업 (예: 정밀 조립, 삽입 작업) 에서는 다음과 같은 한계가 존재합니다.
샘플링 주파수 불일치: 로봇의 비전 센서 (카메라, 보통 1530Hz) 와 힘/토크 센서 (1001000Hz) 는 서로 다른 주파수로 작동합니다. 기존 방법들은 모든 모달리티를 단일 주파수로 통합하기 위해 고주파수 힘 데이터를 저주파수로 다운샘플링합니다. 이로 인해 즉각적인 교정이 필요한 반응형 힘 피드백 신호가 손실됩니다.
오픈 루프 제어의 지연: 일반적인 VLM-Action Expert 파이프라인은 비싼 VLM 업데이트 사이에서 행동 청크 (Action Chunks) 를 오픈 루프 (Open-loop) 방식으로 실행합니다. 이는 충돌, 스틱 - 슬립 (Stick-slip), 힘 스파이크와 같은 급격한 접촉 변화에 대한 반응이 지연되어 작업 실패나 부품 손상으로 이어질 수 있습니다.
2. 제안 방법 (Methodology: FAVLA)
저자들은 FAVLA (Force-Adaptive Fast-Slow VLA) 를 제안하여 느린 의미론적 계획과 빠른 접촉 인식 제어를 분리하면서도 엔드 - 투 - 엔드 학습을 유지합니다.
A. Force-Injected Fast-Slow 아키텍처
모델은 두 가지 주요 구성 요소로 나뉩니다.
Slow VLM Backbone (느린 백본):
고정된 낮은 주파수로 실행됩니다.
비전, 언어, 그리고 과거의 힘 데이터 히스토리를 통합하여 잠재적 컨텍스트 표현 (Latent Representation) 을 생성합니다.
생성된 KV Cache(키/밸리 캐시) 를 빠른 모듈에 재사용하여 계산 효율성을 높입니다.
Fast Action Expert (빠른 행동 전문가):
가변적인 높은 주파수로 실행됩니다.
최신의 고주파수 힘 데이터와 proprioceptive 상태 (관성 상태) 를 기반으로 행동 청크를 정제합니다.
Force Adapter (힘 어댑터): 힘 데이터를 단순히 입력 토큰으로 추가하는 대신, Transformer 의 여러 레이어에 크로스 어텐션 (Cross-Attention) 을 통해 직접 주입 (Inject) 합니다. 이를 통해 희소한 힘 신호가 희석되지 않고 행동에 직접적인 영향을 미치도록 합니다.
B. Force-Adaptive Inference Strategy (적응형 추론 전략)
미래 힘 변동 예측: VLM 은 추가적인 헤드를 통해 미래의 힘 변동성 (Force Variance) 을 예측합니다.
동적 주파수 스케줄링: 예측된 힘 변동성을 기반으로 Action Expert 의 실행 주파수를 동적으로 조절합니다.
자유 공간 이동 시: 힘 변동이 적으면 주파수를 낮춰 (n=1) 계산 비용을 절감합니다.
접촉 발생 시/직전: 힘 변동이 클 것으로 예측되면 주파수를 높여 (n>1) 실시간으로 행동을 교정하고 반응합니다.
일관된 행동 앙상블: 반복적인 추론으로 인한 행동 불일치를 방지하기 위해, 동일한 시각 사이클 내에서는 샘플링 노이즈를 고정하고 시간적 앙상블 (Temporal Ensemble) 을 적용하여 부드러운 동작을 유도합니다.
3. 주요 기여 (Key Contributions)
Force-Adaptive Fast-Slow 프레임워크: 느린 의미 모달리티 (비전, 언어, 힘 히스토리) 와 빠른 상호작용 신호 (최신 힘 데이터) 를 융합하여 폐루프 (Closed-loop) 접촉 제어 가능.
Force-Injected Action Expert: Force Adapter 를 통해 고주파수 힘 피드백을 여러 레이어에 주입하여 행동 청크를 직접 힘 조건에 따라 수정.
적응형 추론 전략: VLM 이 예측한 미래 힘 변동성을 기반으로 Action Expert 의 실행 주파수를 동적으로 스케줄링하여 접촉 시 반응성을 극대화.
실제 로봇 실험 검증: 다양한 접촉 풍부 작업에서 기존 방법 대비 성공률 향상 및 최대 접촉 힘 감소 입증.
4. 실험 결과 (Results)
저자들은 USB 삽입, 기어 조립, 상자 뒤집기, 보드 닦기 등 4 가지 실제 접촉 풍부 작업에서 FAVLA 를 평가했습니다.
성공률 (Success Rate):
FAVLA 는 평균 80.8% 의 성공률을 기록했습니다.
기존 최강 베이스라인 (ForceVLA) 대비 13.8%p 향상되었으며, 비전 전용 π0 모델 대비 38.0%p 크게 개선되었습니다.
특히 정밀도가 요구되는 '기어 조립 (93.3%)'과 힘 제어가 중요한 '보드 닦기 (70.0%)'에서 뛰어난 성능을 보였습니다.
접촉 힘 제어 (Peak Contact Forces):
기어 조립 작업에서 최대 접촉 힘을 7.7N으로 낮췄으며, 이는 비전 전용 모델 (12.0N) 대비 4.3N 감소한 수치입니다.
이는 과도한 힘으로 인한 부품 손상 위험을 크게 줄였음을 의미합니다.
애블레이션 연구 (Ablation Study):
힘 주입 (Force Injection), 힘 분산 예측 (Force Variance Prediction), 적응형 주파수 조절 (Adaptive Frequency) 모듈을 순차적으로 추가할 때 성능이 점진적으로 향상됨을 확인했습니다.
고정된 주파수 (n=1, 2, 4) 보다 적응형 주파수 전략이 모든 작업에서 더 높은 성공률을 보였습니다.
5. 의의 및 결론 (Significance)
FAVLA 는 로봇 조작 분야에서 센서 주파수 불일치와 오픈 루프 제어의 한계를 해결하는 새로운 패러다임을 제시합니다.
산업적 적용 가능성: 고정밀 조립 및 접촉이 필요한 산업 환경에서 로봇의 안전성, 신뢰성, 효율성을 크게 향상시킬 수 있습니다.
기술적 혁신: 의미론적 추론 (느림) 과 반사적 제어 (빠름) 를 시간 척도 (Time Scale) 에 따라 분리하면서도 통합된 엔드 - 투 - 엔드 학습을 가능하게 하여, 복잡한 물리적 상호작용을 가진 작업을 성공적으로 수행할 수 있는 기반을 마련했습니다.
결론적으로, FAVLA 는 힘 피드백을 단순히 입력으로 추가하는 것을 넘어, 힘의 특성에 맞춰 제어 주파수를 적응적으로 조절함으로써 접촉이 풍부한 로봇 조작의 성능 한계를 돌파한 획기적인 연구입니다.