한 번에 멀리 생각하기 (큰 덩어리): "지금부터 10 초 뒤까지의 모든 움직임을 미리 정해놓고 실행하자!"
장점: 움직임이 매끄럽고, 로봇이 덜 흔들립니다.
단점: 갑자기 장애물이 나타나거나 상황이 바뀌면, 미리 정해진 계획 때문에 대응이 느립니다. (예: 길을 가다가 갑자기 사람이 튀어나와도 미리 정해진 길로만 걷는 꼴)
매번 다시 생각하기 (작은 덩어리): "지금 이 순간의 움직임만 정하고, 다음 순간에 다시 생각하자!"
장점: 상황에 따라 즉각적으로 반응할 수 있습니다.
단점: 계획이 자주 바뀌다 보니 로봇이 덜덜 떨리거나 (Jerky behavior), 엉뚱한 방향으로 움직일 수 있습니다.
지금까지의 로봇들은 이 두 가지 중 하나를 고정된 값으로 정해두고 사용했습니다. 마치 "무조건 10 초 계획"이나 "무조건 1 초 계획"처럼요. 하지만 문제는 상황마다 최적의 계획 길이가 다르다는 것입니다.
책상 위를 빠르게 이동할 때: 미리 10 초 계획을 세우는 게 좋습니다.
작은 컵을 잡을 때: 1 초 단위로 꼼꼼히 확인하며 움직여야 합니다.
💡 이 논문의 해결책: "불확실성 감지 센서" (AAC)
이 논문은 **"로봇이 스스로 '내가 지금 얼마나 확신할 수 있는지'를 판단하게 하자"**고 제안합니다. 이를 위해 **'행동 엔트로피 (Action Entropy)'**라는 개념을 사용합니다.
이걸 운전에 비유해 볼까요?
엔트로피가 낮을 때 (확신 있음): "아, 내가 지금 차를 잘 몰고 있어! 길도 잘 알고 있어."
👉 전략: **긴 계획 (큰 덩어리)**을 세웁니다. "앞으로 100m 는 그냥 직진하자." (효율성 UP)
엔트로피가 높을 때 (불확실함): "어? 앞이 안 보이네? 혹은 내가 지금 핸들을 너무 꺾었나?"
👉 전략: **짧은 계획 (작은 덩어리)**으로 바꿉니다. "일단 1 초만 천천히 움직이고 다시 확인하자." (안전성 UP)
이 논문에서 제안한 **AAC(Adaptive Action Chunking)**는 바로 이 원리를 적용한 것입니다. 로봇이 실행하는 도중, **"내가 지금 예측한 움직임이 얼마나 불안한가?"**를 계산해서, 불안하면 계획을 짧게, 안정적이면 계획을 길게 자동으로 조절합니다.
🎯 왜 이것이 혁신적인가요?
재교육 불필요: 로봇을 다시 가르칠 필요 (학습) 가 없습니다. 이미 훈련된 로봇에게 이 '스마트한 조절기'만 달아주면 됩니다.
상황에 맞는 유연성:
이동 중: 로봇이 물건을 들고 이동할 때는 큰 덩어리로 빠르게 움직입니다.
작업 중: 물건을 잡거나 버튼을 누르는 정밀한 순간에는 작은 덩어리로 세밀하게 움직입니다.
마치 인간이 걸을 때는 크게 걷다가, 바늘에 실을 끼울 때는 손끝을 미세하게 조절하는 것과 똑같은 원리입니다.
📊 실제 결과: 로봇이 더 똑똑해졌습니다!
실험 결과, 이 방식을 적용한 로봇은 다음과 같은 성과를 냈습니다.
시뮬레이션 및 실제 로봇: 다양한 작업 (접시 옮기기, 버튼 누르기, 서랍 닫기 등) 에서 성공률이 크게 향상되었습니다.
안전성: 로봇이 테이블에 부딪히거나 넘어지는 사고가 줄었습니다. 불확실한 순간에 로봇이 "일단 멈추고 다시 생각하자"라고 판단하기 때문입니다.
빠른 속도: 불필요하게 자주 계획을 세우는 일을 줄여서, 전체 작업 시간도 효율적이었습니다.
📝 한 줄 요약
"로봇에게 '언제 크게 생각하고, 언제 작게 생각할지' 스스로 판단하게 하여, 매끄럽고 안전한 작업을 가능하게 한 기술입니다."
이 기술은 로봇이 단순히 명령을 따르는 기계가 아니라, 상황을 읽고 유연하게 대처하는 똑똑한 파트너가 되는 데 중요한 첫걸음이 될 것입니다.
1. 문제 정의 (Problem)
비전 - 언어 - 행동 (VLA, Vision-Language-Action) 모델은 로봇 조작 능력을 향상시키기 위해 '액션 청킹 (Action Chunking)' 기술을 사용합니다. 이는 중간 재계획 없이 일련의 행동 시퀀스를 실행하는 방식입니다. 그러나 기존 접근 방식에는 다음과 같은 근본적인 한계가 존재합니다.
고정된 청크 크기의 비효율성: 현재 대부분의 VLA 모델은 추론 시 (Inference-time) 경험적으로 고정된 청크 크기 (예: 16, 25 등) 를 사용합니다.
반응성 vs 일관성의 딜레마:
큰 청크 크기: 시간적 일관성 (Temporal Consistency) 은 높지만, 새로운 정보에 대한 모델의 반응성 (Reactivity) 이 떨어집니다.
작은 청크 크기: 반응성은 높지만, 청크 간의 불연속성으로 인해 모드 점프 (Mode-jumping) 나 거친 행동 (Jerky behavior) 이 발생할 확률이 높아집니다.
작업별 최적값의 부재: 다양한 조작 작업 (예: 단순 이동 vs 정밀 그리퍼 제어) 에 따라 최적의 청크 크기가 달라지는데, 고정된 크기는 이러한 다양성을 반영하지 못해 성능 저하를 초래합니다.
2. 제안 방법: 적응형 액션 청킹 (AAC)
이 논문은 추론 시 고정된 크기를 사용하지 않고, **행동 엔트로피 (Action Entropy)**를 기반으로 동적으로 최적의 청크 크기를 결정하는 적응형 액션 청킹 (Adaptive Action Chunking, AAC) 전략을 제안합니다.
핵심 메커니즘
행동 엔트로피 활용:
모델이 예측한 행동의 불확실성을 정량화하기 위해 엔트로피를 사용합니다.
높은 엔트로피 (High Entropy): 예측의 불확실성이 높음 → 행동 품질이 낮음 →작은 청크 크기를 선택하여 빈번한 재계획 (Replanning) 으로 반응성을 높임.
낮은 엔트로피 (Low Entropy): 예측이 신뢰할 수 있음 → 행동 품질이 높음 →큰 청크 크기를 선택하여 시간적 일관성과 추론 효율성을 높임.
최적 청크 크기 결정 알고리즘:
다양한 청크 크기 (h) 에 대해 평균 행동 엔트로피 (Eh) 를 계산합니다.
연속된 청크 크기 간의 엔트로피 차이 (Eh+1−Eh) 가 최대가 되는 지점을 찾습니다.
공식: h∗=max(argmaxh(Eh+1−Eh),ξ)
여기서 ξ는 최소 행동 크기를 보장하는 하한선입니다.
이 과정은 추가적인 학습이나 아키텍처 수정 없이 추론 시에만 수행됩니다.
적용 범위:
연속 제어 (이동, 회전) 에는 가우시안 미분 엔트로피를, 이산 제어 (그리퍼 개폐) 에는 이산 엔트로피 공식을 적용하여 다양한 로봇 형태에 일반화됩니다.
3. 주요 기여 (Key Contributions)
고찰: 확산 기반 (Diffusion-based) VLA 모델에서 추론 시 적응형 액션 청킹의 중요성을 분석하고, 고정된 크기의 한계를 지적했습니다.
알고리즘 제안: 행동 엔트로피를 신호로 활용하여 추론 시 동적으로 청크 크기를 조절하는 간단하지만 효과적인 AAC 알고리즘을 개발했습니다.
광범위한 검증: 시뮬레이션 벤치마크 (RoboCasa, LIBERO) 와 실제 로봇 실험을 통해 기존 최첨단 (SOTA) 방법 및 고정 크기 베이스라인 대비 우수한 성능을 입증했습니다.
4. 실험 결과 (Results)
시뮬레이션 실험 (RoboCasa & LIBERO)
RoboCasa: 24 가지 주방 조작 작업에서 AAC 는 평균 **2.3%**의 성공률 향상을 보였습니다. 특히 정밀한 회전 조작 (Rotation) 작업에서 57.6% → 61.4% 로 큰 개선을 이루었습니다.
LIBERO: 4 가지 작업 스위트에서 평균 성공률이 94.1% → 95.0% 로 향상되었으며, 가장 어려운 장기 작업 (LIBERO-Long) 에서 4% 의 큰 향상을 보였습니다.
고정 크기 비교: 다양한 고정 크기 (h=2,4,8,12,16) 를 가진 GR00T 모델과 비교했을 때, AAC 는 모든 고정 크기 설정보다 평균적으로 우수한 성능을 보였습니다.
동적 적응성: AAC 는 작업의 의미론적 단계에 따라 청크 크기를 자동으로 조절했습니다.
물체 접근/이동 단계: 큰 청크 크기 (빠른 이동)
정밀 조작/그리핑 단계: 작은 청크 크기 (정밀 제어)
실제 로봇 실험 (Real-world)
환경: Realman 단일 암 로봇과 Mycobot 그리퍼를 사용하여 바나나 집기, 비상 버튼 누르기, 서랍 닫기 등 3 가지 실제 작업을 수행했습니다.
성능: AAC 를 적용한 GR00T 는 베이스라인 대비 평균 **15%**의 성공률 향상 (67.0% → 82.0%) 을 기록했습니다.
안전성 및 정밀도: 고정 크기 모델은 초기 관측 시 낮은 품질의 행동으로 인해 테이블과 충돌하는 경향이 있었으나, AAC 는 엔트로피가 높은 불확실한 행동을 필터링하여 적절한 위치에서 정지하거나 부드럽게 조작하여 안전성을 크게 높였습니다.
효율성
계산 비용: 엔트로피 계산을 위해 여러 샘플 (기본값 20 개) 을 병렬 생성하지만, GPU 배치 처리를 통해 추론 지연은 약 20ms 수준으로 미미하며, 고성능 GPU 로는 더 줄일 수 있습니다.
범용성: GR00T N1.5 뿐만 아니라 π0 백본에서도 우수한 일반화 성능을 보였습니다.
5. 의의 및 결론 (Significance)
이 연구는 VLA 모델의 추론 과정에서 고정된 하이퍼파라미터 (청크 크기) 에 대한 의존성을 탈피했다는 점에서 의의가 있습니다.
인간 직관 모방: 인간이 이동 시에는 빠르게 움직이고 (큰 청크), 정밀 조작 시에는 세심하게 조절하는 (작은 청크) 직관적인 전략을 모델이 자동으로 학습하지 않고도 추론 시 엔트로피를 통해 구현할 수 있음을 증명했습니다.
실용성: 추가 학습 없이 기존 모델에 바로 적용 가능하여 다양한 로봇 작업 환경에서의 확장성과 견고성을 보장합니다.
성능 극대화: 반응성과 일관성 사이의 균형을 최적화함으로써, 복잡한 장기 작업 및 정밀 조작 작업에서 로봇의 성공률과 안전성을 동시에 향상시킵니다.
결론적으로, AAC는 VLA 기반 로봇 제어의 성능 한계를 극복하고 실제 세계 배포를 위한 핵심 기술로 자리 잡을 수 있는 강력한 방법론입니다.