기술 요약: 인컨텍스트 VLA (VLA-Talker)
문제 정의
Vision-Language-Action (VLA) 모델은 일반적인 로봇 조작을 위한 표준이 되었으며, 일반적으로 정적 이미지와 고정된 지침에 조건화된 전문가 액션 청크(action chunks)를 모방하도록 행동 복제(behavior cloning, BC)를 통해 훈련됩니다. 효과적이긴 하지만, 이러한 모델들은 두 가지 주요 한계점을 가집니다:
- 불투명한 조건화(Opaque Conditioning): 지침이 이해된 개념이 아니라 암기된 문자열로 취급됩니다. 따라서 패러프레이징(paraphrasing)을 하거나 보지 못한 유의어를 사용하면 성능이 저하됩니다.
- 수동적 지각(Passive Perception): 정책(policy)이 단일 피드포워드 패스(feed-forward pass)로 관측치를 소비하며, 정보(예: 물체의 위치)가 즉시 보이지 않을 때 능동적으로 누락된 정보를 탐색하는 능력이 부족합니다.
이를 해결하기 위한 자연스러운 가설은 Chain-of-Thought (CoT)를 통한 명시적 추론을 주입하는 것입니다. 그러나 저자들은 자유 형식의 생성형 CoT가 다음과 같은 세 가지 이유로 저수준 제어(low-level control)에 해롭다는 것을 입증했습니다:
- 그라운딩 격차(Grounding Gap): 근거(rationale)가 액션 헤드와 동일한 정적 특징으로부터 생성되므로 새로운 증거를 추가하지 못합니다. 만약 모델이 위치를 환각(hallucinate)한다면, 이는 액션 헤드를 적극적으로 오도하게 됩니다.
- 목적 함수 간섭(Objective Interference): 단일 자기회귀 손실(autoregressive loss) 내에서, 방대한 양의 언어 토큰(추론용)이 소수의 액션 토큰에 대한 그래디언트 신호를 압도하여, 정책이 정확한 행위자가 되기보다는 "유창한 화자"가 되도록 밀어붙입니다.
- 지연 및 드리프트(Latency and Drift): 결정당 수백 개의 추론 토큰을 생성하는 것은 폐쇄 루프(closed-loop) 타이밍을 깨뜨리며, 자기회귀 접두사(prefix)에서의 오류가 액션 접미사(suffix)로 전파됩니다.
저자들은 VLA가 언어를 생성할 능력이 필요한 것이 아니라, 그라운딩된 언어를 소비(consume)할 능력이 필요하다고 주장합니다.
방법론: VLA-Talker
본 논문은 VLA-Talker를 소개하며, 이는 **인컨텍스트 사후 훈련(in-context post-training)**과 **에이전트 도구 사용(agentic tool use)**을 통해 VLA 모델에 언어 역량을 부여하고, 증거 획득과 증거 소비를 분리합니다.
1. 그라운딩된 증거를 위한 에이전트 도구 사용
텍스트 형태의 추론을 생성하는 대신, 시스템은 특정 쿼리에 답하기 위해 특화된 도구를 질의하는 외부 에이전트 루프로 증거 획득을 위임합니다: 그리퍼와 작업 관련 물체의 이미지 공간 위치 및 상대적 깊이는 무엇인가?
- 깊이 및 기하학: 단안 깊이 추정기(monocular depth estimator)가 상대적 깊이 순서를 제공합니다.
- 물체 로컬라이제이션: 오픈 보캐블러리 검출기(예: GroundingDino)가 물체를 로컬라이즈합니다. 검출기가 불확실할 경우, 에이전트 폴백(fallback)이 시각-언어 모델(VLM)에 질적 묘사나 근사 좌표를 질의합니다.
- 그리퍼 투영: 프로프리오셉션(proprioception)으로부터 얻은 그리퍼의 세계 위치는 카메라 내부 파라미터(intrinsics)를 사용하여 이미지 공간으로 분석적으로 투영되며, 학습 없이도 정확한 픽셀 좌표를 제공합니다.
- 증거 튜플: 출력은 좌표, 깊이, 관계를 포함하는 구조화된 튜플입니다 (예: "머그컵은 그리퍼로부터 오른쪽으로 42px, 0.08m 더 깊은 곳에 있음").
2. 다양한 캡션 렌더링
정책이 단일 템플릿에 과적합되는 것을 방지하기 위해, 데이터 엔진은 원시 증거 튜플을 다양하게 패러프레이징된 자연어 설명으로 렌더링합니다. 이 설명들은 다음 요소들이 변합니다:
- 양상(Modality): 절대 좌표 vs 상대적 오프셋 vs 질적 묘사.
- 참조 프레임: 자기중심적(egocentric, 그리퍼 기준) vs 외부중심적(allocentric, 카메라/테이블 기준).
- 어휘 및 구문 형태: 물체 및 공간 전치사에 대한 유의어.
- 장황도(Verbosity): 짧은 문장 vs 상세한 다중 문장 캡션.
결정적으로 기하학적 의미는 고정된 채 표면 형태(surface form)만 변하므로, 정책은 패턴을 암기하는 대신 다양한 언어를 해석하는 법을 배우게 됩니다.
3. 인컨텍스트 사후 훈련
VLA 백본은 변경되지 않습니다. 훈련 중에 렌더링된 증거는 이미지 및 지침과 함께 <spatial> 태그로 감싸져 읽기 전용 컨텍스트로서 프롬프트에 주입됩니다.
- 감독(Supervision): 손실 함수는 액션 토큰에만 적용됩니다. 증거 토큰과 지침은 마스킹 처리됩니다.
- 효과: 모델은 주입된 증거에 조건화되어 액션을 예측하는 법을 배우지만, 증거 자체를 생성하는 법은 배우지 않습니다. 이를 통해 목적 함수 간섭과 자기회귀 지연을 제거합니다.
4. 궤적 수준 RL (GRPO)
마지막 단계로, 인컨텍스트 정책은 희소 성공 보상(sparse success reward)을 사용하는 그룹 상대 정책 최적화(GRPO)를 통해 미세 조정됩니다.
- 목표: 도구 호출 타이밍과 액션 실행을 실제 작업 성공과 정렬합니다.
- 메커니즘: 정책은 도구를 맹목적으로 호출하는 대신, (예: 재그라운딩이 필요한 경우에만) 도구를 호출할 시점을 학습하여 증거 획득 비용과 작업 성공 사이의 트레이드오프를 최적화합니다.
주요 기여
- CoT에 대한 비판적 분석: 본 논문은 자유 형식의 생성형 CoT가 그라운딩 격차, 목적 함수 간섭, 지연 시간 때문에 저수준 제어를 해친다는 실증적 및 분석적 증거를 제공하며, 이를 그라운딩된 언어를 소비하는 것의 이점과 대조합니다.
- VLA-Talker 프레임워크: 에이전트 도구 사용(검출, 깊이, VLM 폴백)을 인컨텍스트 학습과 통합하여, 증거를 토큰으로 생성하는 대신 컨텍스트로 주입하는 새로운 아키텍처를 제시합니다.
- 다양한 그라운딩 언어: 구조화된 증거를 다양한 패러프레이즈로 렌더링하는 데이터 엔진을 통해, 그라운딩을 희생하지 않으면서 언어적 변이에 대한 정책의 강건성을 가르칩니다.
- 2단계 훈련: 감독 인컨텍스트 사후 훈련과 궤적 수준 RL을 결합하여 도구 사용을 작업 결과와 정렬하는 레시피를 제공합니다.
실험 결과
이 방법은 세 가지 시뮬레이션 벤치마크(LIBERO, RoboCasa-GR1, SimplerEnv)와 AgiBot G1 휴머노이드에서의 8가지 실제 작업에서 평가되었습니다.
- 성능: VLA-Talker는 모든 벤치마크에서 SOTA(최고 수준) 결과를 달성했습니다.
- LIBERO: 평균 성공률 97.4% (Gen-CoT 96.2%, VLA-Thinker 97.0% 대비).
- RoboCasa-GR1: 평균 성공률 59.5% (Gen-CoT 46.5% 대비).
- SimplerEnv: 평균 성공률 72.4% (Gen-CoT 54.7% 대비).
- 효율성: 자기회귀적 추론 토큰 생성을 피함으로써, VLA-Talker는 CoT 기반 방식에 비해 결정당 지연 시간을 4.6배 줄였습니다 (359ms에서 78ms로). 이를 통해 더 높은 제어 빈도(~12.8 Hz vs 2.8 Hz)를 가능하게 합니다.
- 데이터 효율성: 이 방법은 저데이터 환경에서 표준 BC 및 Gen-CoT를 크게 능가합니다. 단 25개의 데모만으로 VLA-Talker는 50개의 데모로 훈련된 BC를 앞섭 over습니다.
- 일반화: 이 접근 방식은 보지 못한 물체, 방해 요소, 패러프레이즈된 지침에 대해 우수한 강건성을 보여줍니다. BC와 Gen-CoT는 방해 요소에 의해 성능이 크게 저하되는 반면, VLA-Talker는 도구 루프가 정책에 도달하기 전에 물체 정체성을 해결하기 때문에 높은 성공률을 유지합니다.
- 실제 배포: AgiBot G1에서 VLA-Talker는 단일 작업 정책에서 58.1%, 다중 작업 정책에서 45.0%의 성공률을 기록하며, 베이스라인과 CoT 변형 모델을 모두 앞질렀으며, 특히 정밀한 삽입 작업에서 뛰어난 성능을 보였습니다.
의의 및 주장
본 논문은 VLA의 언어 역량이 추론 생성보다는 그라운딩된 언어 이해에서 기인한다고 주장합니다. "생각하기"(텍스트 생성)에서 "지각하기"(도구로부터 유도된 증거 소비)로 패러다임을 전환함으로써, VLA-Talker는 언어 생성과 저수준 제어 사이의 근본적인 충돌을 해결합니다.
저자들은 자신들의 접근 방식이 다음과 같음을 강조합니다:
- 증거를 획득하는 역할과 사용하는 역할을 분리합니다.
- 자기회귀적 CoT에 내재된 지연 및 오류 전파를 제거합니다.
- 정책이 픽셀로부터 추론해야 하는 부담을 줄이기 위해 필요한 기하학적 사실을 명시적으로 제공함으로써 데이터 효율성을 향상시킵니다.
- 에이전트 도구 사용이 생성형 CoT가 아닌 인컨텍스트 학습을 통해 통합될 때, 더 강건하고 효율적이며 유능한 로봇 정책을 만든다는 것을 입증합니다.
논문은 VLA-Talker가 그라운딩 및 지각 오류를 크게 줄이지만, 남은 실패 모드는 주로 제어 정밀도 오류(예: 타이트한 삽 insertion)이며, 이는 향후 개선 방향이 추가적인 추론 생성보다는 저수준 액션 표현에 집중되어야 함을 시사한다고 결론짓습니다.