← 최신 논문
💻 computer science

Steering Autoregressive Vision-Language-Action Policies via Action Token Intervention

이 논문은 사용자가 저차원 입력을 액션 토큰 공간에 주입함으로써 자기회귀적 시각-언어-행동 정책을 동적으로 유도할 수 있게 하여, 모델이 학습한 숙련도와 사전 지식을 보존하면서도 가사 조작 작업의 성공률을 크게 향상시키는 훈련이 필요 없는 추론 시점 방법론인 토큰 스티어링(Token Steering)을 소개한다.

원저자: Jason Chan, Jonathan C. Kao

게시일 2026-06-16
📖 3 분 읽기☕ 가벼운 읽기

원저자: Jason Chan, Jonathan C. Kao

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. ✨ 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신에게 매우 재능 있고 고도로 훈련된 로봇 요리사가 있다고 상상해 보세요. 이 로봇은 수백만 개의 요리 영상을 시청하며 칼질, 젓기, 플레이팅을 완벽하게 하는 법을 배웠습니다. 레시피를 통째로 외우고 있죠. 하지만 때때로 최고의 셰프들도 작은 실수를 합니다. 설탕 대신 소금을 집거나, 손을 너무 빨리 움직여 그릇을 넘어뜨리는 식이죠.

과거에는 로봇이 실수를 했을 때 두 가지 나쁜 선택지뿐이었습니다:

  1. 로봇을 완전히 멈추고 직접 제어권을 가져오는 것(자율 주행 자동차의 핸들을 뺏는 것처럼)인데, 이는 느리고 답답합니다.
  2. 로봇에게 말로 "왼쪽으로 가"라고 명령하는 것이지만, 로봇은 언어를 통해 빠르고 미세한 교정 신호를 이해하는 데 서툽니다. 명령을 오해하거나 처리하는 데 시간이 너무 오래 걸릴 수 있습니다.

이 논문은 **토큰 스티어링(Token Steering)**이라 불리는 새로운 방식의 도움 방법을 소개합니다. 이것은 일종의 "넛지(nudge, 살짝 밀기)" 시스템입니다.

"액션 토큰"의 마법

이것이 어떻게 작동하는지 이해하려면, 로봇이 단순히 "왼쪽으로 이동"이나 "오른쪽으로 이동"이라고 생각하는 것이 아니라는 점을 알아야 합니다. 대신 로봇은 토큰(단어의 글자 같은 것)으로 이루어진 비밀 코드로 생각합니다. 로봇이 움직임을 계획할 때, 팔이 움직일 전체 경로를 설명하기 위해 이러한 토큰들로 이루어진 긴 문장을 하나씩 써 내려갑니다.

연구진은 로봇이 이 문장을 작성하는 도중에 이를 방해할 수 있다는 것을 발견했습니다. 즉, 로봇의 비밀 코드 단어 몇 개를 우리가 준비한 "넛지" 단어로 바꿀 수 있다는 것입니다.

GPS 비유

로봇의 계획을 GPS 경로라고 생각해 보세요.

  • 로봇: GPS는 교통 상황과 도로 규칙을 바탕으로 목적지까지 가는 최적의 경로를 알고 있습니다. 그리고 경로를 단계별로 나열합니다.
  • 사용자: 당신은 눈앞의 도로 공사 구간을 보고 GPS가 곧 잘못된 길로 접어들 것이라는 사실을 깨닫습니다.
  • 토ке 스티어링: GPS에게 "좌회전!"이라고 소리 지르는 대신(GPS가 이를 무시할 수도 있습니다), 당신은 단순히 "다음 회전 건너뛰기"라고 적힌 버튼을 누릅니다. 그러면 GPS는 그 지점부터 여정을 즉시 재계산하며, 이미 알고 있는 모든 부드러운 주행과 안전 규칙을 유지한 채 이동합니다.

실험에서 인간은 간단한 키보드(화살표 키를 누르는 것과 같은)를 사용하여 "넛지" 토큰을 보냅니다. 로봇은 이 넛지를 받아들여 즉각적인 경로를 약간 수정하고, 그 후 자신의 똑똑한 뇌를 사용하여 나머지 움직임을 매끄럽게 마무리합니다.

연구 결과

연구진은 로봇 팔이 서랍을 닫거나 물건을 바꾸는 등의 가사 노동을 수행하는 실험을 진행했습니다. 결과는 다음과 같습니다.

  1. 작은 넛지가 가장 효과적임: 전체 움직임을 제어할 필요는 없습니다. 계획의 첫 몇 단계만을 살짝 밀어주는 것만으로도 로봇의 생각을 바꿀 수 있습니다. 만약 너무 많이 밀면 로봇이 혼란을 느껴 움직임이 서툴러집니다.
  2. "큰 그림"이 중요함: 로봇의 코드에는 "저주파(low-frequency)" 토큰(움직임의 크고 일반적인 형태)과 "고주파(high-frequency)" 토큰(작고 세밀한 디테일)이 있습니다. 연구진은 로봇이 가는 방향을 바꾸고 싶다면 "큰 그림" 토큰을 밀어야 한다는 것을 발견했습니다. 세밀한 디테일 토큰을 밀면 경로가 크게 바뀌지 않습니다.
  3. 실수 수정: 로봇이 언어 명령 때문에 혼란을 겪을 때(예: "초록색 큐브"를 집으라고 했으나 "파란색 큐브"를 잡았을 때), 인간이 올바른 물체 쪽으로 넛지를 줄 수 있었습니다. 그러면 로봇은 과업을 성공적으로 마쳤습니다. 넛지가 없었다면 이러한 혼란스러운 작업에서 로봇은 100% 실패했을 것입니다.
  4. 실제 환경에서의 성공: 로봇이 서랍을 닫아야 하는 테스트에서, 로봇은 잘못된 각도로 서랍을 밀기 때문에 스스로 할 때는 90% 확률로 실패했습니다. 하지만 인간의 넛지가 더해지자 72.5%의 성공률을 보였으며 훨씬 더 빠르게 작업을 마쳤습니다.

왜 특별한가

가장 놀라운 점은 연구진이 로봇을 다시 훈련시키거나 새로운 기술을 가르칠 필요가 없었다는 것입니다. 그들은 단지 로봇이 생각하는 도중에 로봇의 모국어(토큰)로 대화하는 방법을 찾아냈을 뿐입니다.

이것은 외국어를 사용하는 천재와 대화하는 것과 같습니다. 그들의 언어를 전부 배울 필요는 없습니다. 방향을 바꾸는 데 필요한 몇 가지 단어만 알면, 나머지는 그들이 알아서 처리할 것입니다.

누가 사용할 수 있는가?

이 논문은 손을 완전히 제어하기 어려운 사람들에게 이 기술이 유용할 수 있음을 시사합니다. 예를 들어, 간단한 "위, 아래, 왼쪽, 오른쪽" 신호만 보낼 수 있는 뇌-컴퓨터 인터페이스(BCI)를 사용하는 사람이 복잡한 로봇 팔을 유도할 수 있습니다. 인간은 단순한 방향을 제공하고, 로봇의 지능은 물체를 잡고 옮기는 데 필요한 복잡하고 정교한 움직임을 처리합니다.

요약하자면, 토케 스티어링은 인간이 운전대를 직접 잡지 않고도 초지능 로봇을 부드럽게 안내하여, 실수를 즉각 수정하고 로봇을 우리 가정에서 훨씬 더 유용하게 만들 수 있게 해줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →