Tok: Multi-head Multi-codebook Discrete Action Tokenization for Vision-Language-Action Models
본 논문은 잠재 특징을 독립적인 코드북을 가진 특화된 헤드로 분해하여 미세한 동작 역학을 더 잘 포착함으로써, 재구성 오차를 크게 줄이고 시각-언어-행동 모델의 성능을 향상시키는 새로운 멀티 헤드 멀티 코드북 액션 토크나이저인 Tok을 제안한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
로봇은 오랫동안 인간의 손처럼 부드러운 우아함으로 움직이는 데 어려움을 겪어 왔습니다. 현대의 인공지능이 이제 시를 쓰고, 질병을 진단하며, 멋진 이미지를 생성할 수 있게 되었지만, 기계에게 세상을 물리적으로 조작하는 능력을 부여하는 것은 여전히 완고한 과제로 남아 있습니다. 문제의 핵심은 컴퓨터가 움직임을 어떻게 이해하느냐에 있습니다. 구별되는 글자로 이루어진 텍스트나 픽셀로 구성된 이미지와 달리, 로봇 팔의 물리적 동작은 연속적인 데이터의 흐름입니다. 로봇 팔은 단순히 한 위치에서 다른 위치로 점프하는 것이 아니라, 그 사이의 무수히 많은 미세한 위치들을 통과하며 흐릅니다. 오늘날의 AI를 구동하는 강력한 언어 모델을 사용하여 로봇을 가르치기 위해서, 엔지니어들은 먼저 이 매끄럽고 연속적인 움직임을 개별적인 단계들의 연속으로 변환해야 하며, 이는 마치 흐르는 강물을 개별적인 구슬의 줄로 바꾸는 것과 같습니다. 이 변환 과정을 토큰화(tokenization)라고 합니다. 만약 변환이 너무 거칠면 로봇은 움직임의 미세한 디테일을 잃게 되어, 섬세한 작업에 실패하는 덜컥거리고 부정기한 동작을 보이게 됩니다. 반대로 변환이 너무 복잡하면 컴퓨터가 실시간으로 반응할 만큼 빠르게 처리할 수 없습니다.
수년 동안 연구자들은 이 변환 문제를 해결하려고 노력해 왔지만, 기존 방식들은 종종 둥근 구멍에 사각 못을 박으려는 듯 맞지 않는 방법을 강요했습니다. 어떤 접근 방식은 모든 움직임을 단순한 고정 범주의 목록으로 취급하여, 단계 사이의 미묘한 타이밍과 관계를 무시합니다. 또 다른 방식은 움직임을 그룹화하여 데이터를 압축하려고 시도하지만, 손목의 정확한 각도나 그리퍼의 부드러운 쥐기 같은 정밀한 제어에 필요한 구체적인 세부 사항을 놓치는 경우가 많습니다. 이러한 디테일의 손실은 병목 현상을 일으켜, 로봇이 깨지기 쉬운 물체를 쌓거나 복잡한 부품을 조립하는 것과 같은 복잡한 기술을 배우는 것을 방해합니다. 그 결과 로봇은 넓고 단순한 작업은 수행할 수 있지만, 현실 세계의 미묘한 요구 사항에 직면했을 때는 비틀거리게 됩니다.
한 연구팀이 이제 이 변환 문제를 다루는 새로운 방법을 제안하였으며, 이는 움직임의 풍부함을 보존하면서도 현대 AI가 처리할 수 있을 만큼 데이터를 압축할 수 있는 방법을 제시합니다. 그들은 자신들의 시스템을 M2Tok이라 부르며, 이는 성공에 필요한 미세한 역학 관계를 잃지 않으면서 연속적인 로봇 동작의 흐름을 언어 모델이 이해할 수 있는 형식으로 분해하도록 설계된 도구입니다. 로봇의 전체 몸을 하나의 거대한 단일 블록으로 취급하는 대신, 그들의 접근 방식은 움직임을 별도의 전문화된 채널로 나눕니다. 로봇 팔이 어깨, 팔꿈치, 손목, 그리고 그리퍼를 동시에 움직여야 하는 상황을 상상해 보십시오. 기존 방식은 이 모든 서로 다른 움직임을 하나의 단일 코드로 압축하려고 시도하여, 종종 팔의 정확도와 그리퍼의 정확도 중 하나를 선택하도록 강요했습니다. 그러나 새로운 방식은 이러한 움직임을 별도의 그룹으로 분리하여, AI가 각 부분의 특정 뉘앙스에 독립적으로 집중할 수 있게 합니다.
연구진은 로봇의 움직임 데이터를 여러 개의 '헤드(head)'로 나누어 이를 달성했는데, 각 헤드는 움직임의 서로 다른 측면을 담당합니다. 한 헤드는 팔의 위치를 추적하고, 다른 헤드는 그리퍼의 열림과 닫힘을 추적할 수 있습니다. 결정적으로, 각 헤드는 자신만의 독립적인 움직임 사전(dictionary)을 사용합니다. 여러 개의 사전을 병렬로 사용함으로써, 시스템은 단일 사전이 제공할 수 있는 것보다 훨씬 더 많은 수의 가능한 조합을 만들어냅니다. 이러한 조합적 힘 덕분에 시스템은 매우 높은 정밀도로 훨씬 더 다양한 움직임을 표현할 수 있습니다. 이는 마치 음악가가 서로 다른 악기들 사이에서 제한된 음표들을 조합하여 무한한 멜로디를 만들어내는 것과 유사합니다. 새로운 시스템은 로봇 신체의 서로 다른 '악기'들에 걸쳐 제한된 움직임 코드들을 결합하여 복잡한 동작을 놀라운 충실도로 재현합니다.
이 아이디어를 테스트하기 위해, 연구진은 블록을 망치질하는 것부터 다양한 병을 집어 들어 접시에 놓는 것에 이르기까지 광범위한 시뮬레이션 로봇 작업 모음으로 시스템을 학습시켰습니다. 그들은 자신들의 새로운 방식을 해당 분야에서 사용되어 온 여러 기존 기술들과 비교했습니다. 결과는 새로운 방식의 명확한 우위를 보여주었습니다. 12가지의 서로 다른 시뮬레이션 작업에서, 새로운 방식을 사용한 로봇은 시도 횟수의 51%에서 성공했으며, 이는 45%의 성공률을 보인 차순위 방식보다 유의미하게 높은 수치였습니다. 정밀도가 요구되는 어려운 작업에서는 그 차이가 더욱 극적 이었습니다. 예를 들어, 캔을 솥으로 옮기는 작업에서 새로운 방식은 이전의 최고 방식보다 거의 두 배 더 자주 성공했습니다. 또한 버거와 감자튀김 상자를 쟁반 위에 놓는 작업에서 새로운 방식은 64%의 성공률을 달ened한 반면, 기존의 최고 방식은 52%에 그쳤습니다.
연구진은 또한 기술이 새로운 상황으로 전이될 수 있는지 확인하기 위해 다른 세트의 시뮬레이션 환경에서 시스템을 테스트했습니다. 여기서도 새로운 방식은 다시 한번 우수한 성능을 입증하며, 기존의 선도적인 대안 방식이 21%를 기록한 것에 비해 28%의 성공률을 달성했습니다. 가장 눈에 띄는 차이는 로봇이 가지나를 바구니에 담는 작업을 수행할 때 나타났습니다. 가지는 형태가 불규칙하여 잡기가 까다로운 물체인데, 기존 방식들은 이 작업을 전혀 해결하지 못했습니다. 그러나 새로운 방식은 33%의 성공률을 보였으며, 이는 해당 방식이 미세한 디테일을 포착하는 능력을 통해 다른 방식들이 할 수 없었던 복잡한 기하학적 구조의 물체를 다룰 수 있음을 시사합니다.
이러한 결과가 단순히 시뮬레이션의 산물이 아님을 확실히 하기 위해, 연구팀은 학습된 모델을 실제 로로봇에 적용하여 테스트했습니다. 그들은 네 개의 로봇 팔과 카메라가 장착된 이동형 플랫폼을 사용하여 로봇에게 종 울리기, 용기를 접시 위에 놓기, 다양한 병 집기라는 세 가지 서로 다른 작업을 수행하도록 요청했습니다. 이것은 제로샷(zero-shot) 테스트로, 즉 로봇이 이러한 특정 실제 물체나 환경을 본 적이 없으며, 오로지 시뮬레이션에서 배운 것에만 의존해야 함을 의미합니다. 새로운 방식은 다시 한번 다른 방식들을 앞질렀으며, 세 가지 작업 전체에서 최대 28%인 기존 최선책에 비해 평균 33%의 성공률을 달성했습니다. 이러한 테스트의 시각적 증거는 로봇이 물체의 위치를 성공적으로 식별하고 정밀한 파지 동작을 실행하는 것을 보여주었으며, 이는 움직임 데이터의 고품질 변환이 컴퓨터를 떠나 물리적 세계로 들어왔을 때도 유효함을 확인시켜 주었습니다.
정확성을 넘어, 연구진은 시스템이 얼마나 빠르게 작동할 수 있는지도 살펴보았습니다. 로봇이 유용하게 쓰이려면 환경에 반응할 수 있을 만큼 충분히 빠르게 결정을 내려야 합니다. 새로운 방식은 로봇이 8Hz 이상의 빈도로 작동할 수 있게 해주었는데, 이는 로봇이 매초 8번 이상의 결정을 내릴 수 있음을 의미합니다. 이는 단 2Hz로 작동하던 기존 방식들에 비해 상당한 개선입니다. 게다가 연구진이 특수 처리 엔진을 사용하여 속도를 최적화했을 때, 로봇은 56Hz에 도달할 수 있었으며, 이는 대부분의 실시간 조작 작업에 필요한 속도를 훨씬 뛰어넘는 수준입니다. 이러한 고정밀도와 고속의 결합은 이 새로운 방식이 역동적인 환경에서 고급 로봇을 배치하는 데 있어 실질적인 해결책이 될 수 있음을 시사합니다.
이 작업의 성공은 움직임 데이터가 처리되는 방식의 근본적인 변화에 달려 있습니다. 모든 움직임이 단일하고 균일한 코드로 압축되어야 한다는 생각을 거부함으로써, 연구진은 시스템이 로봇 신체의 각 부분의 독특한 특성을 존중할 수 있도록 했습니다. 움직임을 독립적인 채널로 분리하고 여러 전문화된 사전을 사용하는 결합을 통해, 이전 방식들이 놓쳤던 미세하고 고주파적인 움직임의 디테일을 포착할 수 있는 시스템을 만들어냈습니다. 이 접근 방식은 로봇을 구동하는 언어 모델의 기본 구조를 변경할 필요 없이, 데이터를 모델에 입력하는 더 나은 방법을 제공했습니다. 그 결과, 로봇은 이전에는 도달하기 어려웠던 수준의 숙련도로 복잡한 물리적 작업을 이해하고 실행할 수 있게 되었으며, 이는 언어 모델의 디지털 지능과 그 모델들이 탐색해야 할 물리적 현실 사이의 간극을 메우고 있습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.