FlashVLA: Streaming Action Decoding for Fast and Asynchronous VLA Inference
FlashVLA는 청크 단위의 인과적 어텐션(chunk-wise causal attention)을 갖춘 멀티 청크 액션 버퍼를 유지함으로써 빠르고 비동기적인 VLA 추론을 가능하게 하여, 매끄럽고 시간적으로 일관된 로봇 실행을 보장하는 동시에 30Hz 이상의 제어 주파수를 달성하는 통합 스트리밍 액션 디코딩 프레임워크입니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
보고, 이해하고, 인간과 같은 정교한 움직임을 구현할 수 있는 로봇은 오랫동안 자동화의 성배로 여겨져 왔습니다. 수년간 연구자들은 테이블 위의 컵을 식별하거나 "그것을 집어 올려라"라는 언어 명령을 따를 수 있는 시스템을 구축해 왔습니다. 하지만 그러한 이해를 매끄럽고 실시간적인 물리적 움직임으로 전환하는 것은 여전히 고질적인 병목 현상으로 남아 있었습니다. 핵심적인 어려움은 타이밍에 있습니다. 로봇은 세상을 끊임없이 관찰하고, 이미지를 처리하고, 다음 행동을 결정한 다음, 팔을 움직여야 하는데, 이 모든 과정이 1초 미만의 짧은 시간 안에 이루어져야 합니다. 만약 사고 과정이 너무 오래 걸리면, 로봇은 뒤처지게 되어 구식 정보에 따라 행동하게 되고 결국 목표를 놓치게 됩니다. 이러한 지연은 '비전-언어-행동(Vision-Language-Action)' 모델로 알려진 최신 세대의 로봇 두뇌에서 특히 두드러집니다. 이 시스템들은 시각 및 독해 능력과 움직임 계획 능력을 결합했기에 강력하지만, 동시에 느립니다. 이들은 종-종 움직임을 작은 조각으로 나누고, 모터에 명령을 보내기 전 일련의 반복적이고 시간이 많이 소요되는 계산을 통해 각 조각을 정교하게 다듬는 방식으로 작동합니다. 그 결과 로봇은 주저하거나, 끊기거나, 혹은 목표를 놓치게 만드는 지연 현상을 보이며 움직이게 됩니다.
이를 해결하기 위해 UC 샌디에이고와 MIT의 연구진은 로봇의 두뇌가 순차적이 아니라 동시에 생각하고 움직일 수 있도록 설계된 'FlashVLA'라는 새로운 프레임워크를 도입했습니다. 작업자가 제품이 완전히 검수될 때까지 기다렸다가 다음 작업을 시작하는 공장의 조립 라인을 상상해 보십시오. 그 라인은 계속 멈추게 됩니다. FlashVLA는 작업자가 항상 제품의 서로 다른 단계를 동시에 다루도록 워크플로우를 변경하여, 꾸준하고 연속적인 흐름을 보장합니다. 기술적인 관점에서 연구진은 한 번에 하나의 완전한 움직임을 디코딩하던 기존 방식을 '스트리밍(streaming)' 방식으로 교체했습니다. 전체 움직임 계획이 완벽해질 때까지 기다린 후 행동하는 대신, 시스템은 서로 다른 완성 단계에 있는 여러 움직임 계획의 버퍼를 유지합니다. 어떤 계획은 거의 완성되어 실행될 준비가 된 상태이고, 어떤 계획은 이제 막 시작되어 여전히 정교화되는 중입니다. 시스템은 이 모든 계획을 단 한 번의 단계에서 동시에 업데이트하며, 가장 완성도가 높은 계획을 즉시 로봇의 모터로 보냅니다. 이를 통해 컴퓨터가 다음 몇 단계를 구상하는 동안에도 로봇은 계속 움직일 수 있으며, 결과적으로 생각하는 데 걸리는 시간을 효과적으로 숨길 수 있습니다.
이러한 변화의 영향은 극적입니다. 연구진은 이 스트리밍 방식이 표준 방식에 비해 단일 동작을 생성하는 데 필요한 시간을 최대 20배까지 단축했다는 것을 실험을 통해 발견했습니다. 단일 그래픽 카드에서 이 시스템은 초당 최소 30회 이상의 제어 빈도를 달성했는데, 이는 인간이 보기에 즉각적인 것처럼 느껴지는 속도입니다. 더 중요한 점은, 이 속도가 정확도를 희생하면서 얻어진 것이 아니라는 것입니다. 시스템이 이러한 움직임 조각들을 함께 처리하기 때문에, 미래의 단계들이 곧 일어날 단계들로부터 자연스럽게 학습하게 됩니다. 이는 로보트가 오래된 정보에 따라 행동할 때 흔히 발생하는 끊기고 불연속적인 움직임을 피하고, 매끄럽고 연속적인 동작을 만들어냅니다. 시뮬레이션 환경과 실제 로봇 팔을 이용한 테스트에서, 이 새로운 시스템은 기존의 느린 모델들과 대등하거나 이를 능가하는 성공률을 보이면서도 훨씬 더 빠르게 작동했습니다.
또한 연구진은 이 방식이 로봇을 놀라울 정도로 복잡하고 긴 과업에 능숙하게 만든다는 것을 발견했습니다. 로봇이 완료하는 데 오랜 시간이 걸리는 일련의 동작을 수행해야 할 때, 이 새로운 시스템의 앞을 내다보고 직전의 과거를 기억하는 능력은 로봇이 경로를 이탈하지 않도록 도와주었습니다. 장기적 과업(long-horizon tasks)을 포함한 한 실험 세트에서, 성공률은 이전의 최고 방식보다 36%포인트 이상 급증했습니다. 이는 시스템이 현재의 행동을 미래의 계획과 연결하는 방식이 로봇이 복잡한 순서를 수행하는 동안 길을 잃지 않도록 돕는 일종의 단기 기억을 생성한다는 것을 시사합니다. 연구팀은 단일 암 및 양팔 시스템을 포함한 다양한 로봇 설정에서 이 아이디어들을 테스트했으며, 속도와 매끄러움의 개선 효과가 서로 다른 하드웨어와 다양한 유형의 과업에서도 유효하다는 것을 확인했습니다.
이 연구가 특히 중요한 이유는 계산의 느림과 로봇이 보는 것과 실제 위치 사이의 불일치라는 두 가지 문제를 동시에 해결했기 때문입니다. 느린 속도를 해결하려는 이전의 시도들은 로봇이 오래된 데이터에 따라 행동하게 만들었고, 데이터 불일치를 해결하려는 시도들은 로봇을 다시 느려지게 만드는 복잡한 추가 계산을 요구했습니다. FlashVLA는 사고 과정 자체를 연속적으로 구조화함으로써 이러한 트레이드오프를 제거합니다. 연구진은 로봇이 움직임 계획을 처리하는 방식, 즉 다양한 준비 단계에 있는 계획들의 회전형 버퍼(rolling buffer)를 유지하는 방식을 바꿈으로써 이전에 도달할 수 없었던 유동성을 달 수 있음을 입증했습니다. 그 결과, 로봇은 빠르게 반응하고, 매끄럽게 움직이며, 민첩한 현실 세계의 자동화라는 꿈에 한 발짝 더 다가가는 신뢰성 있는 방식으로 복잡한 조작 과업을 수행할 수 있게 되었습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.