DriftingVLA: Native One-Step Vision-Language-Action Generation via Per-Dimension Temporal Drifting
DriftingVLA는 차원별 시간 드리프트(Per-Dimension Temporal Drifting)를 포함한 분포 드리프트 목적 함수를 활용하여 단 한 번의 순방향 패스만으로 완전한 액션 청크를 생성하는 네이티브 원스텝 시각-언어-행동 모델로, 벤치마크 작업에서 최첨단 성능을 달성하는 동시에 기존의 다단계 플로우 기반 방식보다 3.36배 빠른 속도를 제공합니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
보고, 언어를 이해하며, 인간처럼 유연하게 움직일 수 있는 로봇은 오랫동안 인공지능의 꿈이었습니다. 수년간 연구자들은 강력한 시각 및 언어 이해 능력과 로봇 팔을 제어하는 능력을 결합한 시스템을 구축해 왔습니다. 비전-언어-행동(vision-language-action) 모델로 알려진 이 시스템들은 로봇의 두뇌 역할을 하며, 카메라가 보는 것과 인간이 말하는 단어를 입력받아 로봇의 관절을 어떻게 움직여 작업을 완료할지 결정합니다. 그러나 하나의 중대한 병목 현상이 이러한 기계들이 진정한 실시간 반응성을 갖추는 것을 가로막아 왔습니다. 매끄러운 움직임의 시퀀스를 생성하기 위해, 이 모델들은 전통적으로 복잡하고 다단계적인 과정에 의존합니다. 선을 따라 매 지점마다 아주 작고 주저하는 수정을 가하며 완벽한 원을 그리려고 노력하는 모습을 상상해 보십시오. 로봇은 경로를 계산하고, 한 걸음을 내딛고, 자신의 작업을 확인한 다음, 다시 또 다른 걸음을 내딛는 과정을 모든 움직임마다 여러 번 반복해야 합니다. 이 방식은 높은 품질의 결과를 만들어내지만, 느리다는 단점이 있어 역동적인 세상 속에서 로봇을 느리고 반응이 둔하게 느껴지게 만드는 지연을 초래합니다.
이제 한 연구팀이 로봇이 움직임을 계획하는 방식을 근본적으로 바꾸는 새로운 접근법을 도입하여, 단 한 번의 순간에 완전한 행동 시퀀스를 생성할 수 있게 했습니다. DriftingVLA라고 불리는 시스템을 중심으로 한 이들의 연구는, 느리고 반복적인 수정 과정을 대신하여 전체 미래의 움직임을 한 번에 예측하는 법을 학습하는 방식으로 대체했습니다. 실제 작업 중에 단계별로 경로를 계산하는 대신, 이 시스템은 훈련 단계에서 무작위의 시작점과 최종 목표 동작 사이의 직접적인 연결 고리를 학습합니다. 이러한 전환 덕분에 로봇은 배포 시 반복적인 계산 과정을 통째로 건너뛰고 곧바로 올바른 동작으로 뛰어넘을 수 있습니다. 복잡한 조작 작업이 포함된 테스트에서, 이 새로운 방식은 기존의 느린 시스템과 동일한 정밀도를 보여주었을 뿐만 아니라, 로봇이 움직임을 결정하는 데 걸리는 시간을 200밀리초 이상에서 70밀리초 미만으로 줄임으로써 세 배 이상 더 빠르게 만들었습니다.
이 돌파구의 핵심은 연구자들이 로봇에게 서로 다른 움직이는 부품들 사이의 관계를 이해시키는 방법에 있습니다. 로봇 팔은 단순히 하나의 선을 따라 움직이는 것이 아니라, 앞으로 나아가기, 회전하기, 그리퍼 열기 등 함께 작동해야 하는 여러 개의 관절과 자유도를 가지고 있습니다. 이러한 시스템의 속도를 높이려는 이전의 시도들은 종로 전체 움직임을 하나의 큰 덩어리로 취급하거나, 혹은 아주 작은, 서로 단절된 시간의 순간들로 나누곤 했습니다. 그러나 새로운 접근 방식은 그리퍼의 수직 상승이나 손목의 회전과 같은 각각의 특정한 움직임 방향이 자신만의 고유한 리듬과 통계적 패턴을 가지고 있다는 점을 인식했습니다. 연구진은 각 개별 움직임 방향의 전체 이력을 학습해야 할 별도의 단위로 취급하는 '차원별 시간적 드리프팅(Per-Dimension Temporal Drifting)'이라는 기술을 개발했습니다. 이를 통해 시스템은 그리퍼가 어떻게 열려야 하는지 또는 손목이 어떻게 돌아가야 하는지에 대한 구체적인 뉘앙스를, 이 서로 다른 동작들을 하나의 경직된 수학적 규칙에 강제로 맞추지 않고도 이해할 수 있습니다.
결정적으로, 이 방법은 로봇의 사지 협응 능력을 희생하지 않습니다. 비록 시스템이 각 움직임 방향의 패턴을 개별적으로 학습하더라도, 여전히 전체 행동 계획을 하나의 통합된 전체로서 생성합니다. 언어와 시각을 이해하는 로봇의 두뇌는 온전하게 유지되며, 움직임을 생성하는 행동 전문가를 계속해서 안내합니다. 연구진은 수많은 "만약에" 시나리오를 통해 예측을 정교화하도록 시스템을 훈련함으로써, 단일 단계의 결정이 느린 다단계 계산의 결과만큼이나 정확하도록 보장했습니다. 이는 로봇이 두 팔을 동시에 사용하여 액체를 한 용기에서 다른 용기로 붓거나 블록을 쌓는 것과 같은 섬세한 작업을 지연 없이 수행할 수 있음을 의미합니다.
연구진은 속도가 신뢰성을 희생하는지 확인하기 위해 시뮬레이션 환경과 실제 환경 모두에서 이 새로운 시스템을 테스트했습니다. 물체를 집어 옮기는 등의 도전적인 작업이 포함된 일련의 시뮬레이션에서, 새 시스템은 기존의 가장 우수한 다단계 모델보다 약간 더 높은 98.3%에 달하는 성공률을 달랐습니다. 실제 물리적 로봇 팔이 있는 환경으로 옮겨졌을 때도, 시스템은 단일 팔 및 양팔 협응 과제를 포함한 6가지 작업 전반에서 77.67%의 성공률을 기록하며 우위를 유지했습니다. 이는 기존 시스템의 계산 과정을 단순히 단축하여 속도를 높이려 했던 다른 '단일 단계(one-step)' 방식들이 정확도가 크게 떨어지는 결과와 달리 주목할 만히 높은 성과였습니다. 이 새로운 방법은 시스템이 계산하는 방식이 아니라 학습하는 방식을 바꿈으로써, 속도와 정밀도를 모두 달성할 수 있음을 증명했습니다.
수치적인 성과를 넘어, 본 연구는 반복적인 계산 루프를 제거함으로써 얻는 효율성 이득을 강조했습니다. 매 초의 찰나가 중요한 실제 세계에서, 새 시스템은 움직임 덩어리를 생성하는 데 필요한 시간을 227.61밀리초에서 67.67밀리초로 줄였습니다. 이는 3배 이상의 속도 향상을 의미하며, 로봇을 환경으로부터 단절된 것처럼 느끼게 만드는 지연을 효과적으로 제거합니다. 훈련 과정에서는 여러 가지 "만약에" 시나리오를 처리하기 위해 약간 더 많은 컴퓨터 자원이 필요했지만, 이는 일회성 투자입니다. 일단 로봇이 훈련되면, 추가적인 자원을 요구하지 않는 가볍고 단일 단계적인 효율성으로 작동합니다. 이 연구는 반응형 로보틱스의 미래가 더 느린 알고리즘을 실행하기 위해 더 빠른 컴퓨터를 만드는 데 있는 것이 아니라, 알고리즘 자체를 본질적으로 직접적이고 즉각적이도록 재설계하는 데 있음을 보여줍니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.