← 최신 논문
💻 computer science

Mamba-based Selective State Space Modeling Improves the Accuracy-Complexity Tradeoff of SmolVLA Vision-Language-Action Experts

이 논문은 Mamba 기반의 선택적 상태 공간 모델링을 SmolVLA 액션 전문가에 통합하는 것이 시각-언어-행동(Vision-Language-Action) 모델의 정확도-복잡도 트레이드오프를 유의미하게 개선하여, 행동당 재계획(per-action replanning) 조건 하에서 파라미터 복잡도를 24% 줄이면서도 장기 실행(long-horizon execution) 동안 트랜스포머(Transformer) 베이스라인보다 우수한 성공률을 달성함을 입증한다.

원저자: Farida Mohsen, Thowayba Elkaffash, Mohammad Reza Chalak Qazani, Mohamed Mabrok, Nader Meskin, Ali Safa

게시일 2026-08-25
📖 4 분 읽기☕ 가벼운 읽기

원저자: Farida Mohsen, Thowayba Elkaffash, Mohammad Reza Chalak Qazani, Mohamed Mabrok, Nader Meskin, Ali Safa

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

로봇들은 단순히 세상을 보는 것뿐만 아니라, 지침을 읽고 작업을 수행하기 위해 팔을 움직이는 법을 배우며 세상을 이해하는 법을 익히고 있습니다. 시각-언어-행동(vision-language-action)으로 알려진 이 분야는 장면의 사진과 작업을 설명하는 문장을 입력받아 로봇 손이 작업을 완료하기 위해 정확히 어떻게 움직여야 하는지를 파악하는 강력한 컴퓨터 두뇌에 의존합니다. 엔지니어들의 과제는 속도와 지능 사이의 균형을 맞추는 것입니다. 만약 로봇이 매 아주 작은 움직임마다 너무 많이 생각한다면, 너무 느리게 움직여서 쓸모가 없게 됩니다. 하지만 시간을 절약하기 위해 한 번에 긴 움직임의 시퀀스를 계획한다면, 그 계획된 단계들을 실행하는 동안 세상이 변할 수 있기 때문에 실수를 저지를 위험이 있습니다. 목표는 로봇이 빠르면서도 정확하게 만드는 방법을 찾는 것이며, 이는 달성하기 어려운 균형입니다.

한 연구팀은 정확도를 희생하지 않으면서 속도 쪽으로 이 균형을 기울이는 새로운 방법을 찾아냈습니다. 그들은 원래 언어를 처리하기 위해 설계된 새로운 유형의 컴퓨터 아키텍처를 로봇의 뇌 안에 테스트했습니다. 표준적인 사고 엔진을 이 새로운 설계로 교체함으로써, 그들은 로봇이 훨씬 더 긴 움직임의 시퀀스를 계획하면서도 성공할 수 있다는 것을 발견했습니다. 테스트에서, 로봇이 주변 환경을 다시 확인하기 전에 50개의 전체 시퀀스를 실행하도록 허용했을 때, 새로운 설계는 기존 설계보다 거의 8% 더 자주 작업에 성공했습니다. 이 개선은 의미가 큰데, 이는 로봇이 생각하기 위해 멈추는 횟수를 줄이면서도 일을 올바르게 완수하며 현실 세계에서 훨씬 더 빠르게 작동할 수 있음을 의미하기 때문입니다.

연구진은 이미 효율적이고 정확한 것으로 알려진 SmolVLA라는 인기 있는 로봇 두뇌에서 시작했습니다. 이 시스템은 카메라 피드와 텍스트 지침을 보고, 미래의 움직임인 '청크(chunk)'를 예측하는 방식으로 작동합니다. 단 하나의 움직임만을 결정하는 대신, 이 시스템은 팔이 다음에 해야 할 동작의 짧은 영화처럼 일련의 동작들을 예측합니다. 로봇은 그 시리즈의 처음 몇 가지 움직임을 수행한 다음, 멈춰서 세상을 다시 보고, 새로운 시리즈를 계획합니다. 멈추기 전까지 수행하는 움직임의 수는 '실행 지평(execution horizon)'이라고 불립니다. 만약 매 움직임마다 멈춘다면 매우 정확하지만 매우 느립니다. 만약 멈추지 않고 전체 시리즈를 그대로 실행한다면 빠르지만, 환경이 변할 경우 오류가 발생하기 쉽습니다.

이를 해결하기 위해, 연구팀은 이러한 움직임 시퀀스의 타이밍을 처리하는 로봇의 뇌 부분을 교체했습니다. 기존 시스템은 '셀프 어텐션(self-attention)'이라는 표준적인 방법을 사용했는데, 이는 모든 움직임 계획의 각 부분이 서로를 참조하여 조화를 유지할 수 있도록 하는 스포트라이트와 같습니다. 연구진은 이를 '맘바(Mamba)'라고 불리는 다른 방식으로 교체했는데, 이는 정보를 스포트라이트 방식이 아닌, 더 지속적인 업데이트의 흐름처럼 처리하는 방식입니다. 이 새로운 방식은 컴퓨터 자원을 훨씬 적게 사용하여 약 24% 적은 설정값(settings)을 학습해야 하지만, 시간의 흐로를 다르게 다룹니다.

연구팀은 두 버전의 로봇 두뇌를 블록 쌓기부터 물체를 특정 목표로 이동시키는 것에 이르기까지 40가지의 다양한 작업이 포함된 시뮬레이션 환경에서 테스트했습니다. 그들은 세 가지 조건 하에서 로봇을 실행했습니다: 매 움직임마다 멈추는 경우, 25번의 움직임 후에 멈추는 경우, 그리고 전체 50번의 움직임 후에 멈추는 경우입니다. 로봇이 매 움직임마다 멈췄을 때, 두 버전은 거의 동일하게 작동했으며, 새로운 설계는 기존 설계의 성공률과 일치했습니다. 그러나 로봇이 멈추지 않고 더 긴 시퀀스를 실행하도록 요청받았을 때 차이가 명확해졌습니다. 새로운 맘바 설계를 가진 로봇이 훨씬 더 잘 버텨냈습니다. 50번의 움직임을 실행하기 전에 확인하도록 했을 때, 새로운 설계는 실험의 61.8%에서 성공한 반면, 기존 설계는 53.9%의 성공률을 보였습니다.

이 격차는 특정 유형의 작업에서 더욱 커졌습니다. 로봇이 물체를 정밀한 위치로 이동시켜야 할 때, 새로운 설계는 가장 긴 지평에서 성공률을 거의 18% 향상시켰습니다. 공간 배치와 관련된 작업에서도 10% 개선되었습니다. 연구진은 새로운 설계가 특히 신선한 시각 정보로 업데이트되지 않는 계획에 따라 행동하는 중에도, 시퀀스의 후반부 움직임을 전반부 움직임과 조화롭게 유지하는 데 탁월하다는 것을 발견했습니다. 이는 새로운 아키텍처가 시간이 흐름에 따라 일련의 행동이 어떻게 전개되어야 하는지를 예측하는 데 자연스러운 이점을 가지고 있음을 시사합니다.

이 연구는 로봇이 움직임을 계획하는 방식이 주변 환경을 얼마나 자주 확인하느냐만큼 중요하다는 것을 확인시켜 줍니다. 행동 시퀀스를 조정하는 내부 엔진을 변경함으로써, 연구진은 로봇이 서투르지 않으면서도 더 빠르고 효율적으로 만들어질 수 있음을 보여주었습니다. 새로운 설계는 긴 시퀀스에 대한 성공률을 높였을 뿐만 아니라, 시스템을 실행하는 데 필요한 총 컴퓨터 설정값의 수도 줄였습니다. 이는 미래에 로봇이 더 길고 정확하게 유지되는 계획에 의존하여, 빠르게 그리고 연속적으로 행동해야 하는 실제 환경에 배치될 수 있음을 의미합니다. 이 작업은 적절한 아키텍처 선택이 속도와 정밀도 사이의 더 나은 절충안을 열 수 있음을 입증하며, 빠르고 신뢰할 수 있는 로봇 조수의 꿈에 한 걸음 더 다가서게 합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →