← 최신 논문
💻 computer science

StellaVLA: In-Context Structured Demonstration for Generalizable Vision-Language-Action Models

StellaVLA는 제로 코스트의 구조화된 데모(예: 작업 계획 및 언어화된 3D 모션)를 인컨텍스트 가이드로 활용하여 분포 외 시나리오와 임보디먼트 전반에 걸친 일반화 성능을 향상시키고, 추론 지연 없이 주요 벤치마크에서 최첨단 성능을 달리는 비전-언어-행동 모델을 위한 테스트 타임 적응 프레임워크입니다.

원저자: Siyu Xu, Yunke Wang, Zijian Wang, Dihao Zhu, Chenghao Xia, Chengbin Du, Daochang Liu, Tao Huang, Chang Xu

게시일 2026-08-13
📖 4 분 읽기☕ 가벼운 읽기

원저자: Siyu Xu, Yunke Wang, Zijian Wang, Dihao Zhu, Chenghao Xia, Chengbin Du, Daochang Liu, Tao Huang, Chang Xu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. ✨ 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

로봇에게 샌드위치를 만드는 법을 가르친다고 상상해 보세요. 당신이 샌드위치를 만드는 영상을 보여줄 수 있고, 로봇은 당신의 손 움직임을 똑같이 따라 하려고 할 것입니다. 하지만 로봇이 다른 주방에 있거나, 빵이 오른쪽 대신 왼쪽에 놓여 있거나, 로봇의 팔 종류가 다르다면 어떻게 될까요? 갑자기 로봇은 혼란에 빠져 빵을 떨어뜨리고 맙니다. 이것은 로보틱스 분야, 특히 시각-언어-행동(Vision-Language-Action, VLA) 모델이라고 불리는 일종의 스마트 시스템에서 발생하는 큰 문제입니다. 이들은 사진을 '보고', "컵을 집어라"와 같은 명령을 '읽고', 그에 따라 팔을 움직이는 '행동'을 하는 매우 똑똑한 로봇과 같습니다. 문제는 이들이 특정 시험 문제만 달달 외운 학생 같아서, 질문이 조금만 달라져도 실패한다는 점입니다. 장면이 바뀌거나, 새로운 물체가 나타나거나, 카메라 각도가 바뀌면 이들은 어려움을 겪습니다. 이를 해결하기 위해 과학자들은 보통 수천 개의 새로운 영상을 수집하고 로봇을 다시 훈련시켜야 하는데, 이는 시간이 너무 오래 걸립니다.

하지만 만약 로봇이 누군가가 과업을 수행하는 영상 하나를 보고, 단순히 무엇을 하고 있는지가 아니라 '왜' 그렇게 하고 있는지 즉각적으로 이해할 수 있다면 어떨까요? 그것이 바로 이 논문이 다루는 핵심 질문입니다. 연구진은 단순히 손이 움직이는 가공되지 않은 영상을 보여주는 대신, 로봇에게 움직임의 논리를 설명해 주는 '참조 가이드'를 제공하고자 합니다. 그들은 로봇이 단순히 '픽셀'(예: 손을 X, Y, Z 좌표로 이동)을 배우는 것이 아니라, '계획'(예: 먼저 손잡이를 잡아라)을 배우기를 원합니다. 만약 이를 실현한다면, 로봇은 전체 시스템을 재부팅하지 않고도 새롭고 기이한 상황들을 처리할 수 있을 것입니다.

이 문제를 해결하기 위해 StellarEdge AI 기술 팀이 개발한 새로운 프레임워크인 StellaVLA가 등장했습니다. StellaVLA를 영화를 보는 것이 아니라, 영화를 보면서 감독의 해설(코멘터리)을 함께 읽는 로봇이라고 생각해보세요.

작동 방식은 다음과 같습니다. 팀은 로봇이나 인간이 과업을 수행하는 무질서하고 가공되지 않은 영상을 받아 이를 자동으로 **구조화된 시연(structured demonstration)**으로 변환하는 시스템을 구축했습니다. 누군가 레고 성을 쌓는 길고 혼란스러운 영상을 명확하고 단계적인 지침서로 바꾸는 것을 상상해 보세요. 이 시스템은 과업을 "빨간 브릭 찾기"와 같은 '하위 목표(sub-goals)'로 나누고, 움직임을 "팔을 오른쪽 위로 올리기"와 같은 평이한 언어로 설명합니다. 이 과정은 인간이 직접 노트를 작성할 필요 없이, 강력한 AI가 영상을 '읽고' 이야기를 써 내려감으로써 자동으로 이루어집니다.

이렇게 '이야기 기반'의 예시들이 준비되면, 이들은 라이브러리에 저장됩니다. 로봇이 새로운 과업에 직면했을 때, 로봇은 그냥 추측하지 않습니다. 라이브러리를 검색하여 가장 잘 맞는 이야기를 찾아내고, 그것을 가이드로 삼습니다. 하지만 여기서 영리한 점이 있습니다. 로봇은 특별한 방식으로 훈련됩니다. 훈련 과정 중에 로봇은 두 가지 일을 동시에 해야 합니다. 팔을 움직이는 법(행동)을 배워야 함과 동시에, 그 움직임을 말로 설명하는 법(추론)을 배워야 합니다. 이는 마치 수학 문제를 풀면서 만점을 받기 위해 풀이 과정까지 글로 써야 하는 학생과 같습니다. 이 과정은 로봇이 단순히 동작을 흉내 내는 것이 아니라, 과업의 '논리'를 이해하도록 강제합니다.

그러나 이 논문은 실제 환경에서 이것이 어떻게 작동하는지에 대해 매우 중요한 구분을 합니다. 로봇은 훈련 중에 스스로에게 말을 걸며 학습하지만, 실제로 업무를 수행할 때(추론 시)는 말을 멈춥니다. 뇌의 '설명하는' 부분이 꺼지고 '움직이는' 부분만 활성화되는 것입니다. 왜일까요? 말하는 데는 시간이 걸리고, 로봇은 빠르게 움직여야 하기 때문입니다. 실제 작업 중에 이 '수다'를 끔으로써, 로봇은 공부할 때 배운 깊은 이해도를 유지하면서도 매우 빠르고 기민하게 움직일 수 있습니다.

이러한 접근 방식의 결과는 적어도 연구진이 실시한 테스트에서는 상당히 유망합니다. LIBERO라고 불리는 일련의 시뮬레이션에서 로봇은 **98.8%**라는 매우 높은 성공률을 기록했습니다. 새로운 물체나 혼란스러운 배경 같은 까다로운 상황을 포함하는 더 어려운 리더보드인 VLA-Arena에서 StellaVLA는 종합 점수 0.63을 기록했습니다. 이는 약 0.44와 0.22를 기록한 다른 강력한 모델들을 능가한 수치입니다. 심지어 조명이 이상하거나 카메라 각도가 바뀌거나, 본 적 없는 물체(예: 당근의 색깔이 다른 경우)를 다뤄야 하는 상황에서도, LIBERO-Plus라는 강건성 테스트에서 **85.1%**를 기록하며 경쟁 모델들보다 더 잘 버텨냈습니다.

연구진은 또한 이를 실제 세계의 로봇 팔에도 테스트했습니다. 그들은 로봇이 인간, 다른 로봇, 또는 가상 현실(XR) 시뮬레이션으로부터 온 시연을 가이드로 사용할 수 있다는 것을 발견했습니다. '선생님'이 누구든 상관없었습니다. '이야기'의 내용이 명확하다면 로봇은 그것을 따를 수 있었습니다. 예를 들어, 한 번도 본 적 없는 서랍에 블록을 넣으라는 요청을 받았을 때, 로봇은 단순히 실패하는 데 그치지 않고 평균 4점 만점에 1.9점을 기록하며, 완벽하게 끝내지는 못하더라도 계획을 따르려고 노력하는 모습을 보였습니다.

하지만 이 논문은 이것이 모든 문제를 해결하는 마법의 탄환이라고 주장하지는 않습니다. 로봇은 여전히 계획을 중간에 수정해야 하는 매우 길고 복잡한 과업(예: 로봇이 작업하는 동안 사람이 들어와 블록을 옮기는 경우)에서 어려움을 겪습니다. 이러한 '롱 호라이즌(long horizon)' 테스트에서는 성공률이 크게 떨어졌는데, 이는 로봇이 미리 작성된 이야기를 따르는 데는 뛰어나지만, 현장에서 완전히 새로운 줄거리를 즉흥적으로 만들어내는 데는 아직 준비가 되지 않았음을 시사합니다. 또한, 논문은 다양한 유형의 시연(인간 vs 로봇)을 사용할 때 매우 일관된 모습을 보이지만, 실제 세계 테스트에서는 완벽하게 작동하기 위해 여전히 적절한 종류의 가이드가 필요하다는 점을 언급했습니다.

요약하자면, StellaVLA는 로봇을 똑똑하고 적응력 있게 만들고 싶다면, 단순히 무엇을 할지 보여주는 것이 아니라 '왜' 그것을 하는지 말해주어야 한다는 점을 시사합니다. 가공되지 않은 영상을 구조화되고 논리적인 이야기로 변환하고, 그 논리를 이해하도록 로봇을 가르침으로써, 이 시스템은 새롭고 까다로운 상황을 훨씬 더 잘 처리할 수 있게 됩니다. 이는 로봇이 단순히 우리의 동작을 복사하는 것을 넘어, 우리의 의도를 실제로 이해하게 만드는 단계로 나아가는 길입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →