CoTinyVLA: Chain-of-Thought Distillation for a Sub-Billion-Parameter Vision-Language-Action Model
CoTinyVLA는 모델 크기를 키우는 대신 이중 뷰 시계열 입력, 계층적 사고 사슬 증류, 그리고 의역 증강을 포함한 구조화된 지도 학습 기법을 활용하여 LIBERO-Plus 벤치마크에서 최첨단 수준의 강건성을 달স্য한 10억 파라미터 미만의 시각-언어-행동(Vision-Language-Action) 모델이다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
로봇이 단순히 딱딱한 코드를 따르는 무생물이 아니라, 우리의 말을 이해하고 일을 완수하기 위해 자신의 팔을 어떻게 움직여야 할지 스스로 판단할 수 있는 유능한 동반자가 되는 세상을 상상해 보십시오. 이것이 바로 '체화된 AI(embodied AI)'의 꿈입니다. 이 분야는 컴퓨터가 카메라를 통해 세상을 보고, 인간의 언어를 이해하며, 이 두 가지를 물리적 행동으로 변환하는 법을 배우는 영역입니다. 오랫동안 가장 똑똑한 로봇들은 이 모든 것을 처리하기 위해 수십억 개의 '뉴런'을 가진 거대한 컴퓨터 모델, 즉 거대한 뇌를 필요로 했습니다. 이 거대한 모델들은 마치 엄청나게 크고 비싼 서버가 있어야만 구동할 수 있는 슈퍼컴퓨터와 같아서, 집 안을 돌아다니거나 주방에서 도움을 줄 수 있는 작은 로봇 안에 넣기에는 불가능했습니다. 연구자들이 던진 핵심 질문은 이것입니다. "똑같이 똑똑하고 신뢰할 수 있으면서도, 배낭에 들어갈 정도로 작은 로봇을 만들 수 있을까?"
이 논문은 CoTinyVLA라는 새로운 로봇의 뇌를 소개합니다. 이것은 현재 이 분야를 이끌고 있는 거대하고 무거운 모델들을 능가하면서도, 메모리는 아주 적게 사용하는 작고 매우 효율적인 로봇 뇌라고 생각하면 됩니다. 연구진은 단순히 뇌를 축소한 것이 아니라, 로봇에게 더 나은 방식으로 생각하는 법을 가르쳤습니다. 가능한 모든 상황을 암기하려고 노력하는 대신, 로봇에게 '추론을 위한 요약 노트(cheat sheet)'를 준 것입니다. 그들은 로봇이 큰 과업을 간단한 계획(마치 할 일 목록처럼)으로 나누고, 움직이기 전에 각 작은 단계를 차근차근 생각하도록 가르쳤습니다. 또한 로봇에게 특별한 두 쌍의 눈을 주었습니다. 하나는 방 전체를 보기 위해 멀리서 보는 눈이고, 다른 하나는 손목에 달려 있어 손이 무엇을 만지고 있는지 정확히 보는 눈입니다. 그리고 로봇이 움직임을 이해할 수 있도록 지난 몇 초간의 짧은 영상을 관찰하는 법을 가르쳤습니다. 그 결과, 0.9 tỷ(9억) 개의 파라미터만을 가진 이 로봇 모델은 70억 개의 파라미터를 가진 거대 모델들보다 더 복잡하고 지저잡한 실제 환경을 더 잘 다룰 수 있게 되었습니다.
문제점: 거대한 뇌, 작은 로봇
수년간 명령을 수행하는 최고의 로봇들은 마치 거대하고 무거운 탱크와 같았습니다. "파란색 컵을 집어서 테이블 위에 놓아줘"와 같은 명령을 이해하기 위해, 이 로봇들은 30억에서 70억 개의 파라미터를 가진 거대한 컴퓨터 모델을 사용합니다. 이러한 모델들은 믿을 수 없을 정도로 똑똑하지만, 동시에 매우 거대합니다. 이 모델들을 실행하려면 약 20GB의 컴퓨터 메모리가 필요합니다. 이는 마치 도서관 전체를 배낭 안에 쑤셔 넣으려는 것과 같습니다. 이동형 로봇이나 보조 기기에 들어있는 작은 배터리 기반 컴퓨터에는 도저데 맞지 않습니다.
연구자들은 알고 싶었습니다. 과연 이렇게 거대한 뇌가 반드시 똑똑하기 위해 필요한 것일까요? 아니면, 예측 불가능한 현실 세계의 어지러운 상황들을 처리할 수 있을 만큼 똑똑하면서도 작은, 효율적인 로봇을 만들 수 있을까요?
해결책: 거대한 전략을 가진 작은 뇌
연구팀은 0.9 tỷ(9억) 개의 파라미터만을 가진 로봇 뇌인 CoTinyVLA를 구축했습니다. 이 작은 모델을 거인들만큼 강력하게 만들기 위해, 연구진은 단순히 더 많은 데이터를 입력한 것이 아니라, 로봇이 학습하는 방식과 주의를 기울이는 방식을 바꾸었습니다. 그들은 '구조적 감독(structured supervision)'이라 부르는 세 가지 주요 기술을 사용하여 로봇이 더 잘 생각하도록 가르쳤습니다.
1. "두 개의 눈" 타임머신
공을 잡으려고 한다고 상상해 보십시오. 만약 공의 사진 한 장만 본다면, 공이 당신 쪽으로 오고 있는지 아니면 멀어지고 있는지 알 수 없습니다. 움직임을 이해하려면 짧은 영상이 필요합니다.
CoTinyVLA는 두 가지 서로 다른 '눈'을 통해 동시에 세상을 보도록 학습됩니다:
- 3인칭 눈: 사물이 어디에 있는지 전체 방을 보는 카메라.
- 손목 눈: 로봇의 손에 달려 있어 그리퍼(집게)가 정확히 무엇을 만지고 있는지 보는 카메라.
단순히 현재의 순간만을 보는 것이 아니라, 로봇은 마지막 16개 프레임(각 눈당 8개씩)의 짧은 '영화'를 관찰합니다. 이를 통해 로봇은 시간과 움직임의 감각을 갖게 되며, 물체가 얼마나 빨리 움직이고 어디로 향하는지 이해할 수 있습니다.
2. "계획하고 생각하기" 요약 노트
이것이 가장 중요한 기술입니다. 로봇은 움직이기 전에 하나의 이야기를 써 내려치도록 교육받습니다.
- 계획(The Plan): 과업이 시작될 때, 로봇은 높은 수준의 '할 일 목록'을 작성합니다 (예: "먼저, 컵을 잡는다. 둘째, 컵을 들어 올린다. 셋째, 컵을 테이블 위에 놓는다"). 이 계획은 전체 과업 동안 유지됩니다.
- 생각(The Think): 매 작은 움직임 전마다, 로의는 자신이 지금 무엇을 하고 있는지에 대한 짧은 노트를 작성합니다 (예: "나는 그리퍼를 닫고 있다" 또는 "나는 컵을 들어 올리고 있다").
로봇은 훨씬 더 크고 똑똑한 로봇(350억 개의 파라미터를 가진 '스승' 로봇)이 동일한 과업을 해결하는 과정을 지켜보며 이 과정을 배웁니다. 작은 로봇은 스승의 사고 과정을 그대로 복사합니다. 이는 작은 로봇이 단순히 '무엇을' 하는지가 아니라, '왜' 그 행동을 하는지를 이해하도록 돕습니다.
3. "의역하기" 게임
로봇은 누군가 같은 말을 다른 방식으로 표현하면 혼란에 빠지곤 합니다. 만약 로봇이 "컵을 집어라"라는 문구로만 훈련되었다면, 누군가 "머그잔을 잡아라"라고 말했을 때 멈춰버릴 수 있습니다.
이를 해결하기 위해, 연구진은 40개의 기본 명령어를 800개의 다양한 버전으로 확장하여 로봇을 가르쳤습니다. 단어를 바꾸고(예: "집다"를 "잡다"나 "들어 올리다"로 변경), 사물의 묘사를 바꾸고(예: "검은색 그릇"을 "어두운 색 그릇"으로 변경), 심지어 "부탁인데... 해줄래?"와 같은 정중한 문구를 추가했습니다. 이를 통해 로봇은 특정 단어가 아니라 명령의 '의미'를 이해하도록 학습되었습니다.
결과: 작은 자가 거둔 큰 승리
연구진은 세상의 변화를 얼마나 잘 다루는지 테스트하기 위해 설계된 까다로운 테스트 세트인 LIBERO-Plus에서 CoTinyVLA를 테스트했습니다. 이 테스트에는 로봇이 이상한 위치에서 시작하거나, 조명이 바뀌거나, 배경이 달라지거나, 명령어가 이상하게 표현되는 등 상황이 엉망이 된 10,000개 이상의 서로 다른 시나리오가 포함되어 있습니다.
결과는 놀라웠습니다. 0.9 tỷ(9억) 개의 파라미터만을 가진 CoTinyVLA는 네 가지 주요 테스트 카테고리 모두에서 가장 강력한 70억 개의 파라미터 모델들을 이겼습니다:
- 공간(Spatial): 90.8% 성공률 (거대 모델보다 4.7포인트 앞섬).
- 물체(Object): 87.3% 성공률 (거대 모델보다 2.8포인트 앞섬).
- 목표(Goal): 86.6% 성공률 (거대 모델보다 무려 15.9포인트 앞섬).
- 장기(Long): 80.7% 성공률 (거대 모델보다 3.0포인트 앞섬).
가장 큰 승리는 "목표(Goal)" 카테고리였는데, 여기서 작은 로봇은 가장 강력한 거대 로봇보다 거의 16포인트나 더 높은 성적을 거두었습니다. 이는 작은 로봇이 단 2.25 GiB의 메모리만을 사용하는 컴퓨터에서 구동된다는 점을 고려할 때 특히 인상적이며, 이는 실제 세계의 많은 로봇에 탑재하기에 충분한 크기입니다.
이것이 왜 중요한가
이 논문은 똑똑한 로봇을 만들기 위해 반드시 거대한 뇌가 필요한 것은 아니라는 점을 보여줍니다. 작은 로봇에게 구조적인 방식으로 '생각하는 법'(계획을 세우고 단계를 확인하는 법)을 가르치고, 적절한 종류의 시각 및 언어 훈련을 제공한다면, 훨씬 더 큰 모델들보다 복잡하고 예측 불가능한 현실 세계를 더 잘 다룰 수 있습니다.
또한 연구진은 "계획"을 세우는 사고 과정이 결정적이라는 것을 발견했습니다. 만약 로봇에게서 계획을 쓰는 능력을 제거하면, 성공률이 40~45포인트나 떨어집니다. 이는 로봇이 단순히 추측하는 것이 아니라, 실제로 계획을 사용하여 행동을 안내하고 있음을 증명합니다.
요약하자면, CoTinyVLA는 적절한 교수법이 있다면 작고 효율적인 로봇도 거대한 슈퍼컴퓨터만큼 유능해질 수 있음을 입증하며, 우리 집이나 직장에서 도움을 줄 수 있는 지능형 로봇을 갖게 되는 길에 한 걸음 더 다가서게 합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.