← 최신 논문
🤖 AI

Finetuning Vision-Language-Action Models Requires Fewer Layers Than You Think

이 논문은 시각-언어-행동(Vision-Language-Action) 모델에서 중복된 레이어를 식별하고 제거하여, 다양한 로봇 작업 전반에서 성능을 유지하거나 향상시키면서도 최대 50%의 깊이 감소와 훈련 및 추론 모두에서의 상당한 가속화를 달성하는 훈련이 필요 없는 구조적 압축 파이프라인을 소개한다.

원저자: Gia-Binh Nguyen, Trong-Bao Ho, Thien-Loc Ha, Khoa Vo, Philip Lund Møller, Quang T. Nguyen, Long Dinh, Tuan Dam, Vu Duong, Tung M. Luu, Trung Le, Tran Nguyen Le, Minh Vu, An Thai Le, Ngan Le, Daniel So
게시일 2026-06-19
📖 3 분 읽기☕ 가벼운 읽기

원저자: Gia-Binh Nguyen, Trong-Bao Ho, Thien-Loc Ha, Khoa Vo, Philip Lund Møller, Quang T. Nguyen, Long Dinh, Tuan Dam, Vu Duong, Tung M. Luu, Trung Le, Tran Nguyen Le, Minh Vu, An Thai Le, Ngan Le, Daniel Sonntag, James Zou, Jan Peters, Duy M. H. Nguyen, Ngo Anh Vien

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

상상해 보세요. 당신에게 거대하고 초지능적인 로봇 두뇌가 있습니다. 이 두뇌는 "시각-언어-행동(VLA)" 모델입니다. 이 모델은 세상을 보고, 당신의 말소리를 이해하며, 옷을 접거나 컵을 집어 올리는 것과 같은 동작을 수행하기 위해 팔을 어떻게 움직여야 할지 정확하게 파악할 수 있습니다.

문제는 이 두뇌들이 어마어마하게 크다는 점입니다. 너무 커서 학습시키는 데 슈퍼컴퓨터로 며칠씩 걸리며, 실시간으로 구동하는 것은 마치 북적이는 시장통에서 페라리를 운전하려는 것과 같습니다. 느리고, 비용이 많이 들며, 많은 연료(컴퓨팅 파워)를 필요로 합니다.

이 논문의 저자들은 아주 단순한 질문을 던졌습니다. "우리가 정말 그 모든 두뇌가 다 필요한가?"

핵심 발견: "에코 체임버(메아리 방)" 효과

연구진은 이 거대한 로봇 두뇌 내부를 들여다보았고, 놀라운 사실을 발견했습니다. 이 두뇌들에는 중복성이 가득하다는 것입니다.

두뇌를 50명의 작업자가 있는 긴 조립 라인이라고 생각해 보세요.

  • 작업자 1은 물체를 관찰합니다.
  • 작업자 2는 그것을 다시 보고는 "맞아, 컵이야"라고 말합니다.
  • 작업자 3은 그것을 보고 "여전히 컵이네"라고 말합니다.
  • 작업자 4는 "확실히 컵이야"라고 말합니다.

연구진은 이 조립 라인의 긴 구간 동안, 작업자들이 단순히 이전 작업자가 했던 말을 반복하고 있다는 것을 발견했습니다. 그들은 새로운 것을 추가하는 것이 아니라, 그저 똑같은 정보를 메아리처럼 전달하고 있을 뿐입니다. 기술적인 용어로, 이들은 연속된 층(layer)들이 거의 동일한 "생각"(표현)을 생성한다는 것을 발견했습니다.

해결책: "CKA" 가위

모든 50명의 작업자를 다 유지하는 대신, 팀은 CLP(CKA 기반 레이어 가지치기)라고 불리는 방법을 고안했습니다.

당신이 조립 라인의 소리를 들을 수 있는 스마트한 가위를 가지고 있다고 상상해 보세요. 이 가위는 **중심 커널 정렬(Centered Kernel Alignment, CKA)**이라는 도구를 사용하여 두 작업자가 얼마나 똑같은 말을 하고 있는지 측정합니다.

  • 만약 작업자 5와 작업자 6이 정확히 같은 말을 하고 있다면, 가위는 그들을 잘라냅니다.
  • 그러면 작업자 4가 작업자 7에게 직접 메시지를 전달할 수 있도록 라인이 다시 연결됩니다.

결정적으로, 이 방법은 전체 두뇌를 처음부터 다시 학습시킬 필요가 없습니다. 이는 로봇이 새로운 특정 작업을 배우기 에 한 번 수행하는 일회성 "다듬기" 작업입니다.

결과: 더 작고, 더 빠르고, 더 똑똑하게

불필요한 부분을 잘라낸 후, 결과는 인상적이었습니다.

  1. 두뇌가 작아졌습니다: 레이어를 최대 **50%**까지 제거했습니다. 이는 50층짜리 마천루를 25층짜리로 만드는 것과 같지만, 건물은 여전히 견고하게 서 있습니다.
  2. 학습이 빨라졌습니다: 모델이 더 작아졌기 때문에, 새로운 작업을 가르치는 데 드는 시간이 40~50% 감소했습니다. 예전에 20시간 걸리던 학습이 이제는 약 10시간이면 충분합니다.
  3. 실시간 속도: 이제 로봇은 실제 상황에서 약 30% 더 빠르게 생각하고 움직일 수 있습니다.
  4. 일부 사례에서의 성능 향상: 놀랍게도, 로봇이 배울 데이터가 많지 않은 상황(예: 작업을 단 100번만 본 경우)에서는 더 작은 두뇌가 거대한 두뇌보다 오히려 더 나은 성능을 보였습니다.
    • 비유: 시험 공부를 한다고 생각해 보세요. 만약 당신에게 방대하고 혼란스러운 교과서(큰 모델)가 있다면, 압도당하거나 엉뚱한 것을 외울 수도 있습니다(과적합). 하지만 간결하고 명확한 요약본(가지치기 된 모델)이 있다면, 당신은 가장 중요한 사실에 집중하여 시험을 더 잘 볼 수 있습니다.

테스트 장소

그들은 단순히 컴퓨터 시뮬레이션에서만 테스트하지 않았습니다. 다음 환경에서 테스트를 진행했습니다:

  • 가상 로봇: LIBERO 및 RoboCasa와 같은 비디오 게임 세계.
  • 실제 로봇: 실제 실험실에서 반바지를 접거나, 냅킨을 서빙하거나, 블록을 쌓는 등의 작업을 수행하는 실제 물리적 팔(UR10 및 ALOHA 로봇 등).

결론

이 논문은 이러한 고급 로봇 두뇌들이 "과잉 설계"되어 있음을 증证明합니다. 이들은 주어진 일을 수행하기 위해 필요한 것보다 훨씬 더 많은 층을 가지고 있습니다. 반복적인 레이어를 제거하는 간단하고 학습이 필요 없는 방법을 사용함으로써, 우리는 더 저렴하게 학습시키고, 더 빠르게 실행하며, 심지어 기존보다 더 뛰어난 성능을 내는 로봇을 만들 수 있습니다.

요약하자면: 옷을 접기 위해 50개의 층을 가진 두뇌가 필요한 것은 아닙니다. 효율적으로 다듬어진 25개의 층을 가진 두뇌만으로도 충분하며, 그 두뇌는 더 빠르게 작동합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →