← 최신 논문
💻 computer science

Elastic ViTs from Pretrained Models without Retraining

이 논문은 레이블이 지정된 데이터 없이도 사전 학습된 비전 트랜스포머가 연속적인 컴퓨팅 예산에 걸쳐 탄력적 추론을 달계할 수 있도록, 그래디언트 정보와 진화 알고리즘을 활용하여 네트워크 간 상관관계를 근사하는 재학습이 필요 없는 포스트 프리트레이닝 구조적 프루닝 방법인 SnapViT을 소개한다.

원저자: Walter Simoncini, Michael Dorkenwald, Tijmen Blankevoort, Cees G. M. Snoek, Yuki M. Asano

게시일 2026-06-01
📖 4 분 읽기☕ 가벼운 읽기

원저자: Walter Simoncini, Michael Dorkenwald, Tijmen Blankevoort, Cees G. M. Snoek, Yuki M. Asano

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신에게 거의 모든 것을 인식할 수 있는 거대하고 똑똑한 도서관(Vision Transformer 또는 "ViT")이 있다고 상상해 보세요. 이 도서관은 너무 거대해서 건물 하나를 통째로 차지하며, 이를 가동하기 위해 거대하고 비싼 발전기가 필요합니다.

문제는 대부분의 실제 기기(스마트폰, 드론, 스마트 카메라 등)는 작고 배터리 용량이 제한적이라는 점입니다. 이 기기들은 전체 도서관을 담을 수도 없고, 그것을 돌릴 전기를 감당할 수도 없습니다.

보통 더 작은 도서관을 갖고 싶다면, 처음부터 새로운 작은 도서관을 만들어야 합니다. 하지만 이 논문의 저자들인 SnapViT는 이렇게 말합니다. "왜 새로 만드나요? 그냥 기존의 큰 도서관을 가져와서, 지능을 잃지 않으면서도 당신이 원하는 어떤 크기로든 즉시 줄여버리면 됩니다."

그들이 이 일을 어떻게 해냈는지 쉽게 설명해 드리겠습니다.

1. 문제점: 하나의 크기는 모두에게 맞지 않는다

이 AI 모델들을 러시아 인형(마트료시카 인형)이라고 생각해 보세요. 보통은 소형, 중형, 대형처럼 몇 가지 정해진 크기만 가질 수 있습니다. 만약 당신의 기기에 '중형'보다는 조금 작지만 '소형'보다는 큰 사이즈가 필요하다면, 방법이 없습니다. 아주 크고 느린 것을 사용하거나, 아주 작고 멍청한 것을 사용해야 할 뿐입니다.

2. 해결책: 어떤 크기로든 "스냅(Snap)" 하기

저자들은 SnapViT라는 방법을 만들었습니다. 이것은 마치 거대한 도서관을 당신이 원하는 어떤 크기로든(10% 축소, 50% 축소 등) 단 한 번의 '스냅(snap)'으로 잘라낼 수 있는 마법의 가위와 같습니다.

  • 재학습 불필요: 보통 기계의 일부를 잘라내면 작동이 멈추고 이를 고치기 위해 (재학습을 위해) 몇 시간 또는 며칠 동안 수리해야 합니다. 하지만 SnapViT는 모델을 잘라내도 즉시 작동합니다. 별도의 수정 작업이 필요 없습니다.
  • 라벨링 불필요: 대부분의 방법은 무엇이 중요한지 알려줄 선생님(예: AI에게 수천 장의 고양이와 강아지 사진을 보여주는 것)이 필요합니다. 하지만 SnapViT는 스스로 학습합니다. 데이터 자체의 패턴을 관찰함으로써 무엇을 남길지 스스로 찾아냅니다.

3. 작동 원리: "스마트 가위"

AI의 어느 부분을 자르고 어느 부분을 남길지 알기 위해, 저자들은 두 단계의 점수 산정 시스템을 사용합니다.

  • 1단계: 국소적 확인 (The "Hurt" Test - 아픔 테스트)
    AI를 막대기로 쿡 찔러본다고 상상해 보세요. 특정 부분을 찔렀을 때 AI가 비틀거린다면 그 부분은 중요한 부분입니다. 만약 아무런 반응이 없다면 그 부분은 아마 쓸모없는 부분일 것입니다. 그들은 "자기 지도 학습(self-supervised)" 기법(이미지를 다양한 각도에서 보는 방식)을 사용하여 어떤 부분이 뇌의 민감한 부분인지 확인합니다. 이를 통해 기본적인 절단 목록을 얻습니다.

  • 2단계: 전역적 확인 (The "Teamwork" Test - 팀워크 테스트)
    이것이 영리한 부분입니다. 때때로 어떤 부분은 단독으로는 쓸모없어 보일 수 있지만, 사실 다른 부분과 아주 중요한 팀 동료일 수 있습니다. 하나를 자르면 다른 하나가 혼란에 빠지게 됩니다.
    이러한 숨겨진 팀들을 찾기 위해, 그들은 유전 알고리즘(Genetic Algorithm)(디지털 진화 시뮬레이터라고 생각하세요)을 사용합니다. 모든 연결을 일일이 계산하는 대신(그러면 시간이 너무 오래 걸립니다), "이 부분을 자르면 어떻게 될까?", "저 부분을 자르면 어떻게 될까?"를 몇 분 안에 수천 번 시뮬레이션합니다. 그들은 서로 다른 부분들이 어떻게 의존하고 있는지에 대한 지도를 진화시켜 나갑니다.

4. 결과: 탄력적 추론 (Elastic Inference)

이 지도를 얻고 나면, 그들은 "연속체(continuum)"의 모델들을 생성할 수 있습니다.

  • 초고속 드론을 위한 모델이 필요한가요? SnapViT는 아주 작은 버전을 줍니다.
  • 강력한 서버를 위한 모델이 필요한가요? SnapViT는 더 큰 버전을 줍니다.
  • 그 중간 단계가 필요한가요? SnapViT는 그것 또한 제공합니다.

그들은 여러 유명한 AI 모델(DINO, SigLIPv2 등)에 대해 테스트했습니다. 그 결과, 모델을 **40%**까지 줄여도(거의 절반 크기로 만드는 것) 정확도 손실이 거의 없이 원래 모델과 거의 비슷하게 작동한다는 것을 발견했습니다.

5. 왜 빠른가?

저자들은 이 전체 과정을 단 하나의 강력한 컴퓨터 칩(A100 GPU)에서 5분 미만에 수행할 수 있다고 주장합니다. 이는 며칠이 걸릴 수 있는 다른 방법들과 비교했을 때 믿기지 않을 정도로 빠른 속도입니다.

요약 비유

집을 짓기 위한 100페이지짜리 거대한 지침서를 가지고 있다고 상상해 보세요.

  • 기존 방식: 만약 50페이지만 읽을 시간이 있다면, 여전히 말이 되도록 만드는 50페이지짜리 버전을 만들기 위해 전체 지침서를 처음부터 다시 써야 합니다.
  • SnapViT 방식: 당신은 즉시 가장 중요한 50페이지를 하이라이트 합니다. 그리고 나머지 페이지를 찢어냅니다. 남은 50페이지만으로도 집을 완벽하게 짓는 데 문제가 없으며, 당신은 새로운 설계사 없이 5분 만에 이 일을 끝냈습니다.

이 방법은 누구나 거대하고 강력한 AI를 가져와서, 재학습이나 선생님의 도움 없이도 자신의 특정 요구에 맞춰 즉시 크기를 줄여 시간, 비용, 에너지를 아낄 수 있게 해줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →