← 최신 논문
🤖 AI

Rethinking Depth Pruning for Vision Transformers: A Heterogeneity-Aware Perspective

이 논문은 레이어 간 이질성을 해결함으로써 기존 방식의 정확도 회복 문제를 극복하고, 이를 통해 여러 벤치마크에서 비전 트랜스포머(Vision Transformers)에 대해 최소한의 정확도 손실로 상당한 속도 향상을 달성하는 이질성 인지 깊이 프루닝 방법인 HetDPT를 소개한다.

원저자: Zhenfeng Su, Kang Zhao, Han Bao, Tao Yuan, Zhongzhe Hu, Xianzhi Yu, Wenxuan Wang

게시일 2026-07-07
📖 4 분 읽기☕ 가벼운 읽기

원저자: Zhenfeng Su, Kang Zhao, Han Bao, Tao Yuan, Zhongzhe Hu, Xianzhi Yu, Wenxuan Wang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

비전 트랜스포머(ViT)를 이미지를 인식하도록 설계된 매우 정교하고 다층적인 공장이라고 상상해 보십시오. 공장의 각 층은 이미지가 처리되는 '레이어(layer)'를 나타냅니다. 어떤 층은 어텐션(Attention)(전체 그림을 스캔하여 서로 다른 부분이 어떻게 연관되는지 살피는 역할)에 특화되어 있고, 다른 층은 액티베이션(Activation)(세부 사항을 날카롭게 만들기 위해 특정 필터나 '비선형성'을 적용하는 역할)에 특화되어 있습니다.

수년 동안, 이 공장을 더 작은 기기에서 더 빠르게 구동하려는 엔지니어들은 주로 **너비 프루닝(Width Pruning)**에 집중해 왔습니다. 이는 각 층에서 일하는 직원을 줄이는 것과 같습니다. 공장은 작아지겠지만, 여전히 동일한 수의 층을 가지고 있기 때문에 제품은 여전히 모든 단계를 거쳐 통과해야 합니다.

이 논문은 깊이 프루닝(Depth Pruning), 즉 아예 층 전체를 제거하는 것이 더 나은 방법이라고 주장합니다. 만약 50%의 층을 제거한다면, 제품은 두 배 더 빠르게 끝에 도달할 수 있습니다. 하지만 이전의 시도들은 처참하게 실패했습니다. 공장은 무너졌고, 출력물(이미지 인식)의 품질은 급격히 떨어졌습니다.

저자들은 HetDPT라는 방법을 통해 공장이 왜 무너졌는지 그 이유를 발견했고, 이를 해결하기 위한 새로운 방법을 구축했습니다. 다음은 이를 쉬운 용어로 풀어서 설명한 내용입니다.

문제점: "불일치"와 "서로 다른 성격"

논문은 단순히 층을 삭제하는 것이 왜 작동하지 않는지에 대해 두 가지 주요 원인을 밝혀냈습니다.

  1. 차원 불일치 (끊어진 컨베이어 벨트):
    공장에 컨베이어 벨트 시스템이 있다고 상상해 보십시오. "어텐션" 층과 "액티베이션" 층은 특정한 방식으로 연결되어 있습니다. 만약 액티베이션 층을 무작위로 뽑아내 버리면, 이전 층에서 온 컨베이어 벨트가 더 이상 존재하지 않는 기계에 도착하거나, 혹은 존재하는 기계가 예상하는 크기와 다른 크기의 패키지가 들어오게 됩니다. 논문은 이를 "차원 불일치(dimension mismatch)"라고 부릅니다. 이는 중간의 어댑터를 제거해 버려서 사각 구멍에 원형 막대를 끼우려는 것과 같습니다.

    • 해결책: 저자들은 "액티베이션" 층을 완전히 제거하고, 그 양옆에 있는 두 개의 "리니어(Linear)"(기계) 층을 단순히 하나로 합칠 수 있다는 것을 깨달았습니다. 이렇게 하면 컨베이어 벨트에 완벽하게 들어맞는 새로운 매끄러운 기계를 만들 수 있어, 층이 줄어들어도 공장이 원활하게 돌아가게 됩니다.
  2. 이질성 (서로 다른 성격):
    이것이 이 논문의 가장 큰 통찰입니다. 저자들은 어텐션 층과 액티베이션 층이 서로 같지 않으며, 서로 다른 "성격"을 가지고 있다는 것을 깨달았습니다.

    • 어텐션 층은 **시니어 매니저(Senior Managers)**와 같습니다. 매니저를 몇 명 해고하면 처음에는 공장이 조금 느려지지만, 다시 전성기 속도로 회복하는 데 아주 오랜 시간이 걸립니다. 이들은 빠르게 대체하기 어렵습니다.
    • 액티베이션 층은 **주니어 인턴(Junior Interns)**과 같습니다. 이들을 해고하면 공장은 즉시 붕괴합니다(정확도가 거의 0에 가깝게 떨어집니다). 하지만, 이들에게 10분 정도의 짧은 교육(파인튜닝)만 준다면, 이들은 거의 즉시 원래의 성능으로 회복합니다.
    • 기존 방식의 실수: 기존 방식들은 모든 층을 동일하게 취급했습니다. 그들은 "그레디언트(gradient, 각 층이 얼마나 기여하는지를 나타내는 척도)"를 보고 수치가 가장 낮은 사람들을 해고했습니다. 하지만 시니어 매니저(어텐션)는 주니어 인턴(액티베이션)과 자연스럽게 다른 "전압"을 가지고 있기 때문에, 기존 방식은 엉뚱한 사람들을 계속 해고하여 결국 붕괴를 초래했습니다.

해결책: HetDPT (스마트한 공장 관리자)

저자들은 이 공장을 관리하기 위해 HetDPT(Heterogeneity-Aware Depth Pruning)라고 불리는 2단계 프로세스를 만들었습니다.

1단계: 예산 할당 (전략)
누구를 해고하기 전에, 관리자는 "모델 정확도 예측기(Model Accuracy Predictor)"(스마트한 계산기)를 사용합니다. "어떤 특정 층이 최악인가?"라고 묻는 대신, "만약 시니어 매니저 3명과 주니어 인턴 5명을 해고한다면, 공장이 여전히 제대로 작동할까?"라고 묻습니다.

  • 매니저를 해고하는 것과 인턴을 해고하는 것의 다양한 조합을 테스트합니다.
  • 완벽한 균형점을 찾아냅니다 (예: "총 10개의 층을 제거할 수 있지만, 높은 품질을 유지하려면 인턴 6명과 매니저 4명을 해고해야 한다").
  • 이는 매니저와 인턴을 직접 비교하는 실수를 피하게 해주는데, 이는 마치 사과와 오렌지를 비교하는 것과 같기 때문입니다.

2단계: 실행 (정리)
예산이 설정되면(예: "인턴 6명 해고"), 이 방법은 각 그룹별로 따로 들어갑니다.

  • 모든 인턴을 살펴보고 가장 덜 필요한 인턴을 해고합니다.
  • 모든 매니저를 살펴보고 가장 덜 필요한 매니저를 해고합니다.
  • 핵심적으로: 해고된 인턴 주변의 리니어(Linear) 기계들을 병합하여 컨베이어 벨트가 완벽하게 맞도록 만듭니다(불일치 문제 해결).
  • 마지막으로, 남은 직원들에게 빠른 "보수 교육(refresher course)"(파인튜닝)을 실시하여 그들이 100% 성능을 낼 수 있도록 합니다.

결과: 품질 손실 없이 더 빠르게

저자들은 이 방법을 ImageNet(100만 장의 사진이 담긴 거대한 사진첩과 같은 표준 이미지 데이터셋)과 같은 여러 표준 데이터셋에서 테스트했습니다.

  • 속도: 표준 모델(DeiT-B)에 대해 정확도를 똑같이 유지하면서 1.58배 빠른 처리를 달성했습니다.
  • 극한의 압축: 이 방법을 너비 프루닝(width pruning)과 결합했을 때, 정확도 손실이 거의 없이 원래보다 5.19배 빠른 초경량 모델을 만들어냈습니다.
  • 범용성: 이 방법은 표준 모델뿐만 아니라 더 복잡한 Swin Transformer, 그리고 수십억 개의 파라미터를 가진 거대 모델인 DINO-V2-Giant에서도 작동했습니다.

요약 비유

자동차를 조립하는 긴 조립 라인을 생각해 보십시오.

  • 기존 방식: 작업자들이 더 빨리 일하게 만들거나(너비 프루닝), 혹은 조립 라인의 여러 스테이션에서 무작위로 사람을 해고하여 다음 스테이션이 준비되지 않아 자동차 섀시가 라인에서 떨어지게 만듭니다(실패한 깊이 프루닝).
  • HetDPT 방식: 당신은 어떤 스테이션(인턴)은 아예 제거하고 그 양옆의 기계를 서로 용접하여 합칠 수 있다는 것을 깨닫습니다. 또한, 스테이션 매니저(어텐션)를 해고하는 것은 라인에 장기적인 영향을 미치는 반면, 인턴을 해고하는 것은 일시적이지만 빠르게 회복된다는 것도 깨닫습니다. 따라서 당신은 각각 얼마나 해고할지 신중하게 계산하고, 기계들을 용접하여 합친 뒤, 남은 팀원들에게 짧은 격려의 말(교육)을 건넵니다. 그 결과, 자동차는 원래보다 두 배 더 빠르게 완성되면서도 여전히 완벽한 자동차로 나옵�니다.

이 논문은 레이어의 서로 다른 "성격"을 존중하고 기계적 불일치를 해결함으로써, 강력한 AI 모델의 지능을 잃지 않으면서도 일반적인 기기에서 훨씬 더 빠르게 실행되도록 만들 수 있다고 결론짓습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →