← 최신 논문
🤖 AI

Accelerating Vision Transformers on Brain Processing Unit

본 논문은 선형 레이어를 합성곱 연산자로 대체하여 재학습 없이 가중치 상속을 가능하게 함으로써, CNN에 최적화된 BPU(Brain Processing Unit)에서 비전 트랜스포머를 가속화하고 미미한 정확도 손실과 함께 상당한 추론 속도 향상을 달성하는 모델 재구조화 방식을 제안한다.

원저자: Jinchi Tang, Yan Guo

게시일 2026-02-09
📖 3 분 읽기☕ 가벼운 읽기

원저자: Jinchi Tang, Yan Guo

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신에게 초효율적이고 전문화된 공장 노동자인 BPU(Brain Processing Unit)가 있다고 상상해 보세요. 이 노동자는 4D 레고 브릭(표준 이미지 데이터인 높이, 너비, 색상 채널, 배치를 나타냄)을 조립하는 데 도가 튼 전문가입니다. 인공지능의 세계에서, 이들은 CNN(합성곱 신경망)을 만드는 최고의 '벽돌 쌓기' 전문가입니다.

하지만, 완전히 새로운 유형의 설계자인 **Vision Transformer (ViT)**가 등장했습니다. ViT는 4D 레고 브릭으로 건물을 짓는 대신, 3D 종이 뭉치(데이터 시퀀스)를 가지고 작업합니다. 이들은 매우 똑똑하며 종종 더 나은 결과를 만들어내지만, 사용하는 언어가 다릅니다. 당신이 BPU 공장 노동자에게 ViT를 건설하라고 시키면, 그들은 혼란에 빠집니다. 이 노동자는 벽돌을 쌓도록 설계되었지, 종이 뭉치를 분류하도록 설계되지 않았기 때문입니다. 결과적으로, ViT는 훨씬 느린 범용 노동자인 CPU에 의해 구축되어야 하며, 이 과정에서 초고속인 BPU는 아무 일도 하지 못한 채 놀게 됩니다.

종이의 해결책: "모양 변형" 기술

이 논문의 저자인 진치 탕(Jinichi Tang)과 옌 구오(Yan Guo)는 영리한 우회 방법을 고안해 냈습니다. 그들은 BPU에게 종이 뭉치를 읽는 법을 가르치려 하지 않았습니다(그것은 어렵고 시스템 전체를 재학습시켜야 하는 일입니다). 대신, 그들은 종이 뭉치를 레고 브릭처럼 보이도록 재배열했습니다.

그들이 어떻게 이 일을 해냈는지, 간단한 비유를 통해 설명하겠습니다.

  1. 선형 계층(Linear Layer) 문제: 표준 ViT에서 두뇌는 정보를 처리하기 위해 "선형 계층"을 사용합니다. 이것을 단어 목록을 읽고 새로운 목록을 출력하는 번역가라고 생각해보세요. BPU는 목록을 읽을 수 없으며, 오직 4D 그리드만을 이해합니다.

    • 해결책: 저자들은 이 "번역가"를 가져와서 그 지침을 1x1 레고 브릭처럼 보이도록 모양을 바꿨습니다. 수학적으로는 정확히 같은 일을 수행하지만, 이제 BPU의 공장에 완벽하게 들어맞습니다. 이는 마치 지도의 내용을 바꾸지 않고, 특정 튜브에 맞추기 위해 평면 지도를 원통형으로 마는 것과 같습니다.
  2. 계층 정규화(Layer Normalization) 문제: ViT는 데이터의 균형을 맞추기 위해(마치 온도 조절기가 방의 온도를 적정하게 유지하는 것처럼) "계층 정규화"라는 단계를 사용합니다. 하지만 BPU에는 내장된 온도 조절기가 없습니다.

    • 해결책: 저자들은 BPU가 이미 가지고 있는 기존 레고 브릭들로 "온도 조절기"를 만들었습니다. 그들은 평균과 분산을 계산하는 특수한 작은 브릭들(1x1 컨볼루션)의 체인을 만들어, BPU가 가진 도구만을 사용하여 온도 조절기를 효과적으로 흉내 냈습니다.

"재학습 없음"의 마법

보통 건물의 설계도가 바뀌면, 건물을 허물고 처음부터 다시 지어야 합니다. 하지만 저자들이 그들의 "레고 브릭"을 원래의 "종이 뭉치"와 수학적으로 동일하게 매우 정교하게 만들었기 때문에, 원래의 설계도(가중치)는 여전히 완벽하게 작동합니다.

그들은 모델을 재학습시키거나 새로운 것을 가르칠 필요가 없었습니다. 그들은 단지 사전 학습된 "DeiT"(효율적인 버전의 ViT) 모델을 가져와서, 자신들의 모양 변형 기술을 적용한 뒤 BPU에 전달했을 뿐입니다. BPU는 즉시 새로운 형식을 인식하고 풀 스피드로 작동하기 시작했습니다.

결과: 속도 vs 정확도

팀은 두 가지 서로 다른 작업에 대해 테스트를 진행했습니다: 수천 개의 객체를 인식하는 것(ImageNet)과 꽃을 분류하는 것입니다.

  • 트레이드오프(Trade-off): 모델을 특수 하드웨어에서 실행하도록 변환할 때, 보통 약간의 정밀도 손실이 발생합니다(예: 고화질 사진을 약간 압축된 JPEG로 바꾸는 것과 같습니다).
    • 큰 모델인 DeiT-Base의 경우, 정확도가 아주 약간(81.8%에서 80.4%로 1.4%) 떨어졌습니다.
    • 꽃 테스트에서는 하락 폭이 더 작아 단 **0.5%**였습니다.
  • 보상: 그 미세한 정확도 하락의 대가로, 모델은 훨씬 빨라졌습니다.
    • 가장 큰 모델(DeiT-Base)은 표준 CPU에서 실행될 때보다 BPU에서 3.8배 더 빠르게 작동했습니다.
    • 작은 모델들도 1.3배에서 2.1배 사이의 속도 향상을 보였습니다.

재미있는 발견

테스트 도중, 저자들은 흥미로운 점을 발견했습니다. 때때로 테스트 이미지의 공식 라벨이 잘못되어 있었습니다(예: "사자" 사진이 "원숭이"로 라벨링됨). 원래의 DeiT 모델은 사자를 올바르게 식별했지만, 시스템은 잘못된 라벨 때문에 이를 오류로 표시했습니다. 저자들의 새로운 빠른 모델 역시 사자를 올바르게 식별했습니다. 이는 모델이 실제로는 공식 점수보다 더 똑똑하다는 것을 시사합니다. 왜냐하면 테스트 데이터의 "오타"를 꿰뚫어 볼 수 있기 때문입니다.

요약

이 논문은 누군가가 Vision Transformer(종이 뭉치 설계자)를 가져와서, 설계도를 처음부터 다시 만들지 않고도 전문화된 브레인 프로세싱 유닛(레고 공장)에서 실행시키는 데 성공한 첫 번째 사례입니다. 하드웨어에 맞게 수학적 구조를 교묘하게 재구성함으로써, 그들은 지능의 손실 거의 없이 3.8배의 속도 향상을 달رشف었으며, 이러한 고급 AI 모델들이 마침내 특화된 임베디드 칩에서도 효율적으로 실행될 수 있음을 증명했습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →