FTerViT: Fully Ternary Vision Transformer
본 논문은 모든 가중치와 정규화 매개변수를 양자화하여 상당한 메모리 압축을 달성하고 마이크로컨트롤러에서의 효율적인 온디바이스 배포를 가능하게 하면서도 경쟁력 있는 ImageNet-1K 정확도를 유지하는 완전 3 진화된 비전 트랜스포머인 FTerViT 를 소개합니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신에게 그림을 보고 그것이 정확히 무엇인지 알려줄 수 있는 천재적이고 고학력인 사서 (비전 트랜스포머 또는 ViT) 가 있다고 상상해 보세요. 이 사서는 매우 똑똑하지만, 머릿속에 거대한 도서관의 책들을 가득 지니고 있습니다. 만약 이 사서를 스마트워치나 저렴한 카메라에 들어 있는 것과 같은 마이크로컨트롤러 같은 작은 배낭에 넣으려 한다면, 책들이 너무 무겁고 공간을 너무 많이 차지하기 때문에 배낭이 찢어질 것입니다.
보통, 작은 장치에 똑똑한 AI 를 넣기 위해 엔지니어들은 책들을 줄이려고 노력합니다. 그들은 텍스트를 더 짧은 코드로 변환할 수도 있지만, 종종 가장 중요하고 섬세한 페이지들 (표지, 색인, 최종 요약과 같은 것들) 은 원래의 무거운 형식 그대로 남겨둡니다. 이 논문은 이것이 책의 중간 장들만 줄여서 무거운 백과사전을 주머니에 넣으려 하는 것과 같다고 주장합니다. 표지와 색인은 여전히 너무 무겁기 때문입니다.
다음은 FTerViT의 저자들이 문제를 해결하기 위해 한 일들입니다:
1. "세 가지 색상" 사전
복잡한 숫자 (3.14159... 와 같은) 를 사용하여 정보를 저장하는 대신, 저자들은 AI 가 오직 세 가지 간단한 기호인 -1, 0, +1만 사용하도록 강요했습니다.
- 이는 모든 단어가 빨간색, 초록색, 파란색 점으로 대체되는 사전과 같습니다.
- 이 세 가지 옵션만 사용함으로써 정보를 놀라울 정도로 빽빽하게 압축할 수 있습니다. 거대한 지도를 작은 정사각형으로 접는 것과 같습니다.
- 그들은 이를 3 진법 (Ternary)(즉, '세 개'를 의미함) 이라고 부릅니다.
2. "취약한" 부분
이전에는 이러한 AI 모델을 줄이려는 시도들이 미흡했습니다. 그들은 주된 뇌 (인코더) 는 줄였지만, 패치 임베딩(AI 가 이미지를 처음 보는 방식), 레이어 정규화(LayerNorm, AI 가 생각을 어떻게 균형 있게 유지하는지), 그리고 분류기(최종 결정자) 는 무거운 전체 크기의 형식 그대로 남겨두었습니다.
- 저자들은 작은 장치에서 이러한 '남아있는' 무거운 부분들이 실제로 숫자는 적지만 가장 많은 공간을 차지한다는 것을 깨달았습니다.
- FTerViT는 이러한 취약한 부분들을 포함하여 모든 것을 -1, 0, +1 형식으로 줄인 최초의 모델입니다.
3. "멘토와 학생" 트릭
거대한 뇌를 작은 뇌로 줄이면 보통 생각하는 법을 잊게 되어 어리석은 실수를 하게 됩니다. 이를 해결하기 위해 저자들은 **지식 증류 (Knowledge Distillation)**라는 기법을 사용했습니다.
- 원래의 무거운 AI 인 마스터 셰프가 작은 줄어든 AI 인 주니어 셰프에게 요리법을 가르치는 상황을 상상해 보세요.
- 마스터 셰프가 주니어 셰프에게 "이것은 고양이입니다"라고 단순히 말하는 대신, 그들이 고양이를 어떻게 보는지 보여줍니다. "귀, 수염, 모양을 보세요."
- 주니어 셰프는 최종 답변뿐만 아니라 마스터의 사고 과정을 모방하여 배웁니다. 이를 통해 작은 AI 는 절대적으로 최소 크기로 줄어든 후에도 똑똑함을 유지할 수 있었습니다.
4. 결과: 10 달러 카메라 속의 똑똑한 AI
저자들은 ESP32-S3라는 매우 저렴하고 일반적인 마이크로컨트롤러 칩 (약 10 달러짜리 장치에서 발견됨) 에서 이를 테스트했습니다.
- 전에는: 원래 AI 는 88.3 MB 였습니다. 칩에 들어갈 정도로 너무 컸습니다.
- 이후에는: 그들의 새로운 FTerViT 모델은 단 5.81 MB입니다. 완벽하게 들어갑니다.
- 성능: 비록 작지만 여전히 매우 똑똑합니다. 약 **79.6%**의 확률로 이미지를 정확하게 식별합니다. 이는 종종 74% 이하로 떨어지곤 했던 이전의 AI 축소 시도들보다 훨씬 좋습니다.
5. 왜 이것이 당신의 주머니에 중요한가
이 논문은 똑똑한 비전을 실행하기 위해 슈퍼컴퓨터가 필요하지 않음을 보여줍니다. 8 MB 메모리(작은 텍스트 파일 정도의 크기)를 가진 장치에서 실행할 수 있습니다.
- 속도: 데이터가 매우 작기 때문에 장치는 정보를 가져오기 위해 덜 일합니다. 더 빠르게 실행되고 배터리를 덜 소모합니다.
- 효율성: 저자들은 이 작은 AI 를 인터넷이나 클라우드 서버에 연결할 필요 없이 칩 전체에서 실행하는 맞춤형 "엔진"(소프트웨어) 을 구축했습니다.
요약하자면: 이 논문은 가장 진보된 이미지 인식 AI 모델을 작은 자갈 크기까지 줄이는 방법을 소개하며, 이를 통해 이전에 처리할 수 없었던 값싸고 배터리로 작동하는 장치에서 실행할 수 있게 합니다. 그들은 수학을 세 개의 숫자만으로 단순화하고, 작은 모델이 올바르게 생각하는 법을 가르치는 "멘토"를 사용하여 이를 달성했습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.