← 최신 논문
🤖 machine learning

Max-Window Scale Estimation for Near-Lossless HiF8 W8A8 Quantization-Aware Training

본 논문은 max-window 스케일 추정 전략과 BF16 워밍업 일정을 도입하여 HiF8 W8A8 양자화 인식 학습에서 amax 포화 및 치명적 망각이라는 두 가지 고유한 실패 모드를 식별하고 해결함으로써 OpenPangu-Embedded-1B 모델에서 거의 손실 없는 성능을 달성합니다.

원저자: Yingying Cheng, Jinquan Shi, Li Zhou, Zhiyang He, Zhaoyi Sun, Fan Zhang, Jie Sun

게시일 2026-05-27
📖 4 분 읽기☕ 가벼운 읽기

원저자: Yingying Cheng, Jinquan Shi, Li Zhou, Zhiyang He, Zhaoyi Sun, Fan Zhang, Jie Sun

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

상상해 보세요. 수년 동안 방대한 도서관의 책들을 암기해 온 천재적이고 독서량이 풍부한 사서 (AI 모델) 가 있다고 가정해 봅시다. 이제 이 거대한 도서관을 축소하여 도서관 안의 모든 이야기와 사실을 잃지 않은 채 작은 휴대용 배낭 (저전력 장치) 에 들어갈 수 있도록 만들고자 합니다. 이 과정을 **양자화 (Quantization)**라고 합니다.

이 논문은 연구자들이 10 억 개의 매개변수를 가진 AI 모델을 새로운 압축 형식인 HiF8(고정밀 부동소수점 8 비트) 을 사용하여 축소하려는 구체적인 실험을 설명합니다. HiF8 은 나머지 부분을 압축하면서도 가장 중요한 세부 사항을 선명하게 유지하는 '스마트 압축'으로 생각할 수 있습니다.

그러나 연구자들은 단순히 도서관을 축소하는 것만으로는 부족하다는 사실을 발견했습니다. 훈련 과정이 이론상 완벽해 보였음에도 불구하고 모델의 기억력을 망칠 수 있는 두 가지 숨겨진 '함정'이 존재한다는 것을 발견한 것입니다.

다음은 그들의 여정을 쉽게 설명한 내용입니다:

두 가지 숨겨진 함정

1. '맹점' 함정 (Amax 포화)
상상해 보세요. 사서가 책장 위에 책을 정리하려는데, 서랍이 약간 너무 짧은 자를 사용하고 있습니다.

  • 문제: AI 는 압축의 척도를 설정하기 위해 자신이 보는 '가장 큰' 또는 '가장 큰' 숫자를 알아야 합니다. 연구자들은 **지연 텐서 스케일링 (Delayed Tensor Scaling, DTS)**이라는 방법을 사용했습니다. 이는 사서가 이전 책을 보고 현재 책의 크기를 추측하는 것과 같습니다.
  • 실패: 현재 책이 갑자기 거대해지면 (데이터의 '스파이크'), 사서의 추측 (이전 책 기반) 은 너무 작아집니다. 그 결과 책이 책장 가장자리에서 '잘리거나' 잘립니다.
  • 교묘함: AI 의 내부 '성적표'(훈련 손실) 는 이런 일이 발생하고 있음을 보여주지 않았습니다. 마치 사서가 "나는 잘 정리하고 있어!"라고 말하면서 비밀리에 책의 페이지를 찢어내는 것과 같았습니다. 피해는 나중에 사서의 지식을 특정 퀴즈 (ARC 또는 MMLU 등) 로 테스트했을 때만 드러났습니다.

2. '너무 열성적인 학생' 함정 (재앙적 망각)
상상해 보세요. 사서가 새로운 책들에서 새로운 이야기를 배우는 데 너무 열성적이어서 공간을 마련하기 위해 기억 속의 고전들을 지우기 시작합니다.

  • 문제: 연구자들은 모델에 '학습률'(학습 속도) 을 너무 공격적으로 설정하여 가르쳤습니다.
  • 실패: 모델이 새로운 데이터를 너무 빠르게 학습하여 원래 훈련 중에 배운 상식과 사실을 완전히 잊어버렸습니다.
  • 교묘함: 이는 압축 없이도 발생했습니다. 만약 이 높은 속도로 모델을 단순히 정상적으로 훈련시켰더라도 여전히 모든 것을 잊어버렸을 것입니다. 하지만 그들은 모델을 압축하고 있었기 때문에 실패의 원인을 속도가 아닌 압축 탓으로 돌렸습니다.

해결책: 두 가지 부분으로 이루어진 수정

연구자들은 이러한 함정을 어떻게 해결할지 파악하기 위해 여덟 가지 다른 실험을 수행했습니다. 그들은 하나만 수정하는 것만으로는 부족하며, 두 가지를 동시에 수정해야 한다는 사실을 발견했습니다.

수정 #1: '안전망' (최대 윈도우 전략)
'맹점'을 막기 위해 그들은 사서가 책 크기를 추측하는 방식을 변경했습니다.

  • 단순히 이전 책만 보는 대신, 사서에게 지난 64 권의 책 중 가장 큰 책을 보라고 지시했습니다.
  • 이는 '보수적인' 접근 방식입니다. 책장을 엄격하게 필요한 것보다 약간 더 크게 만듭니다 (조금 지나치게 보수적). 하지만 어떤 책도 잘리지 않도록 보장합니다. 이 작은 '추가 공간'은 실제로 모델이 안정적으로 유지되도록 도와주며, 부드러운 정규화제 역할을 합니다.

수정 #2: '냉각' (워밍업과 느린 학습)
'너무 열성적인 학생'을 막기 위해 그들은 훈련 일정을 변경했습니다.

  • 워밍업: 처음 500 단계 동안 모델을 전혀 압축하지 않았습니다. 대신 모델이 전체 고품질 형식 (BF16) 으로 새로운 데이터에 익숙해지도록 했습니다. 이는 '배낭' 압축이 적용되기 전에 모델이 안정적인 상태로 정착할 수 있게 했습니다.
  • 감속: 그들은 학습 속도를 극적으로 늦췄습니다 (학습률 낮춤). 이는 모델이 새로운 데이터로 인해 기존에 가치 있는 지식을 필사적으로 덮어쓰는 것을 방지했습니다.

결과

이 두 가지 수정을 결합했을 때, 결과는 **거의 손실 없음 (near-lossless)**이었습니다.

  • 압축된 모델 (HiF8) 은 압축되지 않은 전체 크기 모델과 거의 정확히 동일한 성능을 발휘했습니다.
  • 어려운 퀴즈에서의 성능 저하는 미미했습니다 (대부분의 경우 0.5% 미만).
  • 결정적으로, 그들은 '안전망'만 사용하고 '너무 열성적인' 속도를 유지하면 모델이 여전히 실패한다는 것을 증명했습니다. 반대로 속도를 늦추더라도 '맹점' 자를 유지하면 실패했습니다. 두 가지 수정 모두 필수적이었습니다.

작동하지 않은 것 (그 이유)

  • 마지막 책만 보기: 책들이 잘리게 되었습니다.
  • 추측을 부드럽게 하기: 과거의 책들을 평균화해 보았지만, 데이터가 예측 불가능하게 변했을 때 실패했습니다.
  • 현재 책을 즉시 확인하기: 이는 데이터를 두 번 확인해야 하므로 너무 느렸고, 책장 크기가 너무 많이 요동쳐 모델을 혼란스럽게 만들었습니다.
  • 고속 훈련: 압축 없이도 이 방식은 모델이 모든 것을 잊게 만들었습니다.

결론

이 논문은 스마트한 AI 모델을 축소할 때, 작동 여부를 확인하기 위해 단순히 '훈련 점수'만 보면 안 된다는 것을 가르쳐 줍니다. 데이터를 측정하는 방식(잘림을 피하기 위해) 과 학습시키는 속도(망각을 피하기 위해) 에 주의해야 합니다. 데이터 크기에 대한 '안전망'과 '천천히 꾸준히'인 학습 속도를 사용하면, 거대한 두뇌를 정신을 잃지 않은 채 작은 배낭에 넣을 수 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →