이 논문은 NVFP4 의 한계를 극복하기 위해 입력값 분포에 따라 FP4 와 INT4 를 동적으로 선택하는 적응형 블록 스케일 데이터 타입 (IF4) 을 제안하고, 이를 통해 양자화 훈련 손실 감소와 후처리 양자화 정확도 향상을 입증하며 효율적인 하드웨어 구현 가능성도 검증했습니다.
원저자:Jack Cook, Hyemin S. Lee, Kathryn Le, Junxian Guo, Giovanni Traverso, Anantha P. Chandrakasan, Song Han
최근 AI(거대 언어 모델) 는 엄청나게 커졌습니다. 이 AI 를 돌리려면 막대한 메모리와 계산 능력이 필요하죠. 그래서 연구자들은 숫자의 정밀도를 낮추는 '양자화 (Quantization)' 기술을 썼습니다.
비유: 원래는 100 점 만점의 정밀한 점수 (고정밀도) 로 학생을 평가했는데, 메모리 부족으로 **4 점 만점 (4 비트)**으로 점수를 매기려고 한 거예요.
문제점: 4 점 만점으로는 표현할 수 있는 숫자가 16 개뿐이라, 숫자가 너무 크거나 작으면 오차가 생깁니다. 특히 NVFP4라는 기존 방식은 "큰 숫자"를 표현할 때 오차가 너무 커서 AI 가 엉뚱한 대답을 할 위험이 있었습니다.
2. 기존 방식의 한계: "하나의 크기로 모든 것을 재다"
기존 방식 (NVFP4) 은 16 개의 숫자 묶음 (그룹) 에 대해 **하나의 자 (Scale Factor)**만 사용합니다.
비유: 16 명의 학생을 한 반으로 묶고, **한 자 (자)**로 모두 키를 재는 상황입니다.
키가 작은 아이들 (소수) 은 자의 눈금을 잘 맞춥니다.
하지만 키가 매우 큰 아이 (큰 값) 가 있으면, 자의 끝부분을 넘어서서 오차가 엄청나게 커집니다.
연구자들은 "큰 숫자 그룹은 자를 바꿔서 재야 한다"는 아이디어 (Four Over Six) 를 시도했지만, 자를 바꾸는 과정에서 다른 숫자들을 희생하거나 자의 범위를 줄여야 하는 문제가 생겼습니다.
3. 새로운 해결책: IF4 (적응형 블록 스케일 데이터 타입)
이 논문이 제안한 IF4는 **"상황에 따라 자를 바꿔 쓰는 똑똑한 방식"**입니다.
핵심 아이디어: 16 개의 숫자 묶음 (그룹) 을 볼 때, 그 숫자들이 어떤 모양인지 먼저 확인합니다.
상황 A (숫자가 고르게 퍼져 있을 때):정수 (INT4) 방식으로 재는 게 오차가 적습니다. (비유: 키가 비슷한 아이들끼리 모여 있으면, 정수 눈금으로 재는 게 편함)
상황 B (한두 명만 크고 나머지는 작을 때):부동소수점 (FP4) 방식으로 재는 게 좋습니다. (비유: 키가 큰 아이 한 명과 작은 아이들이 섞여 있으면, 부동소수점 자를 쓰는 게 정확함)
IF4 의 마법: 이 방식은 각 그룹마다 FP4 와 INT4 중 오차가 더 적은 것을 자동으로 선택합니다.
중요한 점: 이 선택을 알리는 신호 (Indicator) 를 기존에 쓰지 않던 **부호 비트 (Sign bit)**에 숨겨서 저장합니다. 따라서 메모리 사용량은 기존과 똑같지만, 정확도는 훨씬 높아집니다.
4. 왜 이것이 중요한가? (실제 효과)
연구팀은 이 IF4 방식을 실제 AI 모델에 적용해 보았습니다.
학습 중 (Training): AI 가 새로운 것을 배울 때, 기존 방식보다 **더 적은 실수 (손실)**를 하며 더 빠르게 학습했습니다.
실제 사용 (Inference): 학습이 끝난 AI 가 문제를 풀 때, 기존 4 비트 방식들보다 더 높은 정확도를 보여주었습니다.
하드웨어 호환성: 이 방식은 기존 AI 칩 (하드웨어) 에서도 거의 추가 비용 없이 구현할 수 있습니다. (비유: 새로운 메뉴판을 만들 때, 주방 설비를 새로 사지 않아도 기존 주방에서 바로 쓸 수 있음)
5. 요약: 한 줄로 정리하면?
"기존의 4 비트 AI 방식은 모든 숫자를 같은 자로 재서 오차가 컸지만, IF4 는 숫자의 모양을 보고 '정수 자'와 '부동소수점 자' 중 더 맞는 것을 골라 재므로, 메모리는 그대로인데 AI 의 실수는 확실히 줄였습니다."
이 기술은 앞으로 AI 가 스마트폰이나 개인용 컴퓨터에서도 더 빠르고 정확하게 작동할 수 있는 길을 열어줄 것으로 기대됩니다.
논문 요약: Adaptive Block-Scaled Data Types (적응형 블록 스케일 데이터 타입)
이 논문은 대규모 언어 모델 (LLM) 의 저정밀도 (4 비트) 양자화 훈련 및 추론을 위한 새로운 데이터 타입인 **IF4 (Int/Float 4)**를 제안합니다. 기존 NVFP4 포맷의 한계를 극복하고, 입력 데이터의 분포에 적응하여 양자화 오차를 최소화하는 방법을 제시합니다.
1. 문제 제기 (Problem)
NVFP4 의 한계: NVIDIA Blackwell 아키텍처 등에서 지원하는 4 비트 부동소수점 포맷인 NVFP4 는 하드웨어 가속과 효율성 면에서 유리하지만, 최근 연구에 따르면 특정 그룹 (16 개 값) 내에서 최대값에 가까운 값들에서 큰 양자화 오차를 발생시킵니다.
기존 해결책의 부족: 'Four Over Six (4/6)'와 같은 적응형 스케일링 기법은 오차를 줄이지만, 최대값을 4 로 제한함으로써 사용 가능한 FP4 값의 수를 줄이고 (6 과 -6 을 포기), 텐서의 동적 범위 (Dynamic Range) 를 감소시키는 단점이 있습니다.
W4A4G4 훈련의 어려움: 가중치, 활성화, 기울기 모두를 4 비트로 양자화하는 (W4A4G4) 훈련은 매우 민감하며, 기존 포맷만으로는 고정밀도 훈련과 동등한 성능을 내기 어렵습니다.
2. 방법론 (Methodology)
저자들은 입력 값의 분포에 따라 **FP4(부동소수점)**와 Scaled INT4(정수) 중 더 적합한 표현 방식을 선택하는 적응형 블록 스케일 데이터 타입을 설계했습니다.
IF4 (Int/Float 4) 구조:
NVFP4 와 마찬가지로 16 개 값의 그룹 (Block) 당 하나의 FP8(E4M3) 스케일 팩터를 공유합니다.
핵심 아이디어: 각 그룹의 16 개 값이 FP4 로 표현될 때와 Scaled INT4 로 표현될 때의 **평균 제곱 오차 (MSE)**를 계산하여 오차가 적은 방식을 선택합니다.
표기 방식: NVFP4 에서 사용되지 않는 스케일 팩터의 **부호 비트 (Sign bit)**를 재사용하여 'Indicator'로 활용합니다.
Indicator = 0: 그룹의 값은 FP4 로 저장됨.
Indicator = 1: 그룹의 값은 Scaled INT4 로 저장됨.
6/7 방법 (6/7 Method): INT4 를 선택한 그룹은 양자화 전 7/6배 스케일링을, 역양자화 (De-quantization) 시 6/7배를 적용합니다. 이를 통해 FP4 의 최대값 (6) 과 INT4 의 최대값 (7) 을 동일한 범위 (0~6) 로 맞춰주어 동적 범위 손실을 방지합니다.
확장성: 이 아이디어는 4 비트뿐만 아니라 3 비트 (IF3) 와 6 비트 (IF6) 포맷에도 적용 가능합니다.
3. 주요 기여 (Key Contributions)
새로운 데이터 타입 제안: 메모리 오버헤드 없이 기존 NVFP4 와 호환되는 IF4 포맷을 제안했습니다.
하드웨어 효율성: IF4 를 위한 Multiply-Accumulate (MAC) 유닛을 SystemVerilog 로 설계하고 28nm CMOS 공정에 합성하여, 기존 NVFP4 대비 지연 시간 (Latency) 증가가 불과 4.7% 에 불과함을 입증했습니다.
성능 개선: 적응형 선택 메커니즘을 통해 다양한 입력 분포 (Hadamard 변환 후의 균일한 분포 포함) 에서 기존 4 비트 포맷보다 낮은 양자화 오차를 달성했습니다.
4. 실험 결과 (Results)
양자화 훈련 (W4A4G4):
IF4 를 사용한 훈련은 NVFP4 대비 **더 낮은 훈련 손실 (Training Loss)**을 기록했습니다.
특히, 역전파 시 Hadamard 변환을 적용한 MS-EDEN 기법과 결합 시 NVFP4 대비 성능 격차가 더욱 커졌습니다. 이는 Hadamard 변환 후의 균일한 데이터 분포에서 INT4 표현이 더 유리하기 때문입니다.
사후 양자화 (PTQ):
Qwen3.5 및 Nemotron 3 Nano 등 다양한 모델 크기에 대해 WikiText-2 및 C4 Perplexity를 측정했습니다.
IF4 는 NVFP4, NVINT4, 4/6 등 기존 모든 4 비트 양자화 기법보다 Perplexity 가 낮았으며, 하위 작업 (ARC, HellaSwag 등) 에서도 높은 정확도를 보였습니다.
하드웨어 성능:
IF4 MAC 유닛은 NVFP4 대비 면적 (Area) 은 66.6% 증가하고 전력은 27.8% 증가했으나, 이는 단일 MAC 단위 기준이며 실제 GPU 시스템에서는 메모리 대역폭이 병목이므로 전체 시스템 성능에 미치는 영향은 미미할 것으로 분석되었습니다.
5. 의의 및 결론 (Significance)
저정밀도 훈련의 실용화: 4 비트 양자화 훈련 (W4A4G4) 이 고정밀도 (BF16) 훈련과 유사한 성능을 낼 수 있는 가능성을 보여주었습니다.
하드웨어 친화적 설계: 추가적인 메모리 오버헤드 없이 기존 NVFP4 하드웨어 아키텍처를 기반으로 효율적으로 구현 가능함을 입증했습니다.
미래 지향성: 적응형 블록 스케일링 개념은 3 비트, 6 비트 등 다양한 비트 폭과 블록 크기에 적용 가능하며, 메모리 제약이 심한 환경에서 모델 성능을 극대화하는 새로운 패러다임을 제시합니다.
결론적으로, 이 논문은 IF4를 통해 4 비트 양자화의 정확도 한계를 극복하고, 차세대 AI 가속기에서 효율적으로 작동할 수 있는 실용적인 솔루션을 제시했습니다.