Four Over Six: More Accurate NVFP4 Quantization with Adaptive Block Scaling
본 논문은 NVFP4 양자화에서 큰 값을 더 잘 처리하기 위해 블록 스케일을 동적으로 조정하여 양자화 오차를 줄이고, 최소한의 계산 오버헤드로 BF16 에 가까운 학습 및 추론 성능을 달성하는 적응형 블록 스케일링 기법인 "Four Over Six"(4/6)를 소개합니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
거대한 도서관의 책들을 작은 휴대용 가방에 넣으려 한다고 상상해 보세요. 책들은 대규모 언어 모델 (AI) 의 "두뇌"를 나타내고, 가방은 컴퓨터의 메모리를 나타냅니다. 모든 것을 넣으려면 책들을 줄여야 합니다.
오랫동안 우리는 BF16(표준 고정밀 포맷)이라는 방법을 사용해 왔는데, 이는 책들을 튼튼하지만 무거운 상자에 담는 것과 같습니다. 정확하지만 가방이 금방 차버립니다. 최근 엔지니어들은 훨씬 작은 포맷인 NVFP4로 전환해 보았습니다. NVFP4 를 작고 가벼운 종이접기 상자들의 집합으로 생각하세요. 이 상자들은 가방에 훨씬 더 많은 책을 넣을 수 있게 하고 AI 를 더 빠르게 실행하게 하지만, 한 가지 함정이 있습니다: 상자가 너무 작기 때문에 일부 "큰" 책들이 찌그러지거나 구겨지거나 페이지를 잃게 됩니다. 이러한 "구김"을 양자화 오차라고 하며, 이로 인해 AI 가 실수를 하게 됩니다.
문제: 작은 상자의 "거친 가장자리"
이 논문은 NVFP4 가 특이한 버릇이 있다고 설명합니다. 이 포맷이 수용할 수 있는 특정 크기는 0.5, 1, 1.5, 2, 3, 4, 6 입니다.
- 책의 크기가 정확히 4 라면 완벽하게 들어갑니다.
- 책의 크기가 5 라면 들어가지 않습니다. 크기가 4 인 상자나 크기가 6 인 상자 중 하나로 억지로 넣어야 합니다.
- 크기가 5 인 책을 크기가 4 인 상자에 억지로 넣으면 많은 정보를 잃게 됩니다 (찌그러집니다). 크기가 6 인 상자에 넣으면 많은 공간이 낭비됩니다 (흔들립니다).
저자들은 "찌그러짐"이 가장 큰 상자 (가장 큰 상자) 와 거의 같은 크기의 책들 ("거의 최대" 값) 에서 가장 자주 발생한다고 발견했습니다. 표준 방법에서는 가방이 가능한 절대적으로 가장 큰 책 (크기 6) 을 수용하도록 설계되어 있습니다. 하지만 이로 인해 크기가 5 인 책들이 심하게 찌그러지는 거대한 간격이 생깁니다.
해결책: "4 over 6"(4/6)
저자 잭 쿡 (Jack Cook) 과 그의 팀은 Four Over Six(4/6)라는 영리한 트릭을 고안해냈습니다.
가방에 물건을 넣는다고 상상해 보세요. 모든 단일 항목을 "크기 6" 상자에 억지로 넣는 대신, 각 항목 그룹을 살펴봅니다.
- 옛 방식: 모든 그룹이 "크기 6" 상자가 필요하다고 가정합니다. 그룹에 크기가 5 인 책이 있으면 찌그러뜨립니다.
- 4/6 방식: 그룹을 확인합니다. 해당 그룹에서 가장 큰 책이 크기가 5 라면, "좋아, 이 그룹에는 크기 6 상자가 필요 없군. 대신 크기 4 상자를 사용하자"라고 말합니다.
해당 그룹에 대해 더 작은 "크기 4" 상자로 전환함으로써, "크기 5" 책 (이제 상자 한계와 비교해 상대적으로 더 작아진) 은 훨씬 더 편안하게 들어갑니다. 더 이상 가장자리에 밀려 찌그러지지 않습니다.
비유:
비디오 게임 캐릭터가 점프하는 것과 같습니다.
- 표준 NVFP4: 게임은 캐릭터가 최대 10 피트까지 점프할 수 있다고 가정합니다. 9 피트 점프를 시도하면 게임은 이를 8 피트로 반올림합니다 (큰 하락).
- 4/6 방식: 게임은 특정 레벨을 확인합니다. 가장 높은 플랫폼이 6 피트 높이뿐이라면 "점프 한도"를 6 피트로 변경합니다. 이제 5 피트 점프는 6 피트 (또는 4 피트) 로 훨씬 더 정확하게 반올림됩니다. 캐릭터가 덜 떨어집니다.
실제 작동 방식
이 논문은 데이터를 포장하기 전에 모든 작은 데이터 조각 ( "블록"이라고 함) 을 살펴보는 지능형 알고리즘을 설명합니다:
- 조각을 "크기 6" 상자에 포장하고 얼마나 많은 정보가 손실되는지 계산합니다.
- 동일한 조각을 "크기 4" 상자에 포장하고 손실을 계산합니다.
- 손상이 적은(오차가 적은) 상자를 선택합니다.
일반적으로 매우 큰 숫자가 포함된 조각의 경우, "크기 4" 상자가 승리합니다. 이는 "거의 최대" 숫자들이 더 잘 들어맞게 만들기 때문입니다.
결과
이 팀은 Nemotron 3 Nano(300 억 개 파라미터) 라는 거대한 AI 모델을 테스트했습니다.
- 학습: 4/6 을 사용하여 AI 를 학습시켰을 때, AI 는 표준 NVFP4 방법보다 더 잘 학습하고 실수를 줄였습니다. 무겁고 느린 "BF16" 방법의 성능에 훨씬 더 가까워졌지만, NVFP4 의 속도와 크기 장점은 유지했습니다.
- 속도: 이 "지능형 포장"이 컴퓨터 속도를 늦추지 않는다는 것을 보여주었습니다. 약 15% 미만의 추가 작업만 필요하며, 이는 훨씬 더 나은 정확도를 위한 아주 작은 대가입니다.
- 기존 모델: 이미 학습된 모델 (Llama 및 Qwen 등) 에도 이를 적용해 보았습니다. 재학습 없이도 4/6 을 사용하면 읽기 이해력 및 논리 퍼즐과 같은 테스트에서 이러한 모델들이 더 똑똑하고 정확해졌습니다.
결론
이 논문은 단순히 어떤 데이터 그룹에 어떤 상자 크기를 사용할지 더 똑똑하게 결정함으로써—때로는 "6" 대신 "4"를 사용함으로써—중요한 정보의 "찌그러짐"을 막을 수 있다고 주장합니다. 이는 저정밀도 AI(NVFP4) 를 훨씬 더 정확하게 만들어, 현재의 하드웨어에서 두뇌 능력을 잃지 않고 더 크고 빠른 AI 모델을 실행할 수 있게 합니다.
그들은 심지어 코드 (커널) 를 공개하여 다른 사람들이 NVIDIA 의 최신 Blackwell GPU 에서 이 "지능형 포장" 방법을 사용할 수 있도록 했습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.