← 최신 논문
🤖 machine learning

Pretraining large language models with MXFP4

본 논문은 대규모 언어 모델의 전체 파이프라인 FP4 학습에서 가중치 기울기 (Wgrad) 의 양자화가 불안정성의 주된 원인임을 규명하고, 확률적 반올림이 아닌 결정론적 하다마드 회전이 수렴 안정성을 회복하는 데 필수적임을 입증합니다.

원저자: Musa Cim, Poovaiah Palangappa, Miro Hodak, Ravi Dwivedula, Meena Arunachalam, Mahmut Taylan Kandemir

게시일 2026-05-12
📖 3 분 읽기☕ 가벼운 읽기

원저자: Musa Cim, Poovaiah Palangappa, Miro Hodak, Ravi Dwivedula, Meena Arunachalam, Mahmut Taylan Kandemir

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

거대하고 뛰어난 학생 (대형 언어 모델) 에게 이야기 쓰기를 가르치려 한다고 상상해 보세요. 보통 이 학생이 효과적으로 학습하도록 유지하기 위해, 고품질의 상세한 잉크로 작성된 메모 (FP8 정밀도라고 함) 를 제공합니다. 이는 잘 작동하지만, 메모가 무거워 학생의 책가방을 많이 차지하고 읽는 속도를 늦춥니다.

연구자들은 4 비트 정보만으로 작성된 초경량 메모 (MXFP4) 로 전환할 수 있는지 확인하고 싶어 했습니다. 이 메모들은 작고 빨라 학생이 훨씬 더 빠르게 학습할 수 있을 것이라고 약속했습니다. 그러나 함정이 있었습니다: 이 작은 메모를 학습 과정 전체에 적용하려 했을 때, 학생은 종종 혼란을 겪고 터무니없는 추측을 하기 시작하며 아무것도 배우지 못했습니다 (학습이 '발산'했습니다).

이 논문은 묻습니다: 왜 이런 일이 일어나며, 어떻게 해결할 수 있을까요?

실험: 3 단계 테스트

연구자들은 문제가 정확히 어디에 있는지 파악하기 위해 통제된 실험을 설계했습니다. 그들은 학습 과정을 세 단계로 나누고, 한 단계씩 무거운 메모를 가벼운 메모로 천천히 교체했습니다:

  1. 순전파 (Forward Pass, Fprop): 학생이 질문을 읽습니다.
  2. 활성화 기울기 (Activation Gradients, Dgrad): 학생이 질문을 얼마나 오해했는지 파악합니다.
  3. 가중치 기울기 (Weight Gradients, Wgrad): 학생은 다음을 위해 교훈을 기억하도록 뇌 (가중치) 를 업데이트합니다.

결과:

  • 1 단계 및 2 단계: 읽기와 오해 파악에만 가벼운 메모를 사용했을 때, 학생은 잘 수행했습니다. 무거운 메모를 사용할 때와 거의 비슷하게 학습했으며, 단지 몇 가지 추가 연습 문제가 필요했을 뿐입니다.
  • 3 단계 (문제): 뇌를 업데이트 (Wgrad) 하는 단계로 가벼운 메모를 전환하는 순간, 학생은 통제 불능 상태로 빠져들기 시작했습니다. 연구자들은 이 특정 단계가 '약한 고리'임을 발견했습니다. 이는 마치 작은 구겨진 종이에 복잡한 수학 교정을 쓰려는 것과 같습니다; 세부 사항이 손실되고 학생은 잘못된 교훈을 배우게 됩니다.

실패한 해결책: 무작위성 추가

학생이 실패하기 시작하자, 연구자들은 흔한 트릭을 시도했습니다: 확률성 (Stochasticity, 무작위성 추가).

  • 비유: 학생이 혼란스러우니, "무작위로 추측해 봐!" 또는 "정답을 결정하기 위해 휠을 돌려봐!"라고 말한다고 상상해 보세요.
  • 결과: 이는 작동하지 않았습니다. 오히려 작은 메모에 무작위성을 추가하면 오류가 더 악화되었습니다. 무작위 추측의 '잡음'이 가벼운 메모에 이미 존재하던 작은 오류들을 증폭시켜 학습을 완전히 붕괴시켰습니다.

승리한 해결책: 결정론적 셔플

연구자들은 그다음 다른 접근법을 시도했습니다: 결정론적 하다마드 회전 (Deterministic Hadamard Rotations).

  • 비유: 무작위로 추측하는 대신, 학생이 작은 메모를 기록하기 전에 완벽하게 재배열하는 특수하고 단단한 자를 가지고 있다고 상상해 보세요. 이 자는 무작위성을 추가하지 않습니다. 대신 작은 메모가 구겨지거나 손실되지 않도록 정보를 특정한 예측 가능한 방식으로 단순히 조직화합니다.
  • 결과: 이는 완벽하게 작동했습니다. 이 특정한 예측 가능한 '재배열' 방법을 사용함으로써, 학생은 혼란을 겪지 않고 전체 과정 (읽기, 분석, 업데이트) 에 작은 빠른 메모를 사용할 수 있었습니다.

결론

이 논문은 두 가지 주요 교훈으로 결론을 내립니다:

  1. 병목 현상: 4 비트 학습이 실패하는 주된 이유는 메모가 일반적으로 너무 작기 때문이 아니라, 구체적으로 뇌 업데이트 단계 (Wgrad) 가 해당 메모의 작은 오류에 너무 민감하기 때문입니다.
  2. 해결책: 4 비트 학습을 작동하게 하려면 더 많은 무작위성을 추가할 필요가 없습니다. 구조가 필요합니다. 특정한 예측 가능한 수학적 셔플 (하다마드 회전) 을 사용함으로써 과정을 안정화할 수 있습니다.

성과:
이 '재배열 자'로 문제를 해결했을 때, 시스템은 학습의 각 단계에서 20% 더 빨라졌습니다. 학생이 추가 연습 문제 없이 안정적으로 학습했기 때문에, 전체 과정은 오래된 무거운 잉크 방식에 비해 시작부터 끝까지 약 10% 더 빠르게 완료되었습니다.

간단히 말해: 기록하기 전에 완벽하게 조직화하기만 한다면 초고속의 작은 메모를 사용할 수 있습니다. 단순히 무작위성을 섞어 넣는다면 모든 것이 망가집니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →