← 최신 논문
🤖 machine learning

M+Adam: Low-Precision Training via Additive-Multiplicative Optimization

이 논문은 저정밀도 학습의 상호 보완적인 실패 모드를 극복하기 위해 가법적(additive) 및 승법적(multiplicative) 업데이트를 결합한 새로운 옵티마이저인 M+Adam을 제안하며, 이를 통해 오직 BF16, FP8, 그리고 FP4 마스터 가중치만을 사용하여 LLaMA 스타일 모델의 안정적이고 정확한 학습을 가능하게 한다.

원저자: Xiaoyuan Liang, Sebastian Loeschcke, Mads Toftrup, Anima Anandkumar

게시일 2026-07-14
📖 4 분 읽기☕ 가벼운 읽기

원저자: Xiaoyuan Liang, Sebastian Loeschcke, Mads Toftrup, Anima Anandkumar

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 거대하고 초지능적인 로봇(대규모 언어 모델)에게 인간처럼 쓰는 법을 가르치려 한다고 상상해 보세요. 이를 위해 당신은 로봇의 뇌에 있는 수백만 개의 아주 작은 다이얼을 조절해야 합니다. 보통 이 다이얼들은 현미경을 사용하여 나사를 돌리는 것처럼 극도로 정밀하게 조정됩니다. 하지만 현미경은 무겁고, 느리고, 비쌉니다.

이 논문은 이렇게 묻습니다: 만약 우리가 저렴하고 가벼운 렌치를 사용한다면 어떨까?

이것이 바로 **저정밀도 훈련(low-precision training)**의 세계입니다. 연구자들은 고정밀 "마스터 가중치"(다이얼을 조절하는 로봇의 기억)를 사용하는 대신, BF16, FP8, 또는 심지어 FP4와 같은 더 작고 거친 형식으로 저장하려고 시도합니다. 이것은 마치 10피트 간격으로 눈금이 매겨진 자를 사용하여 산의 높이를 측정하는 것과 같습니다.

문제점: "반올림"의 함정

저자들은 이러한 거친 자를 사용할 때, 표준 훈련 방식(Adam)이 한계에 부착한다는 사실을 발견했습니다. 그 이유는 다음과 같습니다.

  1. 거대한 산 문제: 다이얼이 매우 큰 숫자로 설정되어 있으면, "자"의 눈금 간격이 매우 넓어집니다. 만약 로봇이 다이얼을 아주 미세하게 움직여야 한다면, 자는 그것을 감지할 수 없습니다. 미세한 움직임은 반올림되어 0이 되어버리고, 로봇은 "아무것도 움직이지 않았어!"라고 생각하게 됩니다. 로봇은 산을 오르지 못한 채 갇혀버립니다.
  2. 제로 계곡 문제: 다른 방법들은 이를 해결하기 위해 곱셈 업데이트(예: Madam)를 시도했습니다. 숫자를 더하는 대신, 다이얼에 특정 인수를 곱하는 방식입니다. 이 방식은 큰 산을 다룰 때 매우 효과적입니다. 다이얼의 크기에 따라 단계 크기가 커지기 때문입니다. 하지만, 만약 다이얼이 정확히 0에 멈춰 있다면, 곱셈을 통해서는 움직이게 만들 수 없습니다. 이는 바퀴가 없는 자동차를 밀려는 것과 같습니다. 0에 무엇을 곱해도 여전히 0이기 때문입니다. 또한, 다이얼이 양수에서 음수로 바뀌어야 할 때(0을 가로지를 때), 이 방식들은 혼란을 겪으며 전환을 수행하지 못합니다.

해결책: M+Adam (두 가지 도구 세트)

이 논문은 두 가지 서로 다른 도구를 동시에 들고 있는 영리한 정비사처럼 행동하는 새로운 옵티마이저, M+Adam을 소개합니다. 이는 "상호 보완적인 실패 모드"를 해결하기 위해 두 세계의 장점을 결합한 것입니다.

  • 도구 1: 덧셈 렌치 (Adam 방식). 이 도구는 작고 정밀한 조정을 하는 데 탁면합니다. 0에서 다이얼을 움직일 수 있고, 부호를 양수에서 음수로 바꿀 수 있으며, 계곡 바닥 근처에서의 미세한 움직임을 처리할 수 있습니다.
  • 도구 2: 곱셈 레버 (Madam 방식). 이 도구는 크고 무거운 작업을 하는 데 적합합니다. 덧셈 렌치가 "반올림"되어 아무것도 하지 못할 정도로 다이얼이 거대해졌을 때, 곱셈 레버가 작동합니다. 이는 다이얼의 크기를 조절하여, 로봇이 가장 높은 산에서도 계속해서 전진할 수 있도록 보장합니다.

M+Adam은 이 두 도구를 동시에 사용합니다. 덧셈 도구가 반올림 때문에 멈추면 곱셈 도구가 로봇을 계속 움직이게 합니다. 반대로 곱셈 도구가 0에서 탈출하지 못하면 덧셈 도구가 밀어 올립니다.

증명: 효과가 있었는가?

저자들은 단순히 추측만 한 것이 아니라, 대규모로 테스트했습니다.

  • 테스트: 그들은 6000만 개에서 10억 개의 파라미터를 가진 "LLaMA 스타일" 언어 모델을 훈련시켰습니다.
  • 예산: 1배에서 8배의 표준 "Chinchilla" 예산(모델이 보는 데이터의 양을 측정하는 표준 척도)을 사용했습니다.
  • 정밀도: 마스터 가중치로 BF16, FP8, NVFP4를 테스트했습니다.

결과:
모든 테스트에서 M+Adam은 표준 Adam 옵티마이저를 일관되게 이겼습니다.

  • 가장 극단적인 저정밀도 설정(NVFP4)에서, M+Adam은 350M 모델의 "퍼플렉서티"(모델이 얼마나 혼란스러워하는지를 나타내는 척도)를 Adam 대비 16.6% 감소시켰습니다.
  • 10억 개의 파라미터에서도, M+Adam은 모든 정밀도 영역에서 Adam보다 명확한 개선을 보여주었습니다.

논문은 이 결합된 접근 방식이 훈련 손실(loss)이 반드시 감소한다는 것("단조 감소")을 수학적으로 증명하며, 이는 로봇이 항상 학습하고 있으며 루프에 빠져 멈추지 않는다는 것을 의미합니다.

M+Adam이 아닌 것

이 논문이 주장하지 않는 내용을 아는 것도 중요합니다:

  • M+Adam이 메모리 비용을 완전히 없애주는 마법의 탄환이라고 말하는 것이 아닙니다. 실제로 논문은 M+Adam이 (곱셈 도구를 위한) 하나의 추가적인 "상태(state)"를 더 필요로 하여 약간의 추가 메모리를 사용한다고 언급하지만, 이는 나중에 압축될 수 있음을 보여줍니다.
  • 표준적인 확률적 반올림(Stochastic Rounding)(반올림 오차를 해결하는 기술)이 쓸모없다고 주장하는 것이 아닙니다. 그들은 Stochastic Rounding을 적용한 Adam을 테스트했으나, M+Adam이 여전히 더 우수한 성능을 보였습니다.
  • 우리가 고정밀 하드웨어를 사용하는 것을 중단해야 한다고 제안하는 것이 아닙니다. 대신, 만약 우리가 저정밀도 저장을 사용해야만 한다면, M+Adam이 올바른 방법임을 보여줍니다.

핵심 요약

이 논문은 거대한 AI 모델을 훈련하기 위해 "거친" 자(저정밀도 가중치)를 사용해야 할 때, 단 한 가지 유형의 움직임에만 의존해서는 안 된다는 점을 시사합니다. 혼합된 접근 방식이 필요합니다. M+Adam은 바로 그 하이브리드이며, 덧셈 단계와 곱셈 단계를 모두 사용하여 로봇이 거대한 산을 오르든 0의 계곡에서 탈출하든 절대 멈추지 않도록 보장합니다. 이는 우리가 보통 의존하는 무겁고 비싼 고정밀 메모리 없이도 거대 AI 모델을 효율적으로 훈련하기 위한 원칙적인 진전입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →