Delving into Muon and Beyond: Deep Analysis and Extensions
이 논문은 통합된 스펙트럼 관점을 통해 Muon 옵티마이저를 분석하며, 일련의 스펙트럼 변환과 효율적인 결합 뉴턴 반복법을 도입하여 Muon이 효과적인 스펙트럼 정규화 방법으로 작용하지만 Adam보다 일관되게 우수한 성능을 보이는 것은 아니며, 1차 모멘트 업데이트보다는 RMS 정규화된 업데이트에 적용될 때 가장 안정적임을 입증한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 거대하고 복잡한 로봇(신경망)에게 인간의 언어를 말하는 법을 가르치려 한다고 상상해 보세요. 이를 위해 당신은 로봇의 두뇌 속에 있는 수백만 개의 아주 작은 조절 나사(파라미터)를 조절해야 합니다. 이때 '옵티마이저(optimizer)'는 매 레슨이 끝날 때마다 각 나사를 얼마나 돌릴지 결정하는 선생님 역할을 합니다.
오랫동안 최고의 선생님은 Adam이었습니다. Adam은 똑똑합니다. 로봇의 실수를 경청하고, 과거의 실수를 기억하며(모멘텀), 각 나사의 볼륨을 개별적으로 조절하여(정규화) 어떻게 조절할지 결정합니다. 이는 마치 각 버튼을 얼마나 세게 눌러야 할지 정확히 아는 선생님과 같습니다.
최근에는 Muon이라는 새로운 선생님이 매우 인기를 얻었습니다. Muon은 다릅니다. Muon은 나사를 개별적으로 조정하는 대신, 격자 형태로 배열된 나사 그룹(행렬)을 바라보며 그들이 완벽하게 균형 잡힌 '직교(orthogonal)' 방식으로 움직이도록 강제합니다. 이는 마치 무용 교사가 개별 무용수의 움직임이 크든 작든 상관없이, 전체 무용수 줄이 완벽한 조화를 이루며 움직이도록 지시하는 것과 같습니다.
이 논문은 질문합니다: Muôn이 실제로 Adam보다 더 나은 것일까요, 아니면 그저 다른 스타일의 춤을 추는 것뿐일까요?
핵심 아이디어: "스펙트럼 패밀리(The Spectral Family)"
저자들은 Muon이 단순히 일회성 기술이 아니라는 것을 깨달았습니다. 그들은 Muon이 사실 하나의 거대한 방법론적 가족의 극단적인 끝단이라는 것을 발견했습니다. 로봇의 두뇌 속 서로 다른 방향들의 중요성을 얼마나 "평탄하게(flatten)" 만들지를 제어하는 슬라이더가 있다고 상상해 보세요.
- 슬라이더 1.0 (표준): 특별한 조치를 취하지 않습니다. 이는 표준 Adam이나 모멘텀과 같습니다. 모든 방향의 원래 "크기(loudness)"를 그대로 유지합니다.
- 슬라이더 0.5 또는 0.25 (중간 단계): 차이점을 부드럽게 완화합니다. 큰 오차는 조금 낮추고, 작은 오차는 약간 높여줍니다.
- 슬라이더 0.0 (Muon): 모든 것을 완전히 평평하게 만듭니다. 당신은 로봇에게 이렇게 말합니다. "어떤 방향이 크든 작든 상관없어. 모든 방향을 똑같이 중요하게 취급해." 이것이 Muon의 핵심 동작인 **직교화(Orthogonalization)**입니다.
이를 테스트하기 위해 저자들은 (Coupled Newton-Schulz라는 영리한 수학적 트릭을 사용하는) 초고속 계산기를 구축했습니다. 이를 통해 거대한 컴퓨터에서 느리고 불가능한 수학 계산을 수행할 필요 없이 다양한 슬라이더 설정을 실험할 수 있었습니다.
실험: 통제된 경주
저자들은 매우 공정한 경주를 설정했습니다. 그들은 8가지 버전의 선생님들을 사용하여 작은 언어 모델("nanoGPT")을 훈련시켰습니다.
- Muon과 함께 사용되는 다른 논문들이 사용했던 모든 "치트 코드"(특수한 안정화 장치 등)를 껐습니다.
- 모든 선생님이 동일한 시간과 자원을 할당받도록 했습니다.
- 두 가지 유형의 입력을 테스트했습니다. 하나는 선생님이 단순히 원시 모멘텀(단순한 밀기)만을 보는 경우이고, 다른 하나는 선생님이 먼저 노이즈를 정규화(Adam이 하는 방식)하는 경우입니다.
결과: 그들이 발견한 것
1. Muon은 슈퍼 옵티마이저가 아니라 안정화 도구입니다
선생님이 단순히 원시 모멘텀(단순한 밀기)을 사용하는 경우, Muon은 놀라운 성능을 보입니다. 로봇이 미쳐서 낭떠러지로 떨어지는 것을 막아줍니다. 즉, 훈련을 매우 안정적으로 만듭니다.
- 비유: 만약 당신이 손 위에 빗자루를 세우려고 한다면, Muon은 빗자루를 완벽하게 곧게 잡아주는 단단한 클램프와 같습니다. 빗자루가 흔들리지 않게는 해주지만, 반드시 당신이 더 빨리 걷도록 도와주는 것은 아닙니다.
2. 여전히 Adam이 경주에서 승리합니다
하지만 선생님이 이미 스마트한 "노이즈 제거" 작업(Adam이 하는 방식)을 하고 있다면, Muon은 승리하지 못합니다. 실제로 표준 Adam(또는 그 변형)이 비슷하거나 더 나은 성능을 보였습니다.
- 비유: 만약 당신이 이미 빗자루를 안정적으로 유지해 주는 고성능 자이로스코프(Adam)를 가지고 있다면, 여기에 Muon이라는 단단한 클램프를 추가한다고 해서 더 빨리 걸을 수는 없습니다. 때로는 작은 흔들림을 거대한 추락과 똑같이 취급하게 만들기 때문에 오히려 발을 헛디디게 만들 수도 있습니다.
3. "평탄화(Flattening)"의 문제점
저자들은 모든 것을 똑같이 만드는 Muon의 핵심 기술에 단점이 있다는 것을 발견했습니다.
- 장점: 거대하고 위험한 오차가 훈련을 지배하는 것을 막아줍니다.
- 단점: 작지만 유용한 신호조차 무시되지 않도록 막아버립니다. 특정 방향에 작지만 중요한 신호가 있더라도, Muon은 이를 노이즈 섞인 쓸모없는 방향과 똑같이 취급합니다.
- 비유: 라디오를 상상해 보세요. Adam은 잡음을 줄이고 음악 소리를 키웁니다. 반면 Muon은 모든 채널의 볼륨 노브를 정확히 같은 수준으로 맞춥니다. 만약 한 채널에서는 희미하지만 아름다운 노래가 나오고 있고, 다른 채널에서는 그냥 잡음만 들린다면, Muon은 두 채널을 똑같이 크게 만들어 노래를 잡음 속에 파묻어 버립니다.
결론
이 논문은 Muon이 특히 초기 단계나 단순한 방법을 사용할 때 강력한 안정화 도구라고 결론짓습니다. 이는 훈련이 무너지지 않도록 방지하는 안전벨트 역할을 합니다.
하지만 Muon은 Adam을 대체할 마법의 탄환이 아닙니다. 이미 Adam과 같은 스마트한 옵티마이저를 사용하고 있다면, 모든 것을 평평하게 만드는 것(p=0)이 더 빠른 학습을 보장하지 않습니다. 실제로 모든 것을 완전히 평평하게 만드는 것(p=0)보다, 스펙트럼을 약간만 완화하는 "중간 단계"(p=1/4와 같은 방식)가 더 효과적일 때가 있습니다.
요약하자면: Muon은 훌륭한 안전벨트이지만, 더 나은 엔진은 아닙니다. 만약 당신에게 이미 좋은 엔진(Adam)이 있다면, 더 빨리 가기 위해 도로를 평평하게 깎을 필요는 없습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.