Muon: Muon with Fractional Spectral Powers
이 논문은 그래디언트의 특이값(singular values)에 분수 스펙트럼 거듭제곱(fractional spectral powers)을 적용하여 Muon과 경사 하강법(gradient descent) 사이를 보간하고, 효율적인 이변량 재귀(bivariate recurrences)를 활용하여 이러한 업데이트를 근사하며, 가치 있는 특이 스펙트럼 정보를 보존하면서 수십억 규모 모델의 미세 조정(finetuning)에서 향상된 성능을 입증하는 새로운 옵티마이저인 Muon를 소개한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 거대하고 매우 똑똑한 로봇(신경망)에게 말하기, 코드 작성, 또는 수학 문제 풀기를 가르치고 있다고 상상해 보세요. 이 로봇을 가르치기 위해, 당신은 예시를 보여주고 실수를 바로잡아 주어야 합니다. 여기서 "옵티마이저(optimizer)"는 각 실수 후에 로봇의 뇌를 어떻게 조정할지 결정하는 교사의 방법입니다.
문제점: "전부 아니면 전무" 식의 선생님 (Muon)
최근에 Muon이라는 유명한 교수법이 화제가 되었습니다. 이것은 다음과 같이 작동합니다:
로봇의 실수들은 서로 다른 "방향"이나 "주파수"를 가지고 있다고 상상해 보세요. 어떤 방향은 매우 크고 명확한 반면(지배적 모드), 어떤 방향은 아주 작은 속삭임과 같습니다(작은 특이값).
- 기존의 선생님들(표준 경사 하강법 같은 방식)은 큰 소리가 나는 방향에는 크게 소리치며 교정하지만, 작은 속삭임은 무시하곤 했습니다.
- Muon은 "평평한(flat)" 선생님이 되기로 결정했습니다. 그것은 모든 방향을 살펴보고 이렇게 말했습니다. "자, 이 모든 방향을 똑같이 취급하자!" 그리고 모든 교정의 볼륨을 평평하게 만들어, 작은 속삭임도 큰 외침과 똑같은 주의를 기울이게 했습니다.
함정: 이것은 로봇을 처음부터 가르칠 때(사전 학습, pretraining)는 훌륭하지만, 한 가지 중요한 정보를 버리게 됩니다. 바로 각 방향이 실제로 얼마나 강한가 하는 정보입니다. 때로는 그 큰 소리가 나는 방향들이 정말 중요한 것일 수도 있는데, 단순히 속삭임을 듣기 위해 사이렌 소리의 볼륨을 줄여버리는 것은 문제가 될 수 있습니다.
해결책: "딱 적당한" 선생님 (Muonp)
이 논문의 저자들은 Muonp를 소개했습니다. Muonp를 "골디락스(Goldilocks)" 존을 찾아내는 선생님이라고 생각하세요.
모든 볼륨을 완전히 평평하게 만드는 대신(Muon처럼), 혹은 원래의 크기를 그대로 유지하는 대신(기존 선생님들처럼), Muonp는 볼륨을 아주 조금만 낮춥니다. 그것은 수학적인 "디머 스위치(dimmer switch, 밝기 조절 스위치)"(p라고 불리는 숫자)를 사용하여, 큰 소리가 나는 방향의 원래 강도를 어느 정도 유지하면서도 작은 소리들을 끌어올려 줍니다.
- 만약 p = 0 이라면: 원래의 Muon입니다 (완전한 평탄화).
- 만 if p = 1 이라면: 표준적인 선생님입니다 (변화 없음).
- 만약 p가 그 사이의 값(예: 1/3)이라면: 이것이 바로 Muonp입니다. 원래의 형태를 유지하면서도 교정의 내용을 부드럽게 다듬어 줍니다.
어려운 점: 마법 같은 수학적 트릭
당신은 이렇게 생각할 수도 있습니다. "그래, 그냥 볼륨을 조금만 줄이면 되겠네." 하지만 거대한 행렬(로봇의 뇌)의 세계에서 이 계산을 수행하는 것은 매우 어렵습니다. 보통 이 방향들의 볼륨을 조절하려면, 뇌를 해체하고, 모든 부분을 측정하고, 다시 조립해야 합니다. 이는 느리고 비용이 많이 드는 작업입니다.
저자들은 이 "볼륨 조절"을 단순한 한 단계 레시피로는 할 수 없다는 것을 증ato했습니다. 원래의 뇌 구조를 기억하면서 볼륨을 조절하기 위해서는 더 복잡한 두 단계 레시피가 필요합니다.
그들은 컴퓨터가 이미 갖추고 있는 빠른 수학 칩(GPU)을 사용하여 이 "조절된" 교정값을 계산할 수 있는 새롭고 빠른 레시피("이변량 다항식 재귀(bivariate polynomial recurrences)"라고 불리는 것)를 발명했습니다. 이 마법 같은 지름길 덕분에 Muonp는 Muon만큼 빠르면서도 더 똑똑합니다.
발견한 사실: 직업에 따라 다르다
논문 저자들은 이 새로운 선생님을 십억 단위 규모의 모델에 테스트하여 흥미로운 성능 차이를 발견했습니다:
새로운 뇌를 만들 때 (사전 학습, Pretraining):
만약 로봇을 처음부터 가르치고 있다면, "평평한" 선생님(Muon)이 실제로 더 낫습니다. 기초를 탄탄히 쌓기 위해서는 가능한 모든 방향을 똑같이 탐색해야 하기 때문입니다. 기존의 "큰" 방향들을 붙잡고 있으려 하는 Muonp는 이 단계에서는 약간 성능이 떨어졌습니다.전문가를 미세 조정할 때 (미세 조정, Finetuning):
이미 똑똑한 로봇을 데려와서 특정 새로운 기술(예: 코딩이나 수학)을 가르친다면, Muonp가 승자입니다.- 왜 그럴까요? 이 단계에서 로봇은 이미 기초를 알고 있습니다. "큰 소리"가 나는 방향들이 바로 새로운 과제를 수행하는 데 중요한 데요. Muonp는 이 중요한 방향들에 집중하면서도 작은 소리들을 도와줍니다.
- 결과: 수학적 추론, 코딩, 언어 이해와 같은 과제에서 Muonp는 기존의 Muon이나 표준적인 선생님들보다 로봇을 더 똑똑하고, 빠르고, 정확하게 만들었습니다.
"커리큘럼" 아이디어
저자들은 또한 영리한 트릭을 시도했습니다. 학습의 대부분은 "평평한" 선생님(Muon)을 사용하고, 마지막 몇 단계에서 "디머(dimmer)" 선생님(Muonp)으로 전환하는 것입니다. 이것은 놀라운 효과를 냈습니다. 마치 학생에게 넓은 붓으로 기초를 가르친 다음, 마지막 세부 사항을 다듬을 때는 아주 가는 펜으로 바꾸는 것과 같습니다.
요약
Muonp는 인기 있는 Muon 옵티마이저의 더 똑똑하고 유연한 버전입니다. 이것은 모든 학습 방향을 똑같이 만들지 않고, 대신 그 중요성을 부드럽게 조절합니다.
- 수학: 컴퓨터 속도를 늦추지 않고 이러한 조정을 계산할 수 있는 영리하고 빠른 지름길을 사용합니다.
- 결과: Muonp는 대규모 AI 모델의 **미세 조정(fine-tuning)**을 위한 최고의 도구이며, 코딩이나 수학 같은 특정 기술을 이전보다 더 잘 마스터하도록 돕습니다. 하지만 **처음부터 학습(pretraining)**할 때는 기존의 "평평한" Muon이 여전히 챔피언입니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.