← 최신 논문
🤖 machine learning

Muown: Row-Norm Control for Muon Optimization

이 논문은 Muon 의 스펙트럼 노름 드리프트를 방지하기 위해 행 크기 벡터를 명시적으로 제어하는 즉시 적용 가능한 옵티마이저인 Muown 을 소개하여, 훈련 안정성을 향상시키고 가중치 감소에 대한 민감도를 낮추며 다양한 모델 규모에서 우수한 퍼플렉시티를 달성합니다.

원저자: Kai Lion, Florian Hübler, Bingcong Li, Antonio Orvieto, Niao He

게시일 2026-05-12
📖 3 분 읽기☕ 가벼운 읽기

원저자: Kai Lion, Florian Hübler, Bingcong Li, Antonio Orvieto, Niao He

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

거인급 디지털 뇌(대규모 언어 모델) 를 훈련시켜 이야기를 쓰거나 수학 문제를 풀거나 대화하게 만든다고 상상해 보세요. 이를 위해 이 뇌는 회로 내부에 있는 수백만 개의 작은 노브(가중치) 를 조정하며 학습해야 합니다.

오랫동안 이러한 노브를 조절하는 가장 좋은 방법은 AdamW라는 방법이었습니다. 최근 Muon이라는 더 빠르고 새로운 방법이 등장했습니다. 이는 자전거에서 스포츠카로 바꾼 것과 같아, 더 빠르고 효과적으로 학습했습니다. 하지만 함정이 있었습니다. 바로 그 스포츠카가 통제 불능 상태로 속도를 내기 쉽다는 점이었습니다.

문제: "이동"하는 엔진

이 논문은 Muon 의 특정 문제를 지적합니다. 모델이 훈련되는 동안 내부 연결의 "크기"(구체적으로 가중치 행렬의 행들의 강도) 가 통제 불가능하게 커지기 시작합니다.

이것을 풍선을 부풀리는 것으로 생각하세요.

  • Muon은 풍선을 불어넣을 방향을 파악하는 데 뛰어납니다.
  • 그러나 불필요하게 더 많은 공기를 계속 주입하여 풍선이 점점 커지다가 터지거나(수치적 오류) 불안정해질 때까지 부풀립니다.
  • 표준적인 해결책은 풍선 주위에 끈을 묶어 너무 커질 때마다 팽팽하게 당기는 것 (가중치 감쇠) 이었습니다. 하지만 저자들은 이것이 견과류를 깨기 위해 망치를 쓰는 것과 같다고 발견했습니다. 이는 잘 작동하는 부분까지 모두 조여 학습 속도를 늦추기 때문입니다.

진단: 문제의 두 가지 구성 요소

카이 라이온 (Kai Lion) 이 이끄는 저자들은 풍선 안을 들여다보며 실제로 무엇이 커지고 있는지 확인하기로 결정했습니다. 그들은 연결의 "크기"가 두 가지 뚜렷한 부분으로 구성되어 있음을 깨달았습니다:

  1. 크기 (Magnitude, 부피): 숫자 행 전체가 얼마나 큰지.
  2. 일관성 (Coherence, 형태): 그 행 내부의 숫자들이 서로 관련하여 어떻게 배열되어 있는지.

그들은 오직 크기 (Magnitude) 만이 통제 불능 상태로 이동하고 있음을 발견했습니다. 형태 (일관성) 는 실제로 완벽하게 잘 작동하며 안정적으로 유지되었습니다. 풍선의 모양이 변한 것이 아니라 단지 커진 것뿐이었습니다.

해결책: Muown (지능형 펌프)

저자들은 Muown이라는 새로운 최적화기를 개발했습니다.

Muown 은 전체 연결을 하나의 큰 덩어리로 취급하는 대신, 작업을 두 가지 별도의 과업으로 나눕니다:

  1. 방향 팀 (Muon): 이 팀은 Muon 이 가장 잘하는 일을 계속 수행합니다. 즉, 가중치를 업데이트할 완벽한 방향을 파악하는 것입니다. 이 부분은 변경되지 않고 그대로 둡니다.
  2. 부피 팀 (새로운 부분): 이것이 새로운 부분입니다. 그들은 "크기 (Magnitude, 부피)"를 가져와 별도의 명시적 변수로 취급합니다. 그리고 이 부피가 너무 빠르게 커지지 않도록 일련의 특별한 규칙 (특정 수학적 기하학인 \ell_\infty) 을 부여합니다.

비유:
스티어링 휠과 가속 페달이 붙어 있는 차를 운전한다고 상상해 보세요. 핸들을 돌리면 가속 페달도 함께 눌려 차가 통제 불능 상태로 가속됩니다.

  • Muon은 바로 그런 붙어 있는 차와 같았습니다.
  • Muown은 스티어링 휠을 가속 페달에서 분리한 것과 같습니다. 여전히 완벽하게 핸들을 조작할 수 있습니다 (Muon 의 논리 사용). 하지만 이제 가속 페달 (크기) 을 위한 별도의 지능형 크루즈 컨트롤이 있어 속도를 필요한 곳에 정확히 유지하면서도 속도를 늦추지 않습니다.

결과

이 논문은 1 억 2,400 만 개의 매개변수를 가진 작은 모델부터 27 억 개의 매개변수를 가진 매우 큰 모델까지 다양한 모델에서 이를 테스트했습니다. 그들이 발견한 바는 다음과 같습니다:

  • 더 나은 성능: Muown 은 Muon, AdamW 및 기타 경쟁자보다 일관되게 더 나은 결과 (모델이 얼마나 혼란스러운지 측정하는 "퍼플렉시티"가 더 낮음) 를 산출했습니다.
  • 더 관대함: Muon 을 사용할 때는 설정 (학습률) 을 매우 신중하게 해야 했습니다. 잘못된 값을 선택하면 모델이 실패했습니다. Muown 은 훨씬 더 견고하며, 운전의 "최적 구간"이 더 넓은 차처럼 다양한 설정 범위에서 잘 작동합니다.
  • 추가 비용 없음: 일반적으로 새로운 제어 시스템을 추가하면 차가 느려집니다. 하지만 저자들이 이 새로운 "부피 제어"를 엔진의 기존 워크플로우에 직접 통합했기 때문에 훈련 과정에 거의 추가 시간이 들지 않았습니다.
  • 안정성: "풍선"이 더 이상 이동하지 않았습니다. 스펙트럼 노름 (연결의 크기) 이 안정적으로 유지되어 원래 Muon 을 괴롭혔던 수치적 오류를 방지했습니다.

요약

이 논문은 인기 있는 Muon 최적화기의 불안정성은 방향 찾기 능력의 결함이 아니라 업데이트의 "부피"에 대한 통제 부족 때문이라고 주장합니다. "부피"를 "방향"에서 분리하고 서로 다른 전문 도구를 사용하여 제어함으로써 Muown은 가중치 감쇠와 같은 무거운 수정 없이도 훈련을 빠르고 안정적으로 유지합니다. 이는 훈련 과정을 더 매끄럽고, 빠르며, 신뢰할 수 있게 만드는 바로 교체 가능한 솔루션입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →