← 최신 논문
🤖 machine learning

LionMuon: Alternating Spectral and Sign Descent for Efficient Training

본 논문은 기존 방법인 AdamW, Lion, Muon 에 비해 다양한 모델 규모에서 우수한 성능과 낮은 계산 비용을 달성하기 위해 단일 모멘텀 버퍼를 공유하면서 Lion 과 Muon 의 업데이트를 교차적으로 수행하는 효율적인 옵티마이저 LionMuon 을 소개합니다.

원저자: Arman Bolatov, Artem Riabinin, Nikita Kornilov, Andrey Veprikov, Samuel Horváth, Martin Takáč, Aleksandr Beznosikov

게시일 2026-05-20
📖 4 분 읽기☕ 가벼운 읽기

원저자: Arman Bolatov, Artem Riabinin, Nikita Kornilov, Andrey Veprikov, Samuel Horváth, Martin Takáč, Aleksandr Beznosikov

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

거대하고 복잡한 로봇(대형 언어 모델)에게 수백만 개의 예시를 보여주며 말하기 능력을 가르친다고 상상해 보세요. 이를 위해 로봇이 본 각 예시마다 뇌(파라미터)를 어떻게 조정할지 알려주는 '최적화기'가 필요합니다.

문제는 이 코치가 수십억 번이나 결정을 내려야 한다는 점입니다. 코치가 너무 느리거나 실행 비용이 너무 비싸다면 전체 프로젝트가 지나치게 비싸집니다. 반면 코치가 너무 저렴하지만 잘못된 결정을 내린다면 로봇은 느리게 학습하거나 갇히게 됩니다.

이 논문은 LionMuon이라는 새로운 코치를 소개합니다. 이는 두 가지 매우 다른 코칭 스타일의 장점을 모두 얻으려는 교묘한 하이브리드입니다.

기존 두 코치

LionMuon 을 이해하려면 먼저 그것이 결합하는 두 코치를 알아야 합니다.

  1. '부호 (Sign)' 코치 (Lion/Signum):

    • 작동 방식: 이 코치는 놀라울 정도로 빠르고 저렴합니다. 실수의 정확한 크기를 보지 않고 방향(양수 또는 음수) 만 봅니다. 마치 정확한 거리를 계산하지 않고 "좌회전" 또는 "우회전"만 알려주는 GPS 와 같습니다.
    • 장점: 매우 효율적입니다. 예산을 초과하지 않고도 수십억 번 실행할 수 있습니다.
    • 단점: '크기 (magnitude)' 즉, 얼마나 크게 방향을 틀어야 하는지를 무시하기 때문에 때로는 약하거나 약간 빗나가는 경로를 택합니다. 빠르지만 항상 가장 정확한 것은 아닙니다.
  2. '스펙트럼 (Spectral)' 코치 (Muon):

    • 작동 방식: 이 코치는 천재 수학자입니다. 실수의 전체 지도를 한 번에 살펴보고 이를 수정할 완벽하고 가장 강력한 방향을 계산합니다. 복잡한 행렬 수학을 사용합니다 (교통, 지형, 속도 제한을 고려하여 절대적으로 가장 짧은 경로를 계산하는 고급 GPS 와 같습니다).
    • 장점: 가장 좋은 경로를 매우 빠르게 찾습니다. 로봇이 단계당 더 빠르게 학습합니다.
    • 단점: 계산 비용이 많이 듭니다. 이러한 복잡한 수학 연산은 많은 시간과 에너지를 소모합니다. 모든 단계마다 이 코치를 사용하면 훈련 비용이 급증합니다.

새로운 해결책: LionMuon

저자들은 단순한 질문을 던졌습니다. "부호 코치의 속도와 스펙트럼 코치의 정확성을 모두 가질 수 있을까?"

그들의 답은 LionMuon입니다.

하나를 선택하는 대신 LionMuon 은 스마트 스위치보드처럼 행동합니다. 고정된 일정 (예를 들어 2 단계마다) 으로 두 코치 사이를 오갑니다.

  • 1 단계: 완벽한 강력한 방향을 찾기 위해 Muon 코치를 사용합니다.
  • 2 단계: 첫 단계에서 얻은 모멘텀을 기반으로 저렴하고 빠른 조정을 위해 Lion 코치를 사용합니다.
  • 3 단계: 다시 Muon 으로 돌아가고, 이를 반복합니다.

비밀 재료:
보통 코치를 전환할 경우 메모리를 초기화하거나 두 개의 다른 메모리 뱅크를 사용해야 합니다. LionMuon 은 두 코치 간에 단일 메모리 뱅크를 공유하기 때문에 교묘합니다. 이는 실행을 위해 추가 컴퓨터 메모리 (RAM) 가 필요하지 않음을 의미합니다. 이는 값싼 Lion 코치와 동일한 양의 메모리를 사용하며, 표준 산업용 코치 (AdamW) 의 절반 수준입니다.

이것이 중요한 이유는 무엇일까요?

이 논문은 이러한 단계를 교차함으로써 LionMuon 이 양쪽 세계의 장점을 얻는다고 주장합니다.

  1. 더 저렴합니다: 매 단계마다 비싼 '완벽한 수학 (Muon)'을 수행하는 대신 몇 단계마다 한 번만 수행하므로, 동일한 결과를 얻기 위한 총 훈련 비용이 크게 감소합니다 (동일한 결과에 대해 약 5% 적은 컴퓨팅 파워 필요).
  2. 더 똑똑합니다: 때때로 비싼 수학 연산을 건너뛰지만, '저렴한' 단계들은 이전 단계에서 찾은 강력한 방향에 의해 안내됩니다. 그 결과 로봇은 어느 코치 단독으로 사용할 때보다 더 빠르게 학습하고 더 낮은 오차율에 도달합니다.
  3. 확장성이 있습니다: 연구원들은 다양한 크기의 모델 (1 억 2,400 만 개에서 7 억 2,000 만 개 파라미터) 에서 이를 테스트했습니다. 모든 경우 LionMuon 이 승리하여 최소한의 컴퓨팅 파워로 최고의 결과를 달성했습니다.

이론 (작동 원리)

저자들은 단순히 추측한 것이 아니라 수학적 증명을 했습니다. 특정 조건 (특히 AI 에서 흔한 노이즈가 있는 데이터) 하에서는 전환 빈도에 대한 '골든 스팟'이 있음을 증명했습니다.

그들은 너무 자주 전환하면 (매 단계마다 Muon 수행) 비용이 너무 많이 들고, 너무 드물게 전환하면 정확도 향상을 잃는다는 사실을 발견했습니다. 그들의 수학에 따르면 대부분의 현대 AI 모델의 경우, 2 단계마다 (하나의 Muon, 하나의 Lion) 전환하는 것이 완벽한 균형입니다.

요약 비유

안개 낀 산을 등반한다고 상상해 보세요.

  • Lion은 바람을 기반으로 방향을 대충 추측하는 빠른 주자입니다. 그는 빠르게 움직이지만 지그재그로 갈 수 있습니다.
  • Muon은 열화상 카메라를 사용하여 절대적으로 가장 가파르고 안전한 경로를 찾는 느리고 비싼 헬리콥터 조종사입니다.
  • LionMuon은 헬리콥터 조종사가 한 번 비행하여 최적의 경로를 찾은 후, 빠른 주자가 그 경로를 따라 잠시 질주하다가 헬리콥터가 다시 점검하는 팀입니다.

결과는 무엇일까요? 헬리콥터만 의존하거나 처음부터 끝까지 대충 추측하는 것보다 더 빨리 정상에 도달하고 더 적은 연료로 도달합니다.

핵심 결론: LionMuon 은 추가 컴퓨터 메모리 없이도 비용을 절감하고 시간을 단축하면서 AI 를 더 똑똑하게 만드는 새로운 효율적인 AI 훈련 방법입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →