← 최신 논문
🤖 machine learning

MONA: Muon Optimizer with Nesterov Acceleration for Scalable Language Model Training

본 논문은 10 억에서 680 억 파라미터에 이르는 언어 모델에서 날카로운 지역 최소값을 탈출하고 최첨단 수렴성 및 하류 과업 성능을 달성하기 위해 Muon 프레임워크에 네스테로프 스타일 가속을 통합한 새로운 최적화 알고리즘인 MONA 를 소개합니다.

원저자: Jiacheng Li, Jianchao Tan, Hongtao Xu, Jiaqi Zhang, Yifan Lu, Yerui Sun, Yuchen Xie, Xunliang Cai

게시일 2026-05-27
📖 3 분 읽기☕ 가벼운 읽기

원저자: Jiacheng Li, Jianchao Tan, Hongtao Xu, Jiaqi Zhang, Yifan Lu, Yerui Sun, Yuchen Xie, Xunliang Cai

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

거대하고 초지능적인 로봇에게 인간 언어를 가르치려 한다고 상상해 보세요. 이를 위해 로봇의 뇌 안에 있는 수백만 개의 작은 조절 나사를 조정해야 합니다. 이 나사들의 완벽한 설정을 찾는 과정을 '학습 (training)'이라고 하며, 그 나사들을 돌리는 도구를 **옵티마이저 (optimizer)**라고 부릅니다.

오랫동안 이 작업의 표준 도구는 AdamW였습니다. 이는 지도를 끊임없이 확인하며 작은 걸음을 내딛는 신중하고 꾸준한 등산객처럼 안정적입니다. 최근 Muon이라는 새로운 도구가 등장했습니다. Muon 은 전체 산맥을 한 번에 바라보며 나사들의 그룹을 단일 단위로 취급하는 등산객과 같습니다. 이로 인해 Muon 은 더 빠르고 효율적이지만, 여전히 '날카로운 골짜기 (sharp valley)'에 갇힐 수 있다는 결함이 있습니다.

문제: 날카로운 골짜기 함정

로봇의 학습 과정 지형을 언덕진 지형으로 상상해 보세요.

  • 평탄한 골짜기는 정착하기에 좋은 곳입니다. 이는 로봇이 여러 상황에서 잘 작동하는 안정적이고 일반적인 해법을 찾았음을 의미합니다.
  • 날카로운 골짜기는 좁고 깊은 구덩이입니다. 로봇이 여기에 빠지면 최저점을 찾은 것처럼 보일 수 있지만, 실제로는 매우 구체적이고 취약한 곳에 갇힌 것입니다. 살짝 건드리기만 해도 '완벽한' 자리에서 벗어나 성능이 떨어집니다.

AdamW 와 Muon 모두 실수로 이러한 날카로운 골짜기에 빠져 갇힐 수 있습니다. 두 도구 모두 미리 지형의 모양을 '느껴' 그 자리가 너무 날카로운지 알 수 있는 방법이 부족합니다.

해결책: MONA (Muon with Nesterov Acceleration)

이 논문의 저자들은 MONA라는 새로운 도구를 개발했습니다. MONA 를 소나 안경을 낀 Muon 으로 생각하세요.

간단한 비유로 작동 원리를 설명하면 다음과 같습니다:

  1. 옛 방식 (Muon): Muon 은 서 있는 곳의 경사를 보고 아래로 이동합니다. 효율적으로 이동하는 데는 훌륭하지만, 앞쪽 지면이 완만한 경사인지 절벽 가장자리인지 알지 못합니다.
  2. 새로운 방식 (MONA): Muon 이 한 걸음을 내딛기 전에, MONA 는 마지막 걸음에서 현재 걸음까지 경사가 어떻게 변화했는지 살펴봅니다.
    • 경사가 매우 갑자기 변했다면 (날카로운 절벽을 만난 것처럼), MONA 는 "와, 이건 날카로운 골짜기야! 여기서 튕겨 나오기 위해 더 세게 밀자"라고 판단합니다.
    • 경사가 매우 천천히 변했다면 (부드럽고 평탄한 골짜기), MONA 는 "이곳은 안전해 보이네. 여기에 정착하자"라고 말합니다.

MONA 는 수학식에 특별한 '가속 항 (acceleration term)'을 추가합니다. 이는 현재 방향과 이전 방향 사이의 차이를 계산합니다. 이 차이는 지형의 '날카로움'을 감지하는 센서처럼 작용합니다. 지형이 날카로우면 로봇을 구덩이에서 밀어내고, 평탄하면 로봇이 휴식하도록 합니다.

그들이 발견한 것

연구진은 10 억 개에서 680 억 개까지의 파라미터를 가진 세 가지 크기의 언어 모델 (소형, 중형, 대형) 에 이 새로운 도구를 테스트했습니다. 이들은 최대 1 조 단어에 달하는 방대한 양의 텍스트로 모델을 학습시켰습니다.

  • 더 나은 학습: 모든 테스트에서 MONA 는 기존 표준인 AdamW 와 최신 Muon 보다 모델이 더 빠르게 학습하고 더 나은 최종 상태에 도달하도록 도왔습니다.
  • 더 똑똑한 로봇: MONA 로 학습된 모델은 일반 작업, 수학 문제, 코드 작성 능력이 더 뛰어났습니다. 예를 들어, 680 억 파라미터 모델에서 MONA 는 수학 및 코딩 관련 벤치마크에서 최고 점수를 기록했습니다.
  • 파인튜닝 (Fine-Tuning): 초기 학습 후에도 모델에 추가적인 구체적인 학습 (예: 코드 작성 특화 학습) 을 시켰을 때, Muon 으로 시작한 모델보다 MONA 로 시작한 모델이 더 좋은 성능을 발휘했습니다.

실용화 (MONA-Lite)

저자들은 이 '소나' 시스템을 추가하면 컴퓨터 메모리를 조금 더 사용한다는 점도 깨달았습니다. 이를 해결하기 위해 MONA-Lite라는 경량 버전을 만들었습니다.

  • 고화질 비디오를 표준 화질로 전환하는 것처럼 메모리 데이터를 압축하는 트릭과 추가 파일을 저장하지 않고도 경사 변화를 실시간으로 계산하는 방법을 사용했습니다.
  • 이로 인해 필요한 추가 메모리가 약 75% 감소하여, 제한된 메모리를 가진 컴퓨터에서도 혜택을 잃지 않고 쉽게 사용할 수 있게 되었습니다.

요약

간단히 말해, MONA는 Muon 옵티마이저의 업그레이드 버전입니다. Muon 의 속도와 효율성을 유지하면서 학습 중 나쁜 날카로운 곳에 갇히는 것을 방지하는 '곡률 센서'를 추가했습니다. 그 결과 수학, 코딩, 일반 추론 능력이 향상된 더 똑똑하고 능력 있는 언어 모델이 만들어졌으며, 이는 표준 하드웨어에서도 효율적으로 실행됩니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →