Rethinking Muon Beyond Pretraining: Spectral Failures and High-Pass Remedies for VLA and RLVR
본 논문은 Muon 과 AdamW 가 어려움을 겪는 검증 가능한 보상을 활용한 비전 - 언어 - 행동 훈련 및 강화 학습에서 Muon 보다 노이즈가 많은 기울기 성분을 억제하고 헤드별 전문성을 보존함으로써 우수한 성능과 안정성을 달성하는 고역파 스펙트럼 최적화기인 Pion 을 소개합니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
"Rethinking Muon Beyond Pretraining" 논문을 쉬운 언어와 일상적인 비유로 설명합니다.
큰 그림: 로봇과 추론을 위한 새로운 최적화 알고리즘
인공지능 (AI) 을 훈련시키는 것은 학생을 가르치는 것과 같습니다. 오랫동안 대규모 언어 모델 (LLM) 을 위한 최고의 교사 (최적화 알고리즘) 는 AdamW였습니다. 최근 Muon이라는 더 진보된 새로운 교사가 등장했습니다. Muon 은 AI 가 인터넷 전체를 읽으며 일반 지식을 습득하는 '사전 훈련 (pretraining)' 단계에서 탁월합니다. Muon 은 AI 의 두뇌를 악기처럼 취급하여, 모든 음 (수학적 방향) 이 동일한 볼륨으로 연주되도록 함으로써 과감한 탐색을 장려합니다.
그러나 이 논문의 저자들은 Muon 을 두 가지 특정 고급 작업에 적용하려 할 때 치명적인 결함이 있음을 발견했습니다.
- 로봇 교육 (VLA): 지능형 언어 모델을 보고, 말하고, 움직일 수 있는 로봇으로 변환하는 것.
- 수학/논리 교육 (RLVR): 보상 (reward) 을 이용해 AI 에게 수학 퍼즐 같은 어려운 문제를 해결하도록 가르치는 것.
이 새로운 시나리오에서 Muon 은 종종 실패하여 로봇이 어색하게 움직이거나 수학 풀이기가 배운 모든 것을 잊어버리게 만듭니다. 저자들은 이러한 문제를 해결하는 새로운 교사인 Pion을 제안합니다.
문제: 왜 Muon 은 새로운 상황에서 실패하는가
문제를 이해하기 위해 AI 의 학습 과정을 많은 스피커 (수학적 방향) 가 있는 사운드 시스템으로 상상해 보십시오.
1. 로봇 문제 (저랭크 문제)
로봇을 훈련시킬 때, 팔을 조절하는 두뇌 부분 (행동 모듈) 은 매우 단순합니다. 오직 몇 가지 특정 방향으로만 움직이면 됩니다.
- 비유: 합창단에서 3 명의 가수만 올바른 가사를 가지고 있고, 나머지 97 명은 무작위 소음을 흥얼거리는 상황을 상상해 보십시오.
- Muon 의 행동: Muon 은 모든 가수의 볼륨을 정확히 같은 수준으로 높이는 오디오 엔지니어와 같습니다. 이는 3 명의 좋은 가수를 크게 만들지만, 97 명의 소음 가수들도 같은 볼륨으로 폭발시킵니다. 결과는 무엇일까요? 로봇은 소음에 혼란을 느껴 불규칙하게 움직입니다.
- 해결책: 좋은 가수는 크게 유지하되 소음 가수는 음소거하는 시스템이 필요합니다.
2. 수학 문제 (저신호대잡음비 문제)
보상 (RLVR) 을 이용해 AI 에게 수학 문제를 풀도록 가르칠 때, 피드백은 매우 '소음'이 많습니다. AI 가 추측하고, 보상을 받고, 다시 시도합니다. 신호 (실제 수학 교훈) 는 약하고 소음 (무작위 추측) 은 강합니다.
- 비유: 허리케인 속에서의 속삭임을 듣는 상황을 상상해 보십시오.
- Muon 의 행동: Muon 은 속삭임과 허리케인 바람을 똑같이 크게 만들려고 합니다. 이는 속삭임을 완전히 덮어씌워 AI 가 '붕괴'하고 학습을 멈추게 만듭니다.
- 해결책: 속삭임을 증폭시키고 허리케인 바람은 차단하는 필터가 필요합니다.
해결책: Pion 의 등장
저자들은 Pion(sPectral hIgh-pass Optimization on momeNtum)을 만들었습니다. Pion 은 Muon 이 빠뜨린 스마트 오디오 이퀄라이저라고 생각하십시오.
모든 볼륨을 동일하게 높이는 대신, Pion 은 두 단계 과정을 사용합니다:
- 증진 (Promotion): 중요하고 명확한 신호 (소리의 '머리' 부분) 를 증폭합니다.
- 억제 (Suppression): 소음이 많고 약한 신호 (소리의 '꼬리' 부분) 를 적극적으로 음소거합니다.
이를 'High-Pass' 필터라고 합니다. 음악에서 고역대 필터가 낮은 울림 베이스 소음을 잘라내어 명확한 보컬이 빛나도록 하듯, Pion 도 수학적 소음을 잘라내어 유용한 학습 방향이 빛나도록 합니다.
Pion 의 주요 특징:
- 바로 교체 가능 (Drop-in Replacement): 기존 훈련 코드에서 Muon 이 들어가는 자리에 정확히 들어맞습니다. 더 많은 컴퓨터 성능이나 시간이 필요하지 않으며, 속도는 동일합니다.
- 헤드별 모드 (Per-Head Mode): 수학 문제의 경우 Pion 은 AI 두뇌의 서로 다른 부분 (주목 헤드, attention heads) 을 개별적으로 처리할 수 있습니다. 이는 한 반의 학생들 전체를 하나의 덩어리로 취급하는 대신, 어떤 학생은 기하학을 잘하고 다른 학생은 대수학을 잘한다는 것을 인식하고 각자에게 다른 숙제를 주는 것과 같습니다.
결과: 로봇과 수학이 더 똑똑해지다
이 논문은 Pion 을 두 가지 주요 영역에서 테스트했습니다.
1. 실제 로봇 (VLA)
- 테스트: 로봇이 오이나 큐브 같은 물체를 집어 그릇이나 접시에 넣도록 훈련시켰습니다.
- 결과:
- AdamW: 로봇이 고전하며 물건을 자주 떨어뜨리거나 목표를 빗나갔습니다.
- Muon: 로봇이 더 잘했지만 여전히 떨림이 있었고, 너무 많은 소음에 '귀를 기울여' 때때로 물체에 부딪혔습니다.
- Pion: 로봇은 매끄럽고 정밀했습니다. 한 테스트에서 Pion 은 1,500 단계 후 100% 성공률을 달성한 반면, Muon 은 97%, AdamW 는 32% 에 그쳤습니다.
- 실제 세계: 그들은 실제 물리적 로봇 팔 (Franka Research 3) 에서도 이를 테스트했고, Pion 이 여전히 승리하여 다른 방법들보다 훨씬 더 신뢰성 있게 물체를 집어 넣고 놓았습니다.
2. 수학 추론 (RLVR)
- 테스트: 강화 학습을 이용해 AI 모델 (Qwen3) 에게 수학 문제 (MATH 및 GSM8K 데이터셋) 를 풀도록 가르쳤습니다.
- 결과:
- Muon: 모델이 붕괴했습니다. 소음이 학습 신호를 압도하여 정확도가 거의 0 으로 떨어졌습니다.
- AdamW: 모델은 느리지만 꾸준히 학습했습니다.
- Pion: 모델은 AdamW 보다 빠르게 학습했으며 더 높은 정확도를 달성하여 소음이 많은 수학 환경을 성공적으로 헤쳐 나갔습니다.
요약
이 논문은 Muon 이 AI 훈련의 초기 '읽기' 단계에서는 훌륭한 도구이지만, 로봇을 제어하거나 수학 문제를 해결하는 섬세한 작업에는 너무 '시끄럽고' 무분별하다고 주장합니다. Pion은 AI 훈련을 위한 소음 제거 헤드폰과 같은 새로운 도구입니다. 중요한 학습 신호는 명확하고 크게 유지하면서 방해가 되는 소음은 침묵시켜, 속도를 늦추지 않으면서 더 똑똑한 로봇과 더 나은 수학 풀이기를 만들어냅니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.