← 최신 논문
🤖 machine learning

Approximate Muon with low-rank adapters

이 논문은 목적 함수를 선형화하고 이를 최소제곱법을 통해 해결함으로써, 기존에는 LoRA와 호환되지 않았던 SFT 및 ReLoRA 사전 학습과 같은 환경에서 Muon의 성능 이점을 가능하게 하는 저차원 매개변수 효율적 미세 조정(PEFT)을 위한 효율적인 방법인 sMuon을 소개한다.

원저자: Ben Anson, Conor Houghton, Edward Milsom

게시일 2026-08-17
📖 3 분 읽기☕ 가벼운 읽기

원저자: Ben Anson, Conor Houghton, Edward Milsom

원본 논문은 CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/)에 따라 공공 도메인에 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 거대하고 매우 똑똑한 로봇에게 시 쓰기나 수학 문제 풀기와 같은 새로운 기술을 가르치려 한다고 상상해 보세요. 로봇의 전체 뇌를 처음부터 다시 훈련시키는 것은 시간이 너무 오래 걸리고 비용도 엄청나게 들기 때문에, 그럴 수는 없습니다. 대신, 기존의 뇌에 작고 가벼운 "훈련 모듈"을 부착하고 싶습니다. 이것을 **매개변수 효율적 미세 조정(Parameter-Efficient Fine-Tuning, PEFT)**이라고 부릅니다. 이것은 범용 로봇에게 특화된 헤드셋을 씌워주는 것과 같습니다. 이 헤드셋은 로봇의 핵심 하드웨어를 변경하지 않고도 새로운 기술을 가르쳐 줍니다.

이러한 헤드셋을 만드는 인기 있는 방법 중 하나는 LoRA(Low-Rank Adaptation)입니다. 이것은 마치 두 장의 얇고 평평한 종이로 헤드셋을 만드는 것과 같아서, 이 종이들을 쌓았을 때 새로운 기술의 형태가 만들어집니다. 로봇을 가르치기 위해서는 헤드셋이 어떻게 모양을 바꾸어야 더 나아질 수 있는지 알려주는 수학적 코치인 **옵티마이저(optimizer)**가 필요합니다. 가장 흔한 코치는 AdamW이지만, 더 새롭고 강력한 코치인 Muon이 있습니다. Muon은 로봇에게 첫 번째 교훈을 주는 사전 학습(pretraining) 단계에서 믿을 수 없을 정도로 효율적인 것으로 유명합니다. 이는 로봇의 뇌 업데이트가 마치 무용수가 한 발로 완벽하게 균형을 잡으며 회전하는 것처럼, 완벽하게 균형 잡힌 "직교(orthogonal)" 방식으로 일어나도록 보장하기 때문입니다.

하지만 문제가 하나 있습니다. LoRA 헤드셋을 훈련할 때 Muon을 사용하려고 하면 수학적으로 오류가 발생합니다. Muon은 로봇 뇌의 전체 레이어를 균형 있게 맞추고 싶어 하지만, LoRA 헤드셋은 그 레이어의 아주 작은, 낮은 차원의 조각일 뿐입니다. 이것은 마치 오케스트라 전체를 지휘하기 위해 지휘봉을 휘두르는데, 정작 지휘는 단 한 명의 바이올리니스트에게만 적용되어 기하학적 구조가 맞지 않는 상황과 같습니다. 표준적인 해결책은 오케스트라는 무시하고 바이올리니스트에게 자기 혼자서만 돌라고 말하는 것이었지만, 이는 Muon의 진정한 묘미를 놓치는 일입니다. 이 논문은 이 질문을 던집니다: 수학적 구조를 깨뜨리거나 속도를 늦추지 않으면서도 Muon이 이 작은 헤드셋에서도 작동하게 만들 방법이 있을까요?

저자인 벤 안슨(Ben Anson), 코너 호튼(Conor Houghton), 에드워드 밀섬(Edward Milsom)은 그렇다고 답합니다. 그들은 sMuon(small Muon)이라는 새로운 방법을 소개합니다. 불가능한 것을 강요하는 대신, 그들은 문제를 "선형화(linearize)"하는 영리한 수학적 트릭을 사용합니다. 흔들거리는 거대한 우산을 들고 외줄 타기를 한다고 상상해 보세요. 우산 전체의 균형을 한꺼번에 잡으려 하는 대신, 아주 짧은 순간 동안 우산을 그냥 곧은 막대기라고 가정하고, 완벽한 발걸음을 계산한 다음 다시 조정하는 것입니다. 이렇게 함으로써, 그들은 완벽한 Muon의 춤을 근사(approximate)할 수 있는 최적의 LoRA 헤드셋 업데이트 방식을 찾아냅니다.

논문의 결과에 따르면, 이 새로운 sMuon 방식은 놀라울 정도로 잘 작동합니다. 다양한 언어 모델을 대상으로 테스트했을 때, sMuon은 표준 AdamW 코치 및 다른 Muon 시도들보다 종종 더 나은 성능을 보였습니다. 특히 이미 Muon으로 사전 학습된 로봇(Moonlight라고 불림)에 사용했을 때, sMuon은 11개의 서로 다른 작업 중 6개에서 최고 점수를 기록하며 매우 인상적인 모습을 보였습니다. 사전 학습 실험에서 sMuon은 오차율을 낮추는 데 있어 가장 가까운 경쟁 방식인 Riemannion과 대등한 최고의 결과를 냈지만, 그 과정은 약 30% 더 빨랐습니다.

결정적으로, 저자들은 자신들의 방법이 단순히 이론적인 아이디어에 그치지 않고 실용적이라는 점을 보여줍니다. 다른 고급 방법들은 복잡한 행렬을 분해하고 재조립하는 것과 같은 무겁고 느린 계산을 요구하지만, sMuan은 거의 전적으로 단순한 행렬 곱셈(현대 컴퓨터 칩들이 빛의 속도로 처리하도록 설계된 바로 그 수학)에 의존합니다. 이는 sMuon이 실제 훈련 과정을 늦추지 않고도 실전 훈련에 사용될 만큼 빠르다는 것을 의미합니다. 이 논문은 LoRA 부분을 별개의 관련 없는 조각으로 취급하는 대신 전체 레이어의 기하학적 구조를 존중함으로써, 아주 적은 추가 비용만으로 상당한 성능 향상을 얻을 수 있음을 시사합니다. 이는 때때로 거대한 로봇에게 새로운 기술을 가르치는 가장 좋은 방법은, 작고 똑똑하며 수학적으로 우아한 자극을 주는 것임을 상기시켜 줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →