← 최신 논문
🤖 machine learning

Reassessing Muon for Matrix Factorization

이 논문은 혼란 변수로부터 업데이트 규칙을 분리하기 위해 저계수 행렬 분해(low-rank matrix factorization) 상에서 Muon 옵티마이저를 재평가하며, 이를 통해 Muon이 AdamW보다 일관되게 우수한 성능을 보이지 않으며 보고된 장점들이 종종 하이퍼파라미터 선택에 민감하다는 점을 밝혀낸다.

원저자: Ali Parviz, Gal Mishne, Alex Cloninger

게시일 2026-07-16
📖 3 분 읽기☕ 가벼운 읽기

원저자: Ali Parviz, Gal Mishne, Alex Cloninger

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 초지능 로봇에게 학습하는 법을 가르치려 한다고 상상해 보십시오. 이를 위해 당신은 로봇이 더 나아지기 위해 다음 단계로 어디로 발을 내디뎌야 할지 알려주는 '코치'가 필요합니다. 인공지능의 세계에서 이 코치는 **옵티마이저(optimizer)**라고 불립니다. 수년 동안 가장 인기 있었던 코치는 AdamW라는 방법이었는데, 이는 경로가 얼마나 미끄러운지 혹은 울퉁불퉁한지에 따라 발걸음을 조절하는 데 탁월합니다. 하지만 최근, Muon이라는 화려한 신입 코치가 등장했습니다. Muon은 단순히 경로를 보는 것에 그치지 않고, **직교화(orthogonalization)**라는 멋진 수학적 기술을 사용하여 로봇의 발걸음을 "곧게 펴려고" 하기 때문에 특별하다고 주장합니다. 이것은 마치 무용수에게 완벽하고 서로 겹치지 않는 방향으로 움직이도록 강요하여 춤을 더 효율적으로 만들려는 무용 강사와 같습니다.

모두가 품고 있는 큰 의문은, Muon이 이야기를 쓰거나 이미지를 생성하는 것과 같은 현대 AI의 거대하고 복적인 작업들을 수행할 때 정말로 AdamW보다 더 나은 코치인가 하는 점입니다. 아니면 단지 댄스 플로어가 너무 거대하고 혼란스러워서 Muon이 좋아 보이는 것뿐일까요? 과학자들은 거대 AI 모델을 대상으로 대규모 테스트를 수행해 왔으며, Muon이 승리하는 것처럼 보였습니다. 하지만 수십억 개의 변수를 다룰 때는, 코치가 실제로 일을 잘하고 있는 것인지 아니면 문제의 규모 자체가 코치의 실수를 가리고 있는 것인지 구별하기 어렵습니다. 여기서 이야기는 흥eric해집니다. 진실을 찾으려면, 단순히 큰 쇼를 지켜보는 것이 아니라, 조용하고 통제된 방 안에서 코치들을 테스트해야 합니다.

"행렬 분해에 대한 Muon의 재평가(Reassessing Muon for Matrix Factorization)"라는 제목의 이 논문은 Muon과 AdamW를 혼란스러운 수십억 개의 파라미터가 있는 댄스 플로리에서 데리고 나와, 단순하고 밝은 연습실로 옮겨 놓습니다. 연구진은 **행렬 분해(matrix factorization)**라는 특정하고 근본적인 과제를 통해 그들을 테스트하기로 했습니다. 만약 당신이 두 개의 더 작고 단순한 스프레드시트로 분해하고자 하는 거대한 숫자 표를 가지고 있다면, 그것이 바로 행렬 분해입니다. 이것은 정답이 무엇인지 정확히 알 수 있고 코치가 내딛는 모든 작은 발걸음을 측정할 수 있는 깔끔한 수학적 퍼즐입니다.

연구진은 두 코치에게 "학습률(learning rate, 로봇이 내딛는 발걸음의 크기)"을 조정하며 다양한 버전의 퍼즐에 대해 대규모 실험을 수행했습니다. 그들은 쉽고 매끄러운 퍼즐부터 숫자가 까다롭고 급격히 감소하는 매우 어렵고 "조건이 나쁜(ill-conditioned)" 퍼즐에 이르기까지 모든 것을 테스트했습니다. 또한 숫자가 양수로 유지되어야 하는 **비음수 행렬 분해(Non-negative Matrix Factorization)**를 포함하여 다양한 유형의 퍼즐을 조사했습니다.

결과는 다음과 같으며, 이는 여러분을 놀라게 할 수도 있습니다: Muon은 마법의 탄환이 아닙니다. 연구진이 두 코치에게 최적의 발걸음 크기를 찾을 수 있는 공정한 기회를 주었을 때, Muon은 AdamW를 일관되게 이기지 못했습니다. 실제로 표준적인 저계수(low-rank) 분해 작업에서는 AdamW나 심지어 평범한 경사 하강법(Gradient Descent)조차 Muon과 대등하거나 오히려 더 뛰어난 성능을 보이기도 했습니다. 거대 AI 모델에서 사람들이 보았던 Muon의 "우월성"은 변수들을 통제했을 때 사라지는 듯합니다. 이 논문은 Muon의 성공이 수학적으로 근본적으로 더 뛰어나서라기보다, 그 거대한 모델들의 특정한 규모와 구조에서 비롯된 결과물일 수 있음을 시사합니다.

하지만 Muon이 쓸모없는 것은 아닙니다. 연구진은 Muon이 한 가지 특정 시나리오에서 명확한 이점을 가진다는 것을 발견했습니다: 바로 **비음수 행렬 분해(NMF)**입니다. 숫자가 반드시 양수여야 하는 이 퍼즐에서, 발걸음을 곧게 펴는 Muon의 독특한 방식은 중복된 솔루션을 피하고 더 다양한 답을 찾는 데 도움을 주었습니다. 즉, Muon은 범용 전문가가 아닌 특화된 전문가인 것입니다. Muon은 문제에 특정한 기하학적 특징(NMF 제약 조건과 같은)이 있을 때는 빛을 발하지만, 문제가 단순히 표준적이고 잘 정돈된 수학 퍼즐일 때는 압도적인 성능을 내지 못합니다.

또한 이 연구는 문제의 "조건(conditioning, 숫자가 얼마나 까다로운지)"에 따라 승자가 달라진다는 것을 밝혔습니다. 매우 어렵고 조건이 나쁜 시나리오에서는 데이터의 형태에 따라 코치들의 순위가 완전히 뒤바뀔 수 있습니다. 저자들은 어떤 코로가 최고인지 결정하기 위해 단 하나의 테스트나 기본 설정만을 봐서는 안 된다고 결론짓습니다. 우리는 광범위한 조건과 발걸음 크기에 걸쳐 그들을 테스트해야 합니다. 결론적으로, Muon은 강력한 도구이긴 하지만, 모든 상황에서 AdamW와 같은 기존의 챔피언들을 자동으로 왕좌에서 끌어내릴 수는 없습니다. Muon의 성공은 그것이 해결하려는 문제의 구체적인 형태에 크게 좌우됩니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →