← 최신 논문
🤖 machine learning

When Does Muon Help Agentic Reinforcement Learning?

이 논문은 Group-in-Group 정책 최적화 과정에서 은닉 가중치 행렬에 Muon 옵티마이저를 적용하는 것이 희소 보상 에이전트 강화학습 태스크에서 AdamW보다 현저히 우수한 성능을 보임을 입증하며, 이러한 성능 향상은 어드밴티지 추정치, 학습률, 그리고 정책 최적화 전략 사이의 상호작용에 크게 의존한다.

원저자: Kai Ruan, Jinghao Lin, Zihe Huang, Ziqi Zhou, Qianshan Wei, Xuan Wang, Hao Sun

게시일 2026-07-20
📖 5 분 읽기🧠 심층 분석

원저자: Kai Ruan, Jinghao Lin, Zihe Huang, Ziqi Zhou, Qianshan Wei, Xuan Wang, Hao Sun

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 로봇에게 거대하고 지저한 집 안을 탐험하며 숨겨진 보물을 찾는 법을 가르치고 있다고 상상해 보세요. 로봇은 코드로 만들어진 "두뇌"이며, 로봇이 한 걸음 내디딜 때마다 선생님으로부터 그 발걸음이 좋았는지 나빴는지에 대한 작은 넛지(nudge)를 받습니다. 이것이 바로 에이전트가 시행착오를 통해 학습하는 **강화 학습(Reinforcement Learning, RL)**의 세계입니다. 이 이야기에서 "선생님"은 **옵티마이저(optimizer)**라고 불리는 수학적 도구로, 실수나 성공 후에 로봇의 두뇌를 얼마나 변화시킬지를 결정합니다. 수년 동안 가장 인기 있는 선생님은 AdamW라는 방법이었는데, 이는 마치 로봇의 발걸음이 얼마나 큰 피드백을 받았는지에 따라 발걸음을 조절하는 신중하고 꾸준한 코치와 같습니다.

최근에는 훨씬 더 화려한 코치인 Muon이 등장했습니다. Muon은 로봇을 처음부터 가르칠 때(프리트레이닝 과정) 믿기지 않을 정도로 빠르고 효율적이며, 종종 절반의 에너지만으로도 그 일을 해내는 것으로 유명합니다. 하지만 여기 큰 의문이 있습니다. 만약 로봇이 이미 기초를 배웠고 이제 특정하고 어려운 과제를 마스터하려고 노력 중인 단계(파인튜닝 단계)라면, Muon이 여전히 잘 작동할까요? 초기 보고들에 따르면 Muon은 이 "파인튜닝" 단계에서 너무 공격적이어서, 로봇이 알고 있던 것을 잊어버리게 하거나 노이즈 때문에 혼란을 줄 수도 있다고 합니다. 이 논문은 Muon이 보상이 드물고 찾기 어려운 복잡하고 긴 호흡의 퍼즐을 해결하도록 에이전트를 가르치는 데 있어 비밀 병기가 될 수 있는지 테스트하며 이 미스터리를 파헤칩니다.


위대한 옵티마이저의 대결

연구진은 실험실에서 고도의 승부가 걸린 경주를 준비했습니다. 그들은 작지만 유능한 AI 에이전트(Qwen2.5-0.5B-Instruct 모델 기반)를 데려와서, 에이전트가 물건을 집거나, 청소를 하거나, 음식을 데우는 것과 같은 가사 노동을 수행해야 하는 시뮬레이션 환경인 ALFWorld에서 퍼즐을 풀도록 과제를 주었습니다. 함정은 무엇일까요? 에이전트는 긴 행동 시퀀스의 맨 마지막에만 "성공" 보상을 받으며, 과정 중에 잘못된 행동을 할 때마다 벌칙을 받는다는 점입니다. 이는 마치 미로를 통과하는 것과 같습니다. 출구에 도착했을 때만 "승리했습니다!"라는 소리를 들을 수 있고, 길을 잘못 들 때마다 "삐!" 하는 소리를 듣게 되는 것이죠.

Muon이 도움이 될 수 있는지 확인하기 위해, 연구진은 단순히 로봇을 미로에 던져 넣은 것이 아니라, 로봇의 성과를 해석하기 위한 세 가지 다른 유형의 "피드백 코치"(어드밴티지 추정기/advantage estimators라고 불림)를 제공했습니다.

  1. GRPO: 이 코치는 최종 결과만을 봅니다. "게임을 이겼나요? 네? 잘했습니다! 아니요? 다시 시도하세요." 이 코치는 개별 단계는 무시합니다.
  2. GiGPO: 이 코치는 더 똑똑합니다. 최종 결과뿐만 아니라, 로봇이 동일한 상황에 여러 번 직면했던 순간들을 그룹화하여 살펴봅니다. 이 코치는 "냉장고 앞에 서 있을 때, 보통 냉장고 문을 올바르게 열었나요?"라고 묻습니다.
  3. GraphGPO: 가장 정교한 코치로, 전체 여정을 그래프로 그려서 모든 개별 단계가 목표에 얼마나 근접했는지를 분석합니다.

놀라운 발견

연구진은 구식의 믿음직한 AdamW 코치와 새로운 Muon 코치를 맞붙여 실험을 진행했습니다. 그들은 기본 부분(단어 사전 등)은 AdamW에 남겨둔 채, 로봇의 "숨겨진" 뇌 가중치(복잡한 내부 연결)를 위한 옵티마이저만 교체하여 다른 모든 조건을 동일하게 유지했습니다.

결과는 사용된 피드백 코치에 따라 "그저 그런" 결과와 "와우" 하는 결과가 섞여서 나타났습니다.

"와우"의 순간: GiGPO
GiG별 GiGPO 코치를 사용했을 때, Muon은 로봇을 슈퍼 러너로 만들었습니다.

  • 표준 AdamW 코치를 사용했을 때, 로봇은 최종 테스트 실행의 약 **29%**에서 성공했습니다.
  • Muon을 사용했을 때, 그 수치는 **54.6%**로 급증했습니다.
  • 이는 88%의 상대적 개선입니다.
  • 더욱 인상적인 것은, AdamW 로봇은 특정 시점 이후에 완전히 무너져 아무 작업도 해결하지 못했지만, Muon 로봇은 200번의 업데이트 내내 계속해서 학습하고 성공했다는 점입니다.

"그저 그런" 순간: GRPO
단순히 (최종 승리에만 관심을 갖는) GRPO 코치를 사용했을 때, Muon은 여전히 도움이 되었지만 그만큼 극적이지는 않았습니다. 성공률을 16.1%에서 26.8%로 높였습니다. 승리이긴 했지만, 로봇이 GiGPO만큼 빠르거나 잘 학습하지는 못했습니다.

"거의 다 온" 순간: GraphGPO
가장 정교한 GraphGPO 코치를 사용했을 때, 로봇은 AdamW로도 이미 매우 잘 수행하고 있었습니다(성공률 약 81%). Muon은 특정 학습률에서 이를 90.1%까지 끌어올렸으며, AdamW보다 30~60단계 더 빨리 그 성공 수준에 도달했습니다. 그러나 로봇이 이미 정점에 도달했기 때문에, 결승선에 가까워질수록 두 코치 사이의 격차는 좁혀졌습니다.

왜 Muon이 이겼을까? (그리고 왜 항상 이기지는 못했을까?)

연구진은 왜 이런 일이 일어났는지에 대한 이론을 가지고 있었습니다. 그들은 이것이 **노이즈(noise)**와 관련이 있다고 의심했습니다.

로봇의 뇌가 안개 낀 숲속에서 길을 찾으려고 노력한다고 상상해 보세요.

  • AdamW는 가장 강하고 시끄러운 경로를 따르는 등산객과 같습니다. 안개가 짙으면(높은 노이즈), 길을 잃거나 벗어날 수 있습니다.
  • Muon은 지형을 평평하게 만들어, 약하고 조용한 경로들도 시끄러운 경로만큼 잘 보이게 만드는 등산객과 같습니다. 만약 그 조용한 경로들이 실제로 유용한 곳으로 이어진다면, 이는 아주 좋은 전략입니다.

논문은 GRPO 설정(단일 턴, 낮은 보상 작업)에서 "조용한 경로"가 대부분 무작위 노이즈에 불과하다고 설명합니다. Muon의 평탄화 효과는 이 노이즈를 증폭시키며, 이것이 다른 연구들에서 Muon이 실패하거나 어려움을 겪었던 이유입니다. 하지만 GiGPO 설정에서는 "단계별" 피드백이 등대 역할을 합니다. 이 피드백은 노이즈를 걸러내고 진정으로 유용한 방향을 강조합니다. GiGPO가 어떤 특정 단계가 좋았는지에 대해 더 명확한 신호를 제공하기 때문에, 약한 신호를 증폭시키는 Muon의 능력이 저주가 아닌 초능력이 되는 것입니다.

이 논문이 배제한 것

이 연구가 무엇을 찾아내지 못했는지 주목하는 것도 중요합니다. 연구진은 성공의 원인이 단지 Muon이 더 높은 "학률(learning rate)"(더 큰 보폭)을 사용했기 때문인지 테스트했습니다. 그들은 AdamW의 속도를 Muon의 속도에 맞춰 높여보려 했지만, 로봇은 즉시 무너지고 실패했습니다. 이는 Muon의 성공이 단순히 더 큰 보폭을 취했기 때문이 아니라, 그 보폭을 어떻게 계산했는지에 관한 것임을 입증합니다.

또한, 이 논문은 Muon이 모든 것에 대한 완벽한 해결책이라고 주장하지 않습니다. 실제로 연구진은 다른 유형의 작업(예: 단일 턴 수학 문제)에서 Muon이 실패했다는 점을 명시적으로 언급했습니다. 여기서의 성공은 피드백이 정교하게 구조화된(GiGPO와 같은) 긴 호흡의 희소 보상(long-horizon, sparse-reward) 작업에 특화된 것입니다.

핵심 요약

이 논문은 Muon이 적절한 종류의 피드백과 결합될 때, 에이전트형 강화 학습(agentic Reinforcement Learning)을 위한 강력한 도구가 될 수 있음을 시사합니다.

만약 당신이 AI에게 복잡하고 다단계적인 퍼즐을 풀도록 가르치고 있다면, 단순히 Muon으로 바꾸는 것만으로는 충분하지 않을 수 있습니다. 문제를 더 작고 명확한 조각으로 나누어주는 피드백 시스템(예: GiGPO)이 필요합니다. "조용한" 유용한 경로를 보는 Muon의 능력과 노이즈를 걸러내는 GiGPO의 능력을 결합하면, AI는 훨씬 더 빠르게 학습하고 더 많은 퍼즐을 해결할 수 있습니다.

저자들은 이것이 단일 시드(실험의 한 번의 실행)를 사용한 "탐색적" 연구임을 인정하며, 이 패턴이 다른 모델과 작업에서도 유지되는지 확인하기 위해 더 많은 테스트가 필요하다고 말합니다. 하지만 결과는 유망합니다. 옵티마이저와 피드백 시스템을 함께 튜닝함으로써, 우리는 훨씬 더 나은 방식으로 복잡하고 실제적인 세상을 항해하는 AI 에이전트를 구축할 수 있을 것입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →