← 최신 논문
🤖 AI

Optimizer-Induced Mode Connectivity: From AdamW to Muon

본 논문은 AdamW 및 Muon 과 같은 최적화기가 신경망에서 종종 단절된 서로 다른 영손해 해 매니폴드를 유도함을 보여줌으로써, 모드 연결성이 손실 지형의 보편적 속성이 아니라 특정 최적화기와 그 암시적 정규화에 근본적으로 의존함을 규명한다.

원저자: Fangzhao Zhang, Sungyoon Kim, Erica Zhang, Yiqi Jiang, Mert Pilanci

게시일 2026-05-12
📖 3 분 읽기☕ 가벼운 읽기

원저자: Fangzhao Zhang, Sungyoon Kim, Erica Zhang, Yiqi Jiang, Mert Pilanci

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

거대한 산악 지형에서 가장 낮은 지점을 찾으려 한다고 상상해 보세요. 이 지형은 신경망의 '손실 함수'를 나타냅니다: 높은 곳에 있을수록 모델의 성능은 나빠지고, 낮은 곳에 있을수록 성능은 좋아집니다.

오랫동안 연구자들은 두 개의 서로 다른 모델을 이 계곡의 가장 깊은 바닥 (즉, '손실 제로' 상태) 에 도달하도록 훈련시켰을 때, 두 모델을 연결하는 단순하고 매끄러운 경로가 존재하며 그 경로 위에서 다시 언덕을 오르지 않아도 된다고 믿었습니다. 이 개념은 **모드 연결성 (Mode Connectivity)**이라고 불립니다. 마치 "두 명의 등산가가 같은 계곡의 바닥을 찾았다면, 그들 사이를 연결하는 평탄한 길이 분명히 존재해야 한다"는 말과 같습니다.

그러나 이 논문은 새로운 질문을 던집니다: 그 경로가 등산가들이 '어떻게' 걸어왔는지에 따라 달라질까요?

저자들은 두 가지 다른 '등산 스타일' (최적화 알고리즘) 을 소개합니다:

  1. AdamW: 고전적이고 신뢰할 수 있는 등산가.
  2. Muon: 더 새롭고 전문적이며 다른 방식으로 이동하는 등산가.

다음은 이 논문이 발견한 바를 간단한 비유로 설명한 것입니다:

1. '스펙트럼 지문'

모든 모델은 **특이값 (singular values)**이라는 숫자로 구성된 고유한 '지문'을 가지고 있습니다 (이를 모델의 내부 '근육 긴장도'나 '형태'로 생각하세요).

  • AdamW 모델은 몇 개의 매우 강한 근육과 많은 약한 근육을 가지는 경향이 있습니다 (스펙트럼에서의 이상치).
  • Muon 모델은 모든 근육이 대략 같은 크기를 가지는 경향이 있습니다 (더 균형 잡힌, '등방성' 스펙트럼).

논문에 따르면, AdamW로 훈련된 두 모델을 연결하면 그들 사이의 '근육 긴장도'가 일정하게 유지됩니다. Muon 모델 두 개를 연결해도 마찬가지입니다. 그들은 각자의 '이웃'에 머무릅니다.

2. 동일 최적화 알고리즘 고속도로 (Intra-Optimizer Connectivity)

논문은 수학적으로 증명했습니다. 신경망이 충분히 넓다면 (충분한 뉴런을 가진다면), AdamW가 찾은 모든 해답은 매끄럽고 손실이 낮은 경로로 연결되어 있습니다. Muon의 경우에도 마찬가지입니다.

  • 비유: 넓고 평평한 초원을 상상해 보세요. 당신과 친구가 같은 등산화 (AdamW) 를 신었다면, 바위 한 번 밟거나 언덕을 오르지 않고도 당신의 자리에서 친구의 자리까지 걸어갈 수 있습니다. 당신은 같은 '등산화 자국' 구역에 머무릅니다.

3. 교차 최적화 알고리즘 장벽 (Inter-Optimizer Disconnectivity)

이 부분이 가장 놀랍습니다. AdamW 모델에서 Muon 모델로 걸어가는다면 어떻게 될까요?

  • 이론: 작고 단순한 네트워크에서는 저자들이 증명했듯이 'AdamW 계곡'과 'Muon 계곡'이 높은 산맥으로 분리되어 있을 수 있습니다. 성능을 잃고 언덕을 올라가지 않고는 한쪽에서 다른 쪽으로 이동할 수 없습니다. 그들은 해답 공간의 서로 다른 '섬'에 있습니다.
  • 현실 (대규모 모델): 대규모 실험 (언어 모델인 GPT-2 사용) 에서 그들은 두 모델을 연결할 수는 있지만, 그 경로가 특별하다는 것을 발견했습니다. AdamW 에서 Muon 으로 걸어갈 때, 모델의 '근육 긴장도' (스펙트럼) 는 단순히 유지되는 것이 아니라 매끄럽게 변환됩니다.
    • 비유: 소나무 숲 (AdamW) 에서 참나무 숲 (Muon) 으로 걸어가는 상황을 상상해 보세요. 순간이동하는 것이 아니라, 소나무에서 참나무로 서서히 변하는 과도기 지대를 통과하며 걷게 됩니다. 그 경로가 존재하지만, 어느 최적화 알고리즘도 단독으로 자연스럽게 만들어내지 않는 독특한 '하이브리드' 지형을 통과하게 됩니다.

4. '스무디' 효과 (일반화)

논문의 연구진은 AdamW 해답과 Muon 해답의 중간에 있는 모델을 만들었을 때 어떤 일이 일어나는지 테스트했습니다.

  • 결과: 이러한 '하이브리드' 모델은 종종 원래 모델들보다 보지 못한 데이터 (분포 외 일반화) 에 대해 더 나은 성능을 발휘했습니다.
  • 비유: 커피 (AdamW) 와 차 (Muon) 를 섞으면, 커피나 차 단독보다 어떤 사람들에게는 더 맛있는 새로운 음료가 됩니다. 이 '혼합물'은 개별 최적화 알고리즘이 놓친 지형의 일부를 탐험합니다.

주장 요약

  • 동일 최적화 알고리즘: 같은 최적화 알고리즘을 두 번 사용하면, 모델의 내부 구조를 일관되게 유지하는 매끄러운 경로로 해답들이 연결됩니다.
  • 서로 다른 최적화 알고리즘: 서로 다른 최적화 알고리즘을 사용하면, 작은 네트워크에서는 장벽으로 분리될 수 있지만, 대규모 네트워크에서는 모델의 내부 구조를 매끄럽게 전환시키는 경로로 연결될 수 있습니다.
  • 이점: 서로 다른 최적화 알고리즘 해답 사이를 이동하면 새로운 보지 못한 데이터에 대해 더 잘 일반화할 수 있는 '하이브리드' 모델이 생성됩니다.

이 논문은 이것이 의료 진단, 자율 주행, 또는 구체적인 미래 AI 응용 분야에 적용된다고 주장하지 않습니다. 이 논문은 엄격하게 이러한 모델들이 어떻게 연결되는지에 대한 수학적 기하학과, 언어 모델 훈련에서 이를 혼합하면 일반화가 향상된다는 경험적 관찰에 초점을 맞춥니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →