← 최신 논문
🤖 machine learning

Muon-OGD: Muon-based Spectral Orthogonal Gradient Projection for LLM Continual Learning

본 논문은 무온 스타일의 스펙트럼 노름 기하학과 직교 기울기 투영을 통합하여 대규모 언어 모델의 지속적 학습 프레임워크인 Muon-OGD 를 제안함으로써 파국적 망각을 완화하고 안정성-가소성 트레이드오프를 개선하며 다양한 벤치마크에서 기존 유클리드 노름 기반 방법들을 능가한다고 주장한다.

원저자: Binghang Lu, Zheyuan Deng, Runyu Zhang, Bing Hu, Yunhan Zhao, Yuan Tian, Changhong Mou, Guang Lin, Xiaomin Li

게시일 2026-05-12
📖 4 분 읽기☕ 가벼운 읽기

원저자: Binghang Lu, Zheyuan Deng, Runyu Zhang, Bing Hu, Yunhan Zhao, Yuan Tian, Changhong Mou, Guang Lin, Xiaomin Li

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

"Muon-OGD" 논문에 대한 설명을 쉬운 언어와 창의적인 비유로 풀어보겠습니다.

큰 문제: "스펀지" 효과

상상해 보세요. 프랑스어를 배우고 스페인어를 배우는, 매우 똑똑한 학생 (대형 언어 모델, LLM) 이 있습니다. 하지만 함정이 하나 있습니다. 스페인어 공부를 시작하자마자 프랑스어를 잊기 시작하는 것이죠. 이를 **파괴적 망각 (catastrophic forgetting)**이라고 합니다.

인공지능 세계에서는 모델이 새로운 작업을 학습할 때, 종종 기존 작업에 사용했던 "신경 경로"를 덮어씁니다. 모델은 새로운 정보를 흡수하지만 그 과정에서 기존 정보를 짜내버리는 스펀지가 되는 것입니다.

구식 해결책: "교통 경찰"

과학자들은 이를 **직교 경사 하강법 (Orthogonal Gradient Descent, OGD)**이라는 방법으로 해결하려 시도했습니다.

모델의 지식을 거대한 다차원 지도라고 상상해 보세요.

  • 과거 작업: "프랑스어" 지식은 이 지도의 특정 차선에 자리 잡고 있습니다.
  • 새 작업: "스페인어" 학습은 차 (업데이트) 를 이 지도 위로 몰고 오려 합니다.

구식 방법은 교통 경찰처럼 행동합니다. "스페인어를 배우기 위해 어디든 운전할 수 있지만, '프랑스어' 차선에는 절대 진입하면 안 된다"고 말합니다. 이는 새로운 학습 경로를 투영하여 기존 경로와 완벽하게 수직 (90 도 각도) 이 되도록 함으로써 이루어집니다.

결함: 이 교통 경찰은 지도가 평평하고 균일한 표준 격자 (유클리드 기하학) 라고 가정합니다. 거리는 "프로베니우스 노름 (Frobenius norm)"이라는 표준 자로 측정합니다. 그러나 이 논문은 이러한 AI 모델의 내부 구조가 평평한 격자가 아니라, 어떤 방향은 "무겁거나" 더 중요할 수 있는 복잡하고 휘어진 지형과 더 비슷하다고 주장합니다.

새로운 아이디어: "산악 가이드" (Muon-OGD)

저자들은 Muon이라는 새로운 최적화 기법이 다르게 작동한다는 점을 발견했습니다. Muon 은 표준 자 대신 **스펙트럼 노름 (spectral norm)**을 사용합니다.

비유:
등산을 한다고 상상해 보세요.

  • 구식 방법 (프로베니우스): 당신은 바닥에 평평한 줄자를 대고 걸음을 재어 봅니다. 효율적으로 이동한다고 생각하지만, 지형의 모양을 고려하지 않아 가파른 절벽을 오르고 있을지도 모릅니다.
  • Muon 방식 (스펙트럼 노름): 당신은 지형의 3 차원 모양을 이해하는 산악 가이드를 데리고 있습니다. 가이드는 어떤 길은 "가파르다 (영향력이 크다)"고, 어떤 길은 "부드럽다 (영향력이 작다)"고 압니다. 가이드는 평평한 거리뿐만 아니라 산의 모양을 존중하는 걸음을 하라고 조언합니다. 이는 당신이 안정적으로 유지하고 잘못된 쪽으로 미끄러지지 않도록 합니다.

Muon-OGD는 이 두 가지 아이디어를 결합합니다:

  1. 교통 경찰을 유지합니다 (과거 프랑스어 지식을 보호하기 위해).
  2. 하지만 어떻게 걸음을 내딛을지 결정하기 위해 **산악 가이드 (Muon)**를 고용합니다.

새로운 방법은 단순히 "프랑스어 차선으로 가지 마라"고 말하는 대신, "프랑스어 차선으로 가지 않으면서도, 미끄러지지 않도록 산의 3 차원 모양을 존중하는 걸음을 하라"고 말합니다.

작동 원리: "이중 (Dual)" 춤

이 논문은 이를 효율적으로 수행하기 위한 수학적 과정을 설명합니다:

  1. 준비: 모델은 건드리지 말아야 할 "보호된 차선 (프랑스어 지식)"을 식별합니다.
  2. 보정: 한 걸음을 내딛기 전에 모델은 "보정된 경로"를 계산합니다. "이걸로 걸으면 실수로 프랑스어 차선에 부딪히지는 않을까?"라고 묻는 것입니다.
  3. 반복: 단순히 한 번 추측하는 것이 아닙니다. 걸음을 미세 조정하기 위해 빠르고 내부적인 루프 (이중 반복, dual iterations) 를 실행합니다. 이는 파트너의 발을 밟지 않으면서도 가장 효율적인 방향으로 이동하기 위해 순간순간 발 위치를 반복해서 조정하는 무용수와 같습니다.
  4. 정렬: 마지막으로, 뉴턴 - 슈르츠 (Newton-Schulz) 반복이라는 수학적 트릭을 사용하여 걸음을 완벽한 "직교" 형태로 딱 맞춰줍니다. 규칙을 위반하지 않으면서도 가장 효율적인 움직임이 되도록 보장하는 것입니다.

결과: 더 나은 학생

저자들은 다양한 "학교 과목 (벤치마크)"에서 이 새로운 방법 (Muon-OGD) 을 구식 방법과 비교 테스트했습니다:

  • 표준 테스트: 텍스트 분류 (뉴스 기사 분류 등).
  • 어려운 테스트: 15 개 작업 스트림 (15 가지 다른 주제를 연속으로 학습).
  • 전문 테스트: 코딩, 수학, 의학 추론.

결과:
모든 테스트에서 Muon-OGD 학생이 더 잘 수행했습니다.

  • 그들은 다른 학생들만큼 새로운 과목 (가소성) 을 잘 배웠습니다.
  • 하지만 과거 과목 (안정성) 을 훨씬 덜 잊었습니다.
  • 특히 코딩, 수학, 의학 기술을 새로운 것을 배우는 동안 유지하는 데 탁월했습니다. 반면 구식 방법들은 이전 기술을 잃기 시작했습니다.

요약

이 논문은 AI 의 뇌에서 "거리"를 측정하는 방식을 평평한 자에서 3 차원 산악 가이드로 변경하고, 이를 과거 지식을 보호하는 엄격한 규칙과 결합함으로써, AI 가 이미 알고 있는 것을 잊지 않고 새로운 것을 가르칠 수 있다고 주장합니다. 이는 영원히 학습을 지속할 수 있는 더 안정적이고 효율적인 방법입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →