DMuon: Efficient Distributed Muon Training with Near-Adam Overhead
이 논문은 기존의 훈련 파이프라인에 원활하게 통합되어 옵티마이저 단계의 지연 시간을 획기적으로 줄이고 AdamW에 근접한 효율성을 달성함으로써, 대규모 파운데이션 모델에서 행렬 직교화 기반 최적화의 확장 가능한 사용을 가능하게 하는 Muon 옵티마이저의 오픈 소스 분산 구현체인 DMuon을 소개한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 거대한 로봇의 두뇌(대규모 언어 모델 또는 체화된 AI)를 훈련시키고 있다고 상상해 보십시오. 이 로봇을 가르치기 위해서는 '옵티마이저(optimizer)'가 필요합니다. 즉, 로봇의 실수를 관찰하고 더 똑똑하게 만들기 위해 내부 연결 구조(가중치)를 조정하는 코치입니다.
오랫동안 표준적인 코치는 AdamW였습니다. 이것은 마치 수천 명의 작은 작업자가 로봇의 아주 작은 나사 하나하나를 한 번에 하나씩 고치는 것과 같습니다. 빠르고 효율적이지만, 모든 나사를 독립적으로 취급합니다.
최근에는 Muon이라는 더 똑똑한 코치가 발견되었습니다. Muon은 나사를 하나씩 고치는 대신, 로봇의 전체적인 '패널'(데이터의 전체 행렬)을 보고 이를 한꺼번에 조정합니다. 이 "그룹 치료" 방식은 로봇이 더 빠르게 학습하고 더 높은 성능에 도달하도록 돕습니다. 하지만 여기에는 문제가 있습니다. Muon은 분산 시스템(여러 대의 컴퓨터가 협력하여 작업하는 클러스터)에서 실행할 때 매우 느리다는 점입니다.
문제: "전원 참석" 회의의 병목 현상
분산 훈련 설정에서는 로봇의 두뇌가 여러 대의 컴퓨터(GPU)에 나누어져 있습니다.
- AdamW는 원격 팀처럼 작동합니다. 컴퓨터 A는 자신의 나사를 고치고, 컴퓨터 B는 자신의 나사를 고치며, 서로 많은 대화를 나눌 필요가 없습니다.
- Muon은 위원회처럼 작동합니다. 하나의 패널을 고치기 위해서, 모든 컴퓨터가 먼저 전체 패 데이터를 모두 확인해야 합니다.
- 단순하게 구현된 Muon의 경우, 모든 컴퓨터가 하던 일을 멈추고, 다른 모든 사람으로부터 전체 데이터를 다운로드한 뒤, 복잡한 수학 계산을 수행하고, 그 결과를 다시 보내야 합니다. 이것은 마치 수많은 사람이 결정을 내리기 전에 1,000페이지짜리 보고서 전체를 읽기 위해 모이는 거대한 회의와 같습니다. 이 과정이 너무 오래 걸려서, "회의"(옵티마이저 단계)가 실제 작업(학습 단계)보다 더 길어지게 됩니다. 실제로 논문에서는 이것이 학습 시간보다 2배 더 많은 시간을 소모할 수 있다고 언급합니다!
해결책: DMuon (Distributed Muon)
X Square 로봇 팀은 Muon을 AdamW만큼 빠르게 실행할 수 있게 만드는 새로운 시스템인 DMuon을 구축했습니다. 그들은 코치의 수학적 방식을 바꾸는 대신, 팀이 일하는 방식을 바꿈으로써 이 문제를 해결했습니다.
그들은 다음 세 가지 기술을 사용하여 병목 현상을 해결했습니다.
1. "전담 전문가" 전략 (소유자 중심 실행)
모든 사람이 모든 패널을 고치려고 노력하는 대신, DMuon은 각 패널에 대해 특정한 한 대의 컴퓨터를 "소유자(Owner)"로 지정합니다.
- 이전: 모두가 데이터를 모으고, 모두가 수학 계산을 수행하며, 모두가 시간을 낭비했습니다.
- 현재: 오직 "소유자" 컴퓨터만이 데이터를 모으고 무거운 수학 계산을 수행합니다. 다른 컴퓨터들은 그저 기다리거나 다른 작업을 수행합니다.
- 비유: 건설 현장을 상상해 보십시오. 모든 작업자가 집 전체를 지으려고 하는 대신, 한 명의 전문가는 지붕을 맡고, 다른 전문가는 배관을 맡습니다. 다른 작업자들은 지붕을 만들려고 시도하지 않고, 단지 전문가에게 필요한 도구를 전달할 뿐입니다. 이를 통해 중복 작업을 방-지합니다.
2. "컨베이어 벨트" 시스템 (통신 중첩)
"소유자"가 수학 계산을 수행하는 동안, 다른 컴퓨터들은 그저 가만히 앉아 있는 것이 아닙니다. DMuon은 파이프라인을 만듭니다:
- 순전파 (Forward Pass): 로봇이 "생각하는"(데이터를 처리하는) 동안, 시스템은 백그라운드에서 다음 세트의 도구들을 전문가들에게 조용히 전달합니다.
- 역전파 (Backward Pass): 로보가 "실수로부터 배우는" 동안, 시스템은 이미 전문가를 위한 다음 배치(batch) 데이터를 모으고 있습니다.
- 비유: 이것은 레스토랑 주방과 같습니다. 요리사(소유자)는 채소를 다듬고 있습니다. 웨이터가 다음 주문을 가져오기 전까지 기다리는 대신, 요리사가 채소를 다듬는 동안 웨이터는 이미 다음 주문을 가져옵니다. 기다리는 시간은 채소를 다듬는 시간 속에 숨겨집니다.
3. "스마트 조립 라인" (배칭 및 튜닝)
Muon이 수행하는 수학 계산은 복잡합니다. 때로는 조각들이 거대하고(거대한 벽), 때로는 아주 작습니다(작은 타일).
- 문제: 거대한 기계로 아주 작은 타일을 처리하려고 하면 기계가 놀게 됩니다. 반대로 거대한 벽을 처리하려고 하면 시간이 너무 오래 걸립니다.
- 해결: DMuon은 많은 작은 타일들을 하나의 "배치(batch)"로 묶어 기계가 계속 돌아가도록 합니다. 또한, 각 특정 모양의 타일에 대해 가장 빠른 처리 방법을 자동으로 찾아내는 "튜너(tuner)"를 사용합니다.
- 비유: 봉투 하나를 배달하기 위해 트럭을 보내는 대신, DMuon은 트럭 한 대를 가득 채울 만큼의 봉투가 모일 때까지 기다렸다가 한꺼번에 보냅니다. 또한 목적지가 도시인지 농장인지에 따라 트럭의 경로를 변경합니다.
결과
논문은 Wall-OSS(로봇 훈련 모델)와 Qwen2.5(언어 모델)를 포함한 실제 세계의 모델에 대해 DMuon을 테스트했습니다.
- 속도: DMuon은 기존의 단순한 방식보다 "옵티마이저 단계"(회의)를 6배에서 163배 더 빠르게 만들었습니다.
- 효율성: 한 단계를 훈련하는 총 시간은 이제 표준적인 AdamW 방식보다 겨우 2% 느릴 뿐입니다.
- 결론: DMuon을 통해 팀은 막대한 시간 손실 없이도 Muon의 우수한 "그룹 치료" 학습 방식을 사용할 수 있습니다. 이는 느리고 투박한 과정을 매끄럽고 효율적인 프로세스로 바꾸어, 거대 AI 모델을 위한 실무 적용을 가능하게 합니다.
요약하자면, DMuon은 가장 똑똑한 코치(Muon)가 컴퓨터 고속도로에서 교통 체증을 일으키지 않고 달릴 수 있게 해주는 교통 제어 시스템이며, 마침내 차세대 AI를 훈련하는 것을 실용적으로 만들어 줍니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.