← 최신 논문
💻 computer science

MatrixFSDP: communication-free matrix optimizers under ZeRO-3 parameter sharding

MatrixFSDP는 각 2D 가중치 행렬이 단일 랭크에 완전히 존재하도록 파라미터 배치를 재구성함으로써, 메모리 효율성을 유지하면서도 최적화 단계 중 비용이 많이 드는 행렬 재구성을 제거하고 상당한 지연 시간 감소를 달성하여 ZeRO-3 샤딩 하에서 Muon과 같은 행렬 옵티마이저를 통한 통신 프리 대규모 학습을 가능하게 합니다.

원저자: Ming Gao, Yanwu Xu, Hao Zhang

게시일 2026-07-08✓ Author reviewed
📖 3 분 읽기☕ 가벼운 읽기

원저자: Ming Gao, Yanwu Xu, Hao Zhang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 거대한 로봇 팀(컴퓨터 클러스터)에게 소설을 쓰는 법을 가르치려 한다고 상상해 보세요. 로봇들은 방대한 텍스트가 담긴 책 한 권으로부터 함께 학습하고 있습니다. 이를 효율적으로 수행하기 위해, 그들은 Muon이라고 불리는 특별한 "학습 규칙"을 사용합니다.

문제점: "전체 그림" vs "퍼즐 조각"

보통 로봇들이 학습할 때는 거대한 책을 아주 작은 퍼즐 조각들로 나눕니다. 각 로봇은 책의 몇 페이지(샤드, shard)만을 가집니다. 이는 단 하나의 로봇도 책 전체를 다 들고 있을 필요가 없게 만들어 메모리를 절약하는 데 매우 효과적입니다. 이 방법을 ZeRO-3라고 부릅니다.

하지만 Muon 학습 규칙은 조금 까다롭습니다. 이 규칙은 한 번에 몇 페이지씩 나누어 학습하는 것을 원하지 않습니다. 완벽하게 제 역할을 수행하기 위해서는, 단어들 사이의 관계를 이해할 수 있도록 전체 2D 페이지(전체 행렬)를 한꺼번에 봐야만 합니다.

충돌 지점:

  • ZeRO-3는 말합니다: "우리에게는 퍼즐 조각들뿐이야."
  • Muon은 말합니다: "나는 학습을 위해 전체 페이지가 필요해."

기존의 해결책들 (나쁜 옵션들):

  1. "재구성(Reconstruction)" 방식: 로봇들이 학습할 때마다 모든 작업을 멈추고, 모든 로봇으로부터 퍼즐 조각들을 모아 전체 페이지를 다시 붙이고, Muon이 학습하게 한 뒤, 즉시 페이지를 다시 찢어서 분해합니다.
    • 단점: 이것은 마치 사람들이 작업을 하다가 계속 멈춰 서서, 거대한 직소 퍼즐을 조립했다가 다시 해체하는 과정을 반복하는 것과 같습니다. 매 단계마다 엄청난 양의 시간과 에너지(통신 비용)를 낭비하게 됩니다.
  2. "전체 복사(Full Copy)" 방식: 조각을 나누는 대신, 모든 로봇이 책 전체의 복사본을 하나씩 가집니다. Muon은 즉시 학습할 수 있습니다. 모두가 전체 그림을 가지고 있기 때문입니다.
    • 단점: 이 방식은 너무 많은 메모리를 요구하며, 책이 너무 커지면 로봇들의 두뇌(GPU)가 폭발해 버립니다. 즉, 공간이 부족해지는 것입니다.

새로운 해결책: MatrixFSDP

이 논문의 저자들은 MatrixFSDP라는 영리한 제3의 길을 찾아냈습니다. 그들은 학습 규칙(Muon)을 바꾸지도 않았고, 모두에게 전체 책을 들고 있으라고 강요하지도 않았습니다. 대신, 누가 책을 들고 있을지를 바꿨습니다.

비유: "전담 사서"

도서관에서 책들이 보통 조각조각 나뉘어 여러 사서들에게 분배되어 있다고 상상해 보세요.

  • MatrixFSDP의 아이디어: 모든 "페이지"(행렬)에 대해, 그 페이지를 담당할 특정 사서 한 명을 **"소유자(Owner)"**로 임명합니다.
    • 소유자완전하고 전체적인 페이지를 통째로 가집니다.
    • 그 외의 다른 사서들은 해당 페이지에 대해서는 아무것도 가지지 않습니다(빈 공간).
    • 특별한 Muon 규칙이 필요 없는 나머지 부분들에 대해서는 기존의 "퍼즐 조각" 방식을 그대로 유지합니다.

실제 작동 방식:

  1. 학습 중 (Optimizer 단계): "소유자"는 이미 전체 페이지를 가지고 있기 때문에, Muon이 즉시 학습할 수 있습니다. 누구도 조각을 모으거나 무엇인가를 붙일 필요가 없습니다. 마치 사서가 자신의 책상 위에 놓인 책을 바로 읽는 것과 같습니다. 통신이 전혀 필요하지 않습니다.
  2. 읽기/쓰기 중 (Forward/Backward Pass): 로봇들이 책을 읽거나 써야 할 때, 일시적으로 조각들을 다시 모아 작업을 수행한 뒤, 즉시 다시 "소유자"의 슬롯으로 되돌려 놓습니다.

이것이 왜 중요한가

이 논문은 이 접근 방식이 거대 AI 모델을 훈련할 때 발생하는 가장 큰 병목 현상을 해결한다고 주장합니다.

  • 속도: "붙이고 찢는" 과정을 멈췄기 때문에 학습 단계가 믿을 수 없을 정도로 빨라졌습니다. 단일 컴퓨터 노드에서는 4.2배 더 빨라졌습니다. 8개의 노드로 구성된 대규모 클러스터에서는 54.6배 더 빨라졌는데, 이는 기존 방식이 컴퓨터 간에 데이터를 주고받는 네트워크 과정에서 시간을 낭비했던 반면, MatrixFSDP는 데이터를 로컬에 유지했기 때문입니다.
  • 메모리: "전체 복사" 방식과 달리, MatrixFSDP는 여전히 "퍼즐 조각" 방식의 메모리만 사용합니다. 덕분에 "전체 복사" 방식으로는 감당할 수 없는 거대한 모델도 훈련할 수 있게 해줍니다.
  • 정확도: 그들은 "소유자"가 전체를 모았을 때와 동일한 데이터를 얻기 때문에, 학습 결과가 완벽하고 느린 방식과 동일하다는 것을 증명했습니다.

요약

MatrixFSDP는 팀을 재편성하는 것과 같습니다. 즉, 특정 업무를 수행하기 위해 전체 문서가 필요한 사람에게 실제로 그 전체 문서를 들려주는 것입니다. 그 외의 사람들은 해당 작업에 대해 아무것도 들고 있지 않습니다. 이를 통해 데이터를 끊임없이 주고받는 수고를 덜어줌으로써, 더 큰 책상(더 많은 메모리)을 필요로 하지 않으면서도 팀이 훨씬 더 빠르게 일할 수 있게 만듭니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →