← 최신 논문
💬 NLP

Can Model Merging Improve Aggregation in DiLoCo?

이 논문은 Iso-C 병합 기법에 네스테로프 모멘텀을 적용한 방식(IsoLoCo)이 저대역폭 분산 학습 환경에서, 특히 로컬 워커의 수가 증가함에 따라 기존의 DiLoCo 방식들을 유의미하게 능가한다는 것을 입증함으로써 모델 병합과 분산 학습 사이의 간극을 메웁니다.

원저자: Stefan Horoi, Benjamin Thérien, Guy Wolf, Eugene Belilovsky

게시일 2026-07-07
📖 3 분 읽기☕ 가벼운 읽기

원저자: Stefan Horoi, Benjamin Thérien, Guy Wolf, Eugene Belilovsky

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

거대한, 초지능적인 AI 브레인을 훈련시키려 한다고 상상해 보세요. 이를 위해 엄청난 양의 컴퓨터 연산 능력이 필요합니다. 보통 기업들은 "데이터 병렬(data-parallel)" 방식을 사용합니다. 수백 대의 컴퓨터를 나란히 세워두고, 모두가 정확히 같은 작업을 동시에 수행하며, 서로에게 끊임없이 업데이트 내용을 외치는 방식입니다. 이 방식은 빠르지만, 모든 컴퓨터를 연결하는 비싸고 고속인 케이블이 필요합니다. 만약 컴퓨터 한 대가 느려지거나 케이블 하나가 약해지면, 전체 줄이 기다려야 합니다.

문제점: "섬(Island)" 방식
비용을 절감하고 더 약한 연결을 사용하기 위해, 연구자들은 DiLoCo라고 불리는 방법을 개발했습니다. 이 방식은 컴퓨터들을 하나의 긴 줄 대신 여러 개의 분리된 "섬"으로 만드는 것을 상상해 보세요.

  1. 각 섬은 일정 기간 동안(예를 들어 30단계) 독립적으로 자신만의 AI 브레인을 훈련시킵니다.
  2. 이 30단계 동안 그들은 서로 대화하지 않습니다.
  3. 30단계가 지나면, 그들은 자신이 배운 요약본(하나의 "의사 그래디언트(pseudo-gradient)")을 중앙 허브로 보냅니다.
  4. 허브는 이 요약본들을 평균 내어 메인 브레인을 업데이트합니다.

결함:
논문은 이 "섬" 방식에 결함이 있다는 것을 발견했습니다. 섬(작업자)의 개수가 늘어나거나, 대화하기 전까지 훈련하는 시간이 길어질수록 AI가 혼란을 겪기 시작합니다. 이는 마치 여러 사람이 서로 대화하지 않고 함께 그림을 그리려는 것과 같습니다. 너무 오래 각자 작업하면 서로 다른 것을 그리게 되고, 나중에 결과물을 합치려고 할 때 결과물이 엉망이 됩니다. 기술적인 용어로 말하자면, 서로 다른 섬으로부터 오는 "업데이트"들이 서로 충돌하여 AI의 성능을 저하시키는 것입니다.

영감: 전문가 모델 병합(Merging Expert Models)
별도로, 다른 연구 그룹은 **모델 병합(Model Merging)**에 대해 연구하고 있었습니다. 이탈리아 음식을 배운 전문 셰프와 일본 음식을 배운 또 다른 전문 셰프가 있다고 상상해 보세요. 여러분은 두 가지를 모두 할 수 있는 한 명의 셰프를 원합니다.

  • 과거의 방식: 단순히 그들의 레시피를 평균 내는 것입니다. 이는 종종 실패합니다 (예: 간장과 생크림을 섞는 것처럼 재료가 충돌할 수 있기 때문입니다).
  • 새로운 방식 (태스크 산술(Task Arithmetic)): 레시피 전체를 평균 내는 대신, 전문가의 최종 레시피와 원래의 기본 레시피 사이의 '차이'를 살펴봅니다. 그런 다음 그 차이점들만을 정교하게 결합합니다.

이 논문의 위대한 "아하!(Aha!)" 순간은 DiLoCo가 사실 모델 병합을 반복적으로 수행하고 있는 것이라는 사실을 깨달은 데서 왔습니다.

  • "베이스 모델(Base Model)"은 모두가 마지막으로 대화했을 때의 AI 브레인입니다.
  • "섬(Islands)"은 독자적으로 훈련한 전문가들입니다.
  • 그들이 돌려보내는 "업데이트"는 "차이(또는 태스크 벡터)"입니다.

논문은 DiLoCo가 많은 섬과 함께할 때 엉망이 되는 이유가 모델 병합이 엉망이 되는 이유와 같다고 주장합니다. 즉, 간섭(Interference) 때문입니다. 서로 다른 섬에서 오는 업데이트들이 서로 싸우고 있는 것입니다.

해결책: IsoLoCo
저자들은 DiLoCo를 고치기 위해 모델 병합 세계의 "최고의 레시피"를 빌려오기로 했습니다. 그들은 여러 병합 기술을 테스트했고, **Iso-C(등방성 병합, Isotropic merging)**라고 불리는 기술이 가장 잘 작동한다는 것을 발견했습니다.

Iso-C를 이해하기 쉽게 설명하자면, 업데이트를 위한 "조화기(harmonizer)"와 같습니다. 섬들이 업데이트를 보내올 때:

  1. 조화기는 업데이트의 "모양"을 살핍니다.
  2. 만약 한 섬이 특정 방향(특정한 수학적 방향)으로 너무 크게 소리를 지르고 있다면, 조화기는 그 볼륨을 낮추어 평균에 맞춥니다.
  3. 이는 어떤 단일 섬도 독단적으로 행동하거나 다른 섬들과 충돌하지 않도록 하여, 더 매끄럽고 균형 잡힌 결합 업데이트를 만들어냅니다.

그들은 이 "조화기"에 "모멘텀(momentum)" 기능(길이 울퉁불퉁해도 속도를 유지하는 러너처럼)을 추가하여 IsoLoCo라는 새로운 방법을 만들었습니다.

결과
논문은 다양한 크기의 AI 모델과 다양한 수의 섬(1개에서 128개까지)을 대상으로 테스트를 진행했습니다.

  • 승자: IsoLoCo는 기존의 DiLoCo 방식보다 일관되게 우수한 성능을 보였습니다.
  • 격차: 섬의 개수가 많아질수록 IsoLoCo의 이점이 커졌습니다. 128개의 섬을 사용할 때 기존 방식은 꽤 엉망이 되었지만, IsoLoCo는 깨끗하고 효율적인 상태를 유지했습니다.
  • 속도: 그들은 또한 수학적 지름길(Newton-Schulz 반복법)을 사용하여 품질 저하 없이 훨씬 빠르게 작동하는 IsoLoCo의 "패스트 모드(fast mode)"를 만들었습니다.

요약
이 논문은 분산 AI 훈련을 "전문가들의 병합" 문제로 다룸으로써, 컴퓨터들이 서로 싸우는 것을 막는 고급 수학적 기법을 사용할 수 있음을 보여줍니다. 이를 통해 우리는 거대한 AI 모델을 성능 저하 없이 많은 수의 약하게 연결된 컴퓨터들을 통해 훈련할 수 있으며, 이는 대규모 AI 훈련을 더 저렴하고 확장 가능하게 만듭니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →