← 최신 논문
🤖 machine learning

Unifying Local Communications and Local Updates for LLM Pretraining

본 논문은 로컬 업데이트를 희소한 가십 기반 피어 통신과 결합하여 동기식 All-Reduce 방식의 대역폭 및 이질성 병목 현상을 극복하는 새로운 분산형 사전 학습 알고리즘인 GASLoC을 소개하며, 이는 동질적 및 이질적 네트워크 환경 모두에서 DiLoCo와 같은 최첨단 방식과 대등하거나 더 우수한 성능을 달성합니다.

원저자: Pietro Cagnasso, Eugene Belilovsky, Edouard Oyallon

게시일 2026-06-10
📖 3 분 읽기☕ 가벼운 읽기

원저자: Pietro Cagnasso, Eugene Belilovsky, Edouard Oyallon

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

거대한 문제: "가장 느린 작업자"라는 병목 현상

당신이 32명의 예술가(이들은 컴퓨터 작업자들입니다)와 함께 거대한 벽화를 그리려고 한다고 상Imagine 해보세요. 벽화의 일관성을 유지하기 위해, 모든 예술가는 몇 분마다 한 번씩 자신의 구역을 다른 모든 사람의 구역과 비교하기 위해 멈춰야 합니다. 그들은 원형으로 모여서 서로 손을 잡고, 각자의 색상을 외쳐서 모두의 색상을 평균 내는 방식으로 이 작업을 수행합니다. 이것을 All-Reduce라고 부릅니다.

완벽한 세상이라면 모든 사람이 같은 속도로 그림을 그릴 것입니다. 하지만 현실 세계에서는 어떤 예술가는 손이 느리거나, 페인트 통이 무겁거나, 인터넷 연결이 불안정할 수 있습니다. 현재의 "외치기" 방식에서는 모든 사람이 다음 단계로 넘어가기 전에 가장 느린 예술가를 기다려야 합니다. 만약 한 명의 예술가가 느리다면, 팀 전체가 아무것도 하지 못한 채 서서 시간을 낭비하게 됩니다.

기존의 해결책: "가십(Gossip)" 방식

연구자들은 분산 학습(또는 가십)이라고 불리는 다른 접근 방식을 시도해 왔습니다. 예술가들이 커다란 원형으로 모이는 대신, 바로 옆에 있는 이웃들과만 대화하는 방식입니다. 예술가 A는 B와 대화하고, B는 C와 대화하는 식입니다. 정보는 소문처럼 그룹 전체에 서서히 퍼져나갑니다.

문제는 이 기존의 가십 방식이 효과적으로 학습하기에는 너무 느린 경우가 많다는 점입니다. "소문"은 왜곡되기 쉽고, 결국 팀은 엉망이고 일관성 없는 벽화를 그리게 됩니다. 또한, 대부분의 기존 가십 방식은 오늘날 거대한 AI 두뇌를 훈련하는 데 사용하는 현대적이고 복잡한 도구(옵티마이저)들과 잘 맞지 않습니다.

새로운 해결책: GASLoC

이 논문의 저자들은 GASLoC라는 새로운 방법을 소개합니다. 이것은 두 방식의 장점을 결합한, 훨씬 스마트하고 유연한 방식의 팀 조직법이라고 생각하면 됩니다.

GASLoC가 어떻게 작동하는지 세 가지 간단한 아이디어로 나누어 설명하겠습니다.

1. "로컬 휴식" (Local Steps)

붓질 한 번을 할 때마다 멈춰서 대화하는 대신, 예술가들은 "로컬 휴식"을 가질 수 있습니다. 즉, 누군가와 확인 절차를 거치기 전에 스스로 일정 구간의 벽을 다 그리는 것(여러 번의 로컬 업데이트 수행)입니다. 이는 계속해서 대화를 위해 멈추지 않아도 되기 때문에 시간을 크게 절약해 줍니다.

2. "무작위 악수" (Sparse Peer Communication)

확인할 시간이 되었을 때, 그들은 큰 원형으로 모이지 않습니다. 대신 무작위 악수 시스템을 사용합니다.

  • 어떤 라운드에서 예술가 A는 예술가 B와 악수를 할 수 있습니다.
  • 다음 라운드에서 예술가 A는 예술가 C와 악수를 할 수 있습니다.
  • 그들은 한 번에 한 명 또는 두 명의 사람하고만 대화합니다.

이 방식은 큰 원형으로 모이는 것보다 훨씬 빠릅니다. 설령 예술가 A가 느리더라도, 팀 전체가 아니라 오직 B나 C만을 기다리면 됩니다. "소문"은 결국 그룹 전체로 퍼지지만, 훨씬 더 효율적으로 전달됩니다.

3. "모멘텀 코치" (Outer Optimizer)

이것이 핵심 비결입니다. 기존의 가십 방식에서는 팀이 단순히 색상을 평균 냈습니다. 하지만 GASLoC에는 "코치"(모멘텀이 있는 외부 옵티마이저)가 추가되었습니다.

  • 코치는 팀이 어제 어디를 향해 가고 있었는지를 기억합니다.
  • 예술가들이 로컬 업데이트를 공유할 때, 코치는 그 기억을 사용하여 그들의 경로를 수정합니다.
  • 이 덕분에 팀이 한 번에 몇 명의 사람하고만 대화하더라도 방향을 잃지 않고 올바른 길을 유지할 수 있습니다. 이는 "소문"이 너무 왜곡되는 것을 방지합니다.

이것이 왜 중요한가 (결과)

이 논문은 이 방법을 대규모 AI 모델(LLM) 훈련에 테스트하였고, 두 가지 주요 성과를 발견했습니다.

  1. 완벽한 세상에서의 속도: 모두의 인터넷이 빠를 때도, GASLoC는 기존의 가장 좋은 방법들만큼 학습 능력이 뛰어나면서도, 무겁고 느린 "큰 원형" 모임을 필요로 하지 않습니다.
  2. 엉망인 세상에서의 초능력: 이것이 핵심입니다. 한 예술가의 인터넷 연결이 매우 느리다고 가정해 봅시다(이런 사람을 "스트래글러/느린 작업자"라고 합니다).
    • 기존 방식: 팀 전체가 그 느린 예술가를 기다리며 멈춥니다. 빠른 예술가들은 아무것도 하지 못한 채 그냥 서 있게 됩니다.
    • GASLoC: 빠른 예술가들은 자신들의 로컬 구역을 계속 그려 나갑니다. 느린 예술가는 따라잡기 위해 수행해야 하는 "로컬 단계"를 더 적게 수행하도록 허용됩니다. 빠른 예술가들이 느린 사람을 기다릴 필요가 없기 때문에, 팀 전체가 훨씬 더 빠르게 벽화를 완성합니다.

요약

GASLoC는 마치 가장 느린 사람을 기다리는 대신, 각자의 속도에 맞춰 일하게 하고, 한 번에 몇 명의 이웃하고만 대화하며, 모두가 정렬될 수 있도록 스마트한 코치를 사용하는 화가 팀과 같습니다. 이는 거대 AI 모델 훈련을 더 빠르고, 저렴하며, 일부 컴퓨터가 느려지더라도 훨씬 더 탄력적으로 만들어 줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →