← 최신 논문
🤖 machine learning

HetCCL: Enabling Collective Communication For Mixed-Vendor Heterogeneous Clusters

letCCL은 호스트-디바이스 카피 프리(copy-free) P2P 전송, 벤더 독립적인 보더 커뮤니케이터(border-communicator) 메커니즘, 그리고 계층적 토폴로지 추상화를 도입함으로써 이기종 벤더 혼합 클러스터에서 효율적인 집단 통신을 가능하게 하는 새로운 프레임워크로, Gloo보다 최대 19배 높은 대역폭을 달성하고 LLM 학습을 16.9% 가속화한다.

원저자: Yuejie Wang, Tao Chang, Yuanyuan Zhao, Yulong Ao, Zeyu Gu, Zhiyu Li, Yanmin Jia, Yan Zhang, Mingjun Zhang, He Liu, Yongzhe He, Yonghua Lin, Guyue Liu

게시일 2026-06-01
📖 3 분 읽기☕ 가벼운 읽기

원저자: Yuejie Wang, Tao Chang, Yuanyuan Zhao, Yulong Ao, Zeyu Gu, Zhiyu Li, Yanmin Jia, Yan Zhang, Mingjun Zhang, He Liu, Yongzhe He, Yonghua Lin, Guyue Liu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 초지능형 AI(거대 언어 모델)를 훈련시키기 위해 거대한 글로벌 계주 경기를 조직한다고 상상해 보세요. 과거에는 특정 국가의 주자(NVIDIA와 같은 특정 하드웨어 벤더)들만 사용할 수 있었습니다. 그들은 모두 똑같은 신발을 신고, 같은 언어를 사용하며, 바통을 어떻게 전달해야 하는지 정확히 알고 있었습니다. 덕 달리기는 빠르고 매끄러웠습니다.

하지만 오늘날, 한 국가의 주자들로만 경주를 하는 것은 공급 부족으로 인해 너무 비싸거나 불가능합니다. 그래서 당신은 여러 국가(NVIDIA, AMD, Huawei 등)의 주자들을 섞어서 쓰기로 결정했습니다. 문제는, 이들은 서로 다른 언어를 사용하고, 서로 다른 신발을 신으며, 바통을 서로에게 어떻게 전달해야 할지 몰라 바통을 떨어뜨릴 수도 있다는 점입니다.

이것이 바로 HetCCL이 해결하는 문제입니다. 작동 방식은 다음과 같이 간단한 개념으로 나누어 설명할 수 있습니다.

1. 문제점: "호스트(Host)"의 병목 현상

과형 혼합 경주 시도에서는, A국의 주자가 B국의 주자에게 바통을 전달해야 할 때, 먼저 중앙의 "코치"(CPU)에게 달려가야 했습니다. 코치는 바통을 받아 클립보드에 적은 뒤, 반대편으로 달려가 새로운 주자에게 전달했습니다.

  • 문제점: 이 "코치" 단계는 느립니다. 코치가 앞뒤로 뛰어다니는 데 시간을 낭비하게 만들며, 코치와 주자 사이의 경로는 좁고 붐비는 복도(PCIe 병목 현상)와 같습니다.

2. 해결책: "직통 라인" (P2P 전송)

HetCCL은 바통을 전달하는 새로운 방법을 발명했습니다. 코치를 사용하는 대신, 서로 다른 국가 출신의 주자들 사이에도 직접 연결된 고속 터널을 구축합니다.

  • 작동 방식: HetCCL은 "제어"(언제 달릴지에 대한 지시)는 코치에게 맡기되, "데이터"(실제 바통)는 경주 내내 주자의 손에 머물게 합니다.
  • 비유: 코치가 "출발!"이라는 메시지를 문자로 보낸다고 상상해 보세요. 그러면 주자들은 코치의 사무실을 완전히 건너뛰고, 초고속 터널을 통해 서로에게 직접 바통을 전달합니다. 이는 코치가 앞뒤로 뛰어다니는 느린 시간을 제거합니다.

3. "국경 수비대" 기법 (벤더 독립적 리덕션/Reduction)

때때로 경주는 단순히 바통을 전달하는 것만이 아니라, 정보를 결합하는 과정이기도 합니다. 예를 들어, 주자 A가 숫자 "5"를 가지고 있고 주자 B가 "3"을 가지고 있다면, 다음 단계로 넘어가기 전에 이 둘을 더해 "8"을 만들어야 합니다.

  • 문제점: 각 국가는 서로 다른 계산기를 사용합니다. 주자 A에게 주자 B의 계산기를 사용하라고 요청할 수는 없습니다.
  • 해결책: HetCCL은 "국경 수비대" 시스템을 만듭니다. 이 시스템은 서로 다른 주자들로부터 숫자를 가져와, 표준화된 범용 계산기(각 국가의 기존 소프트웨어에 내장된 것)가 계산을 수행할 수 있는 특정 "국경 스테이션"으로 이동시킵니다. 이는 마치 국경에 만능 통역사가 있어 모두의 덧셈을 대신 해주는 것과 같아서, 아무도 새로운 언어를 배울 필요가 없게 만듭니다.

4. "조립 라인" (계층적 및 파이프라인 설계)

많은 팀이 참여하는 거대한 경주에서, 모든 사람이 이전 팀이 끝날 때까지 기다려야 한다면 경주는 느려질 것입니다.

  • 해결책: HetCCL은 계층적 조립 라인을 구성합니다.
    • 1단계: 같은 국가 내의 주자들이 먼저 로컬 핸드오프(바통 전달)를 마칩니다.
    • 2단계: 그들이 이를 수행하는 동안, "국경 수비대"가 국가 간의 데이터를 전달하기 시작합니다.
    • 3단계: 최종 핸드오프는 다시 국가 내부에서 이루어집니다.
  • 비유: 전체 라인이 멈출 때까지 기다리는 대신, 이전 배치(Batch)가 트랙을 비우는 즉시 다음 배치의 주자들이 움직이기 시작합니다. 이를 통해 "터널"(네트워크 대역폭)이 유휴 상태로 머물지 않고 계속 가득 차서 활발하게 돌아가도록 유지합니다.

무엇을 증명했는가?

연구진은 이 시스템(HetCCL이라 불림)을 구축하고 네 개 회사의 실제 하드웨어로 테스트했습니다. 결과는 다음과 같습니다.

  • 속도: 혼합 경주 시나리오에서, HetCCL은 기존의 "코치" 방식(Gloo)보다 17배에서 19배 더 빨랐습니다.
  • 효율성: 서로 다른 하드웨어를 섞었음에도 불구하고, 마치 모두가 같은 국가 출신인 것처럼 거의 동일한 속도를 달성했습니다.
  • 실제 영향: 이 시스템을 사용하여 AI 모델(Llama 3 등)을 훈련했을 때, 기존 방식보다 스텝당 훈련 속도가 최대 16.9% 더 빨라졌습니다.

요약하자면: HetCCL은 서로 다른 유형의 컴퓨터 칩들이 서로의 속도를 늦추지 않고 하나의 팀으로서 협력할 수 있게 해주는 만능 통역사이자 급행 차선입니다. 이를 통해 더 저렴하고 빠르게 거대한 AI 시스템을 구축할 수 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →