← 최신 논문
🤖 machine learning

Understanding and Improving Communication Performance in Multi-node LLM Inference

본 논문은 멀티 노드 LLM 추론에 대한 성능 연구를 제시하며, all-reduce 연산을 주요 병목 현상으로 규명하고 NVSHMEM 을 활용한 계층적 all-reduce 알고리즘인 NVRAR 을 도입하여 Llama 3.1 405B 와 같은 대규모 모델의 경우 표준 NCCL 구현체 대비 지연 시간을 현저히 줄이고 종단 간 성능을 향상시킵니다.

원저자: Prajwal Singhania, Siddharth Singh, Lannie Dalton Hough, Akarsh Srivastava, Harshitha Menon, Charles Fredrick Jekel, Abhinav Bhatele

게시일 2026-05-21
📖 3 분 읽기☕ 가벼운 읽기

원저자: Prajwal Singhania, Siddharth Singh, Lannie Dalton Hough, Akarsh Srivastava, Harshitha Menon, Charles Fredrick Jekel, Abhinav Bhatele

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

거대한 복잡한 퍼즐을 풀려고 한다고 상상해 보세요. 인공지능 세계에서는 이 퍼즐이 '대형 언어 모델'(LLM)입니다. 이는 이야기를 쓰고, 질문에 답하며, 문제를 해결할 수 있는 초지능 컴퓨터 두뇌입니다. 이러한 두뇌가 커지고 똑똑해질수록, 단일 컴퓨터가 감당하기엔 너무 무거워집니다.

이를 해결하기 위해 과학자들은 퍼즐 조각들을 여러 컴퓨터(노드라고 부름)에 분산시켜 함께 작동하도록 합니다. 이 논문은 이러한 컴퓨터들이 시간을 낭비하지 않고 서로 효율적으로 대화할 수 있는 방법을 규명하는 것에 관한 것입니다.

연구자들이 발견하고 구축한 내용을 간단히 정리해 보겠습니다:

1. 문제: '전화 놀이' 병목 현상

컴퓨터들이 함께 작동할 때는 끊임없이 정보를 공유해야 합니다.

  • 설정: 퍼즐을 풀려고 하는 32 명의 사람들(GPU) 팀을 상상해 보세요. 이들은 그룹(노드) 으로 나뉩니다. 그룹 내부에서는 서로에게 즉시 외칠 수 있습니다(NVLink 라는 초고속 내부 워크ie-talkie 를 사용하는 것처럼). 하지만 다른 그룹과 대화하려면 더 느리고 장거리 전화선(노드 간 네트워크) 을 사용해야 합니다.
  • 문제점: 연구자들은 컴퓨터들이 퍼즐의 '디코딩'(한 번에 한 단어씩 생성하는) 부분을 풀려고 할 때 서로에게 매우 작은 메시지를 보내야 한다는 사실을 발견했습니다.
  • 비유: 릴레이 경주를 한다고 상상해 보세요. 다음 주자에게 작은 쪽지를 전달하기 위해 긴 거리를 달려야 하고, 쪽지를 받는 사람이 느리다면 대부분의 시간을 기다리는 데 보내게 됩니다. 논문은 표준 '전화선' 소프트웨어(NCCL) 가 서로 다른 건물(노드) 간의 작고 빈번한 쪽지를 처리하는 데 매우 부적합하다는 것을 발견했습니다. 즉, 즉시 비밀 악수를 전달해야 할 때 느린 우편 서비스를 통해 엽서를 보내려는 것과 같습니다.

2. 비교: 팀을 조직하는 두 가지 방법

연구자들은 팀을 조직하는 두 가지 주요 방식을 테스트했습니다:

  • 텐서 병렬화 (TP): 모두가 동시에 퍼즐의 같은 부분을 작업하지만, 의견을 일치시키기 위해 서로에게 끊임없이 확인을 해야 합니다. 이는 큰 작업 덩어리에 적합하지만, 모든 확인 과정(통신) 으로 인해 속도가 느려집니다.
  • 하이브리드 병렬화 (HP): 퍼즐을 큰 덩어리로 나누고 각 덩어리를 다른 사람에게 할당합니다. 이는 확인 과정을 줄이지만, '단어별' 생성 작업에는 효율성이 떨어집니다.

발견: 작업의 '단어별' 부분(대부분의 시간 동안 발생하는 부분) 에서는 TP가 일반적으로 더 좋지만, 오직 팀이 서로 충분히 빠르게 대화할 수 있는 경우에만 해당됩니다. 표준 대화 방식은 너무 느려 팀이 멈추게 만들었습니다.

3. 해결책: NVRAR( '전용 차선')

느린 통신을 해결하기 위해 연구자들은 NVRAR이라는 새로운 도구를 구축했습니다.

  • 작동 원리: 느린 표준 우편 서비스를 사용하는 대신, NVSHMEM 이라는 기술을 사용하여 맞춤형 '전용 차선'을 구축했습니다.
  • 비유: 옛 방식은 도장을 찍고 분류하며 트럭이 배달해야 하는 편지를 보내는 것과 같습니다. NVRAR 은 한 사람에서 다른 사람으로 직접 날아와 쪽지를 떨어뜨리고 즉시 회신을 받아오는 전용 드론을 가진 것과 같습니다.
  • '재귀적 배가' 트릭: 그들은 모든 단계에서 대화하는 사람의 수를 두 배로 늘리는 '전화 놀이' 게임처럼 통신을 조직했습니다. 모든 사람이 한 명씩 대화하는 대신, 짝을 지어 합치고, 다시 짝을 지어 합치는 방식을 반복합니다. 이는 대규모 그룹에게 훨씬 빠릅니다.

4. 결과: 팀 속도 향상

이 새로운 '전용 차선'(NVRAR) 을 시스템에 연결했을 때:

  • 더 빠른 대화: 이러한 AI 작업에 사용되는 작은 메시지의 경우, 새 시스템은 표준 시스템보다 1.9 배에서 3.6 배까지 빠릅니다.
  • 더 나은 퍼즐 해결: 이 새로운 시스템을 사용하여 거대한 'Llama 3.1 405B'모델(거대 AI 두뇌) 을 실행했을 때, 답변을 생성하는 데 걸리는 시간이 크게 줄었습니다. 어떤 경우에는 팀이 이전보다 1.72 배 더 빠르게 작업을 완료했습니다.
  • 실제 테스트: 그들은 실제 세계의 트래픽(수천 명의 사용자가 질문하는 것을 시뮬레이션) 에서 이를 테스트하여 시스템이 속도가 느려지지 않고 초당 더 많은 요청을 처리할 수 있음을 발견했습니다.

요약

이 논문은 본질적으로 거대한 컴퓨터 팀이 AI 퍼즐을 풀려고 할 때, 가장 큰 지연은 '생각'이 아니라 '대화'라는 점을 깨닫는 것에 관한 것입니다. 서로 다른 건물 간의 표준 대화 방식은 작고 빈번한 메시지에 필요한 속도에 비해 너무 느렸습니다. 저자들은 팀이 즉시 협력하여 퍼즐을 훨씬 더 빠르게 풀 수 있도록 즉각적인 전용 차선 역할을 하는 맞춤형 고속 통신 시스템(NVRAR) 을 구축했습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →