← 최신 논문
💬 NLP

Folding Tensor and Sequence Parallelism for Memory-Efficient Transformer Training & Inference

본 논문은 가중치 및 토큰 쉐이딩을 단일 장치 축으로 통합하여 매개변수 및 활성화 메모리 오버헤드를 동시에 감소시키는 새로운 실행 전략인 텐서 및 시퀀스 병렬성 (TSP) 을 소개하며, 이는 긴 컨텍스트 및 메모리 제약이 있는 트랜스포머 모델의 학습 및 추론을 위한 하드웨어 효율적인 대안을 제공합니다.

원저자: Vasu Shyam, Anna Golubeva, Quentin Anthony

게시일 2026-04-30
📖 4 분 읽기☕ 가벼운 읽기

원저자: Vasu Shyam, Anna Golubeva, Quentin Anthony

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

친구들과 함께 거대한 퍼즐을 풀고 있다고 상상해 보세요. 하지만 작업할 수 있는 테이블 (컴퓨터의 메모리) 은 매우 작습니다. 퍼즐이 너무 커서 한 사람이 모든 조각을 한 번에 들고 있을 수 없습니다.

이 논문은 거대한 AI 모델 (본질적으로 이러한 거대한 퍼즐들) 을 훈련시키기 위해 컴퓨터들 (GPU) 팀이 협력하는 새로운 방식을 소개합니다. 저자들은 이 새로운 전략을 **TSP(텐서 및 시퀀스 병렬성)**라고 명명했습니다.

간단한 비유를 사용한 상세한 설명은 다음과 같습니다:

문제: 작업을 공유하는 두 가지 구식 방법

퍼즐을 풀기 위해 팀은 보통 두 가지 구식 방법 중 하나를 사용하지만, 둘 다 결함이 있습니다:

  1. "가중치 분할" 방법 (텐서 병렬성):
    퍼즐 조각이 게임의 "규칙" (모델의 가중치) 이라고 상상해 보세요. 이 방법에서는 규칙 책을 반으로 잘라냅니다. A 사람은 규칙의 첫 번째 절반을 들고, B 사람은 두 번째 절반을 듭니다.

    • 장점: 규칙 책을 두 번 저장하지 않으므로 테이블 위 공간을 절약할 수 있습니다.
    • 단점: 퍼즐에 긴 이야기 (긴 단어 시퀀스) 가 있다면, 모든 사람이 게임을 하기 위해 여전히 전체 이야기를 손에 들고 있어야 합니다. 이야기가 거대하면 손 (메모리) 이 가득 차서 시스템이 충돌합니다.
  2. "이야기 분할" 방법 (시퀀스 병렬성):
    퍼즐 조각이 이야기 자체라고 상상해 보세요. 이 방법에서는 A 사람이 이야기의 첫 번째 절반을 들고, B 사람은 두 번째 절반을 듭니다.

    • 장점: 한 번에 전체 이야기를 들고 있지 않으므로 테이블 위 공간을 절약할 수 있습니다.
    • 단점: 모든 사람이 여전히 전체 규칙 책을 암기해야 합니다. 규칙 책이 거대하면 뇌 (메모리) 가 가득 차서 시스템이 충돌합니다.

구식 하이브리드: 보통 팀은 두 개의 별도 친구 그룹을 사용하여 둘 다 수행하려고 시도합니다. 한 그룹은 규칙을 분할하고, 다른 그룹은 이야기를 분할합니다. 하지만 이는 비효율적입니다. 작업을 분할하기 위해 친구들을 모두 소진시켜 버려서 데이터 병렬성 (Data Parallelism) 과 같은 다른 작업을 도와줄 사람이 남지 않기 때문입니다.

해결책: "접힌" 방법 (TSP)

저자들은 말합니다: "왜 두 개의 별도 그룹을 사용합니까? 작업을 단일 축으로 접어봅시다."

TSP에서는 그룹의 모든 사람이 동시에 두 가지 일을 모두 수행합니다:

  • 그들은 규칙 책의 조각 (가중치) 을 들고 있습니다.
  • 그들은 이야기의 조각 (시퀀스) 을 들고 있습니다.

비유:
저녁 파티에 있다고 상상해 보세요.

  • 구식 방식: 한 테이블에서는 한 사람이 메뉴 (가중치) 를 돌리면서 모두가 전체 책을 읽습니다. 다른 테이블에서는 사람들이 책 (이야기) 을 돌리면서 모두가 전체 메뉴를 암기합니다.
  • TSP 방식: 테이블에 있는 모든 사람이 메뉴의 작은 조각 그리고 이야기의 작은 조각을 얻습니다.

작동 방식 (마법 같은 기술)

모두가 메뉴의 작은 조각과 이야기의 작은 조각을 가지고 있기 때문에, 퍼즐을 완성하려면 서로 많이 대화해야 합니다. 논문은 그들이 압도되지 않고 이를 수행하는 두 가지 교묘한 방법을 설명합니다:

  1. "이야기" 부분 (Attention) 에 대해:
    그룹이 특정 문장을 이해하기 위해 전체 이야기를 알아야 한다고 상상해 보세요. 모두가 한 번에 전체 이야기를 외치는 대신, 차례로 합니다. 한 사람이 자신의 메뉴 조각을 모두에게 브로드캐스트합니다. 그런 다음, 모두가 자신의 이야기 부분을 계산하고, 전체 맥락을 재구성하기 위해 이야기 조각 (키와 값) 을 빠르게 교환합니다. 이는 달리는 동안 배턴 (데이터) 을 넘기는 릴레이 경주와 같습니다.

  2. "규칙" 부분 (MLP) 에 대해:
    그룹이 이야기 조각에 서로 다른 규칙을 적용해야 한다고 상상해 보세요. 규칙을 외치기 위해 멈추는 대신, 규칙 책 페이지를 원형 (링) 으로 돌립니다. A 사람이 1 페이지로 수학을 수행한 후, B 사람이 2 페이지를 C 사람에게 전달하는 동안 1 페이지를 B 사람에게 전달합니다. 페이지가 이동하는 동안 모두 수학에 바쁩니다. 이는 "교통"이 움직이는 동안 "작업"이 완료되도록 유지합니다.

왜 이것이 더 나은가요?

이 논문은 TSP 가 현대 컴퓨터 칩이 서로 통신하는 방식에 맞춰 설계된 "하드웨어 인식" 솔루션이라고 주장합니다.

  • 메모리 절약: 모두가 규칙의 조각 그리고 이야기의 조각을 가지고 있기 때문에 각 컴퓨터에 필요한 메모리가 크게 감소합니다. 이로 인해 팀은 메모리가 부족해지지 않고 훨씬 더 긴 이야기 (긴 컨텍스트) 를 처리할 수 있습니다.
  • 속도: 그들은 더 많은 데이터를 왕복으로 전송하므로 (더 느린 것처럼 들림) 그렇게 하더라도 생각과 겹치는 방식으로 수행합니다. "전송"이 "생각"하는 동안 발생하므로 총 소요 시간은 크게 길어지지 않습니다.
  • 방에 들어맞음: 컴퓨터 클러스터에서 가장 빠른 연결은 일반적으로 동일한 기계의 칩 사이 (같은 테이블에 앉은 사람들) 입니다. 더 느린 연결은 다른 기계 사이 (다른 방에 있는 사람들) 입니다.
    • 구식 방법들은 종종 팀을 다른 방으로 분할하게 하여 속도를 늦췄습니다.
    • TSP 는 전체 "분할" 팀이 단일 기계 (한 테이블) 에 들어갈 수 있게 하여, 그들이 고속 차선에 머물게 합니다.

결과

저자들은 1,024 개의 강력한 GPU(MI300X) 로 구성된 거대한 클러스터에서 이를 테스트했습니다.

  • 메모리: TSP 는 특히 이야기가 매우 길 때 모든 테스트에서 가장 적은 양의 메모리를 사용했습니다.
  • 속도: TSP 는 구식 방법만큼 빠르거나 더 빨랐습니다.
  • 확장성: 그룹에 더 많은 컴퓨터를 추가함에 따라 TSP 는 계속 잘 수행되었지만, 구식 방법들은 메모리 제한으로 인해 어려움을 겪기 시작했습니다.

요약하자면: TSP 는 컴퓨터 팀을 조직하는 더 지혜로운 방법입니다. "규칙"과 "이야기"를 별도의 그룹으로 나누는 대신, 이를 결합하여 모든 컴퓨터가 둘 다 조금씩 갖도록 합니다. 이는 공간을 절약하고, 더 긴 이야기를 허용하며, 팀이 동일한 고속 네트워크에서 효율적으로 작업하도록 유지합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →