Heterogeneous Parallelism for Multimodal Large Language Model Training
본 논문은 단일 그래프 내 다양한 모듈에 대해 독립적인 텐서 병렬성 레이아웃을 가능하게 하여 모달리티별 확장 불일치를 해결하고 최적화된 공존 실행을 통해 GPU 당 TFLOPS 를 최대 49.3% 향상시키는 멀티모달 대규모 언어 모델 학습을 위한 이종 병렬성 프레임워크를 소개한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
상상해 보세요. 보고, 듣고, 읽을 수 있는 초지능 로봇을 훈련시키려 한다고 가정해 봅시다. 이를 위해서는 두 가지 매우 다른 유형의 "뇌"를 결합해야 합니다:
- 인코더 (Encoder): 이 부분은 전문 카메라나 마이크와 같습니다. 이미지나 소리를 처리하는 데 뛰어나지만, 특정 크기로 고정된 데이터 덩어리와 함께 작동할 때 가장 효과적입니다.
- 대규모 언어 모델 (LLM): 이는 거대한 언어 뇌입니다. 이 모델은 방대한 양의 텍스트를 한 번에 읽어야 하며, 효율성을 위해 작업을 조직하는 방식이 매우 다릅니다.
문제: "일률적"인 정장
과거에 이러한 결합된 로봇을 훈련시킬 때, 엔지니어들은 두 뇌 모두에게 정확히 동일한 "제복"(여러 컴퓨터에 작업을 분할하는 특정 방식) 을 강요했습니다.
이는 배관공과 전기공이 정확히 동일한 포메이션으로 일하도록 강요받는 건설 현장과 같습니다.
- 전기공 (LLM) 은 전선을 빠르게 전달하기 위해 거대한 원으로 서야 합니다 (텐서 병렬화라는 기술).
- 배관공 (인코더) 은 파이프가 짧고 고정되어 있으므로 작은 쌍으로만 일하면 됩니다.
만약 배관공을 전기공의 거대한 원 안에 서게 한다면, 그들은 전선을 전달하는 전기공이 끝날 때까지 모든 시간을 기다리며 보냅니다. 그들은 배관 작업을 하지 않고 그냥 서 있는 것입니다. 이는 전체 프로젝트의 속도를 늦춥니다.
해결책: "이종 병렬화 (Heterogeneous Parallelism)"
이 논문은 이종 병렬화라는 새로운 방식으로 건설 인력을 조직하는 방법을 소개합니다. 모두를 하나의 제복에 강요하는 대신, 같은 건물에서 일하더라도 각 팀이 자신에게 가장 잘 맞는 제복을 입도록 합니다.
이 시스템은 "인코더" 팀과 "LLM" 팀이 다음을 할 수 있게 합니다:
- 작업을 다르게 분할: LLM 은 거대한 컴퓨터 원을 사용할 수 있는 반면, 인코더는 긴밀한 쌍을 사용합니다.
- 자신의 자리를 선택: 공간과 시간을 가장 많이 절약하는 방법에 따라 같은 컴퓨터 (하드웨어 공유) 에 앉거나 완전히 다른 컴퓨터에 앉을 수 있습니다.
마법의 트릭: "번역기"
두 팀이 서로 다른 방식으로 일하게 하는 가장 어려운 부분은 그들 사이에서 정보를 전달하는 것입니다. 인코더가 "작은 쌍" 형식으로 작업을 완료했지만, LLM 은 "거대한 원" 형식을 기대한다면 데이터가 왜곡됩니다.
저자들은 특별한 번역기 (경계 통신기, Boundary Communicator) 를 구축했습니다.
- 순방향 전달 (전달): 인코더가 작업을 마치면, 번역기는 즉시 데이터를 LLM 이 필요로 하는 형식으로 재구성합니다. 이는 작은 상자를 가져와 큰crate 으로 다시 포장한 후 LLM 팀에게 전달하는 택배원과 같습니다.
- 역방향 전달 (귀환): LLM 이 실수에서 배울 때, 피드백을 되돌려 보냅니다. 번역기는 그 피드백을 받아 인코더가 이해하는 작은 형식으로 다시 분해하여 반환합니다.
이를 통해 팀들이 서로 다른 방식으로 일하더라도 데이터나 학습 과정을 잃지 않도록 보장합니다.
앉는 두 가지 방법: "공존 (Colocated)" 대 "비공존 (Non-Colocated)"
이 논문은 이러한 팀들을 배치하는 두 가지 방식을 테스트합니다:
공존 (같은 책상 공유):
- 상황: 인코더와 LLM 이 동일한 컴퓨터 세트에 맞습니다.
- 이점: 인코더를 LLM 의 비효율적인 원 안에 앉히지 않고, 시스템이 인코더가 같은 컴퓨터 위에서 자신의 효율적인 쌍으로 앉도록 합니다.
- 결과: 이는 같은 주방에 셰프와 부셰프가 있는 것과 같습니다. 셰프는 채소를 썰고 (인코더), 부셰프는 수프를 저어줍니다 (LLM). 서로 방해하지 않으며, 아무도 기다리지 않기 때문에 주방은 최대 49% 더 빠르게 운영됩니다.
비공존 (별도의 방):
- 상황: 인코더가 너무 거대하거나 (또는 LLM 이 메모리를 너무 많이 요구하여) 공간 부족 없이 같은 컴퓨터를 공유할 수 없습니다.
- 이점: 시스템은 인코더를 완전히 별도의 방 (별도의 컴퓨터 세트) 으로 이동시킵니다. 이는 인코더가 공간을 차지하지 않도록 하여 LLM 의 방을 자신의 필요에 맞게 완벽하게 배치할 수 있게 합니다.
- 결과: 이는 무거운 기계를 별도의 창고로 옮겨 메인 사무실을 최대 효율을 위해 조직하는 것과 같습니다. 이는 단어 처리의 전체 속도를 최대 13% 향상시켰습니다.
증명
저자들은 이것이 작동할 것이라고 추측만 한 것이 아니라, 이를 테스트했습니다.
- 그들은 "번역기"가 수학을 망치지 않는다는 것을 증명했습니다. 로봇은 이전과 정확히 같은 속도와 정확도로 학습하지만, 더 빠릅니다.
- 그들은 작은 인코더의 경우 컴퓨터를 공유하는 것 (공존) 이 최선임을 보여주었습니다.
- 그들은 거대한 인코더의 경우 별도의 방으로 이동하는 것 (비공존) 이 최선임을 보여주었습니다.
요약
이 논문은 AI 훈련에 대한 "일률적"인 접근 방식을 중단하는 것에 관한 것입니다. AI 시스템의 서로 다른 부분이 자신의 특정 작업에 가장 효율적인 방식으로 일하도록 허용하고, 그들 사이에서 데이터를 전달하기 위해 스마트한 번역기를 구축함으로써, 시스템은 훨씬 더 빠르게 훈련되고 더 적은 컴퓨터 전력을 사용합니다. 이는 결국 배관공과 전기공을 강제로 동조하여 행진하게 하는 대신, 그들이 자연스러운 포메이션으로 일하도록 하는 것과 같습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.