TEMPO: Makespan-Aware Expert-Parallel Load Balancing Across Memory- and Compute-Bound Regimes
TEMPO는 메모리 및 연산 제한 영역(memory- and compute-bound regimes) 전반에 걸친 비선형 전문가 실행 시간을 모델링하여 토큰 분포를 동적으로 최적화함으로써, 기존의 선형 개수 기반 방식이 실패하는 혼합 영역 시나리오에서 최대 15.5%의 처리량 향상과 상당한 지연 시간 감소를 달나성하는 메이크스팬 인지형 전문가 병렬 부하 분산 디스패처를 도입한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 잠들지 않는 도시를 위해 거대하고 고속인 피자 배달 서비스를 운영하고 있다고 상상해 보십시오. 당신에게는 동일한 배달 기사들(GPU)의 함대와 수백 명의 다양한 전문 요리사들("전문가" - AI 모델의 전문가)이 있는 중앙 주방이 있습니다. 고객이 피자를 주문할 때마다, 시스템은 어떤 요리사가 피자를 만들고 어떤 기사가 완성된 피자를 가져갈지 결정해야 합니다. 인공지능의 세계, 구체적으로 "전문가 혼합(Mixture-of-Experts, MoE)"이라 불리는 유형의 모델에서는 정확히 이런 일이 일어납니다. 이 모델들은 수천 개의 작고 전문화된 하위 뇌로 이루어진 거대한 뇌와 같습니다. AI가 생각할 때, 한 번에 전체 뇌를 사용하는 것이 아니라, 작업을 처리하기 위해 몇몇 특정 전문가를 선택합니다.
큰 과제는 전체 팀이 동일한 속도로 움직이게 유지하는 것입니다. 만약 한 명의 기사가 거대하고 복잡한 주문을 맡게 되어 다른 모든 사람이 놀고 있다면, 전체 배달이 지연됩니다. 수년 동안 작업 부하를 균형 있게 맞추기 위한 표준 규칙은 간단했습니다: "주문 수를 균등하게 나누라." 만약 100개의 주문이 있다면, 10명의 기사에게 각각 10개씩 주는 식입니다. 이는 사과 더미를 똑같이 나누는 것처럼 논리적으로 보였습니다. 하지만 어떤 사과는 무거운 돌이고 어떤 사과는 가벼운 깃털이라면 어떨까요? 또는 주방에 새로운 요리사를 호출하는 데 주문의 양과 상관없이 고정된 시간이 걸린다는 규칙이 있다면 어떨까요? 기존의 규칙들은 시간이 항상 주문의 수와 직접적으로 연결되어 있다고 가정했습니다. 이 논문은 그 가정이 틀렸다면 어떨지 묻습니다.
KlingAI에서 연구한 이 논문의 저자들은 기존의 "주문 수 세기" 규칙이 사실은 함정이라는 것을 발견했습니다. 그들은 현대 AI 하드웨어에서 전문가를 처리하는 데 걸리는 시간이 단순히 그 전문가가 보는 토큰(단어 또는 데이터 조각)의 수에 의라 결정되지 않는다는 것을 발견했습니다. 그것은 두 얼굴을 가진 괴물입니다. 때때로, 시간은 메모리 뱅크에서 전문가의 "레시피(가중치)"를 불러오는 순수한 노력, 즉 주문의 크기와 상관없이 일정하게 소요되는 시간에 의해 지배됩니다. 다른 때에는 일단 레시피가 로드되면, 시간은 주문의 수에 따라 선형적으로 증가합니다. 오직 주문의 수만 바라보던 기존 방식들은 레시피를 불러오는 데 드는 숨겨진 비용을 놓치고 있었습니다. 그들은 무게를 재는 대신 개수를 세는 방식으로 깃털과 돌이 섞인 더미를 균형 잡으려 했던 것입니다.
이 문제를 해결하기 위해 팀은 TEMPO(Time-modeled Expert-Parallel Optimization)라는 새로운 디스패처를 구축했습니다. 토큰의 수를 세는 대신, TEMPO는 주방의 물리 법칙을 이해하는 스마트한 교통 통제관처럼 작동합니다. TEMPO는 요리사의 레시피를 불러오는 데 정확히 얼마나 걸리는지, 그리고 피자를 요리하는 데 얼마나 걸리는지를 측정하는 특수한 "비용 모델"을 사용합니다. TEM-PO는 만약 "차가운" 전문가(한동안 사용되지 않은 전문가)가 있다면, 그 작은 주문을 두 명의 기사에게 나누는 것이 재앙이라는 점을 깨닫습니다. 왜냐하면 "로딩 비용"을 두 번 지불해야 하기 때문입니다. 하지만 산더미 같은 주문을 가진 "뜨거운" 전문가라면, 나누는 것이 괜찮습니다.
논문은 TEMPO가 단순히 추측하는 것이 아니라, 밀리초 단위로 모든 요청 배치에 대해 완벽한 균형을 계산한다는 것을 보여줍니다. 연구진은 실제 AI 모델에 테스트를 진행했고, 기존 방식들이 종로 15% 더 느리거나 줄 끝에 서 있는 마지막 몇 명의 고객에게 상당한 지연을 초래한다는 것을 발견했습니다. 그러나 TEMPO는 줄을 매끄럽게 계속 움직이게 합니다. 이는 "모두가 똑같은 수의 사과를 가져라"라는 규칙에서 "모두가 똑같은 양의 일을 해라(어떤 사과는 무겁고 어떤 요리사는 깨어나는 데 시간이 걸린다는 점을 고려하여)"라는 규칙으로 전환하는 것과 같습니다.
연구진은 이 새로운 방법이 정확히 어디에서 작동하고 어디에서 작동하지 않는지를 보여주기 위해 매우 신중했습니다. 그들은 만약 "뜨거운" 전문가들이 너무 많아서 시스템이 순수한 데이터의 양에 의해 압도당하는 상황(컴퓨트 바운드 영역)이라면, 기존의 토큰 카운팅 방식이 실제로 괜찮다는 것을 증명했습니다. 하지만 일부 전문가는 바쁘고 다른 전문가는 쉬고 있으며, "로딩 비용"이 높은 실제 세상에서는 TEMPO가 빛을 발합니다. 그들은 심지어 AI 교통을 위한 일기예보와 같은 "위상도(phase diagram)"를 그려서, 새로운 방법이 시간을 절약할 때와 기존 방법이 충분히 좋을 때를 정확히 예측했습니다.
결국, 이 논문은 단지 더 빠른 알고리즘에 관한 것이 아니라, AI에서 작업의 균형을 맞추는 방식에 대한 우리의 생각을 바꾸는 것에 관한 것입니다. 이는 현대의 복잡하고 고속인 AI 세계에서는 단순히 사물을 세는 것만으로는 부족하다는 것을 가르쳐 줍니다. 데이터를 이동시키는 숨겨진 비용과 작업의 구체적인 형태를 이해해야 합니다. 데이터의 양을 세는 대신 작업을 수행하는 데 걸리는 실제 시간을 측정함으로써, TEMPO는 AI 모델을 더 빠르고 효율적이며 미래의 막대한 수요를 감당할 수 있게 만듭니다. 이는 혼란스러운 주방을 잘 돌아가는 기계로 바꾸어, 피자가 히팅 램프 아래에서 기다리고 있는 동안 어떤 기사도 허송세월하지 않도록 보장합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.