Compute-Optimal Is Not Cluster-Optimal: Systems-Aware Scaling for Sparse Mixture-of-Experts
이 논문은 최적의 희소성(sparsity)이 전통적인 연산 최적화 스케일링 법칙만으로는 달성될 수 없으며, 모델 아키텍처를 하드웨어 제약 조건과 함께 공동으로 최적화할 때만 나타난다는 것을 보여주는 시스템 인지형 공동 설계 프레임워크인 MOSAIC을 소개한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 궁극의, 가장 강력한 로봇 두뇌를 만들려고 노력하고 있다고 상상해 보세요. 인공지능의 세계에서 이 "두뇌"는 거대한 컴퓨터 프로그램인 대규모 언어 모델(LLM)입니다. 이러한 두뇌를 더 똑똑하게 만들기 위해, 과학자들은 단순한 규칙을 발견했습니다: 더 많은 데이터를 제공하고 규모를 키우면 세상에 대한 이해도가 높아진다는 것입니다. 이 규칙을 "스케일링 법칙(scaling law)"이라고 부릅니다. 오랫동안 이러한 두뇌를 만드는 레시피는 두 개의 별개 단계로 나뉘어 있었습니다. 먼저, 수학자는 가용 가능한 컴퓨터 연산량(이를 "컴퓨트(compute)"라고 부릅니다)을 바탕으로 두뇌의 완벽한 크기를 결정합니다. 그다음, 다른 엔지니어가 그 두뇌를 특정 컴퓨터 칩에 밀어 넣어 최대한 빠르게 실행되도록 만듭니다.
이것은 자동차 여행을 계획하는 것과 비슷하다고 생각해보세요. 첫 번째 단계는 연료 예산에 따라 얼마나 멀리 운전할지를 결정하는 것입니다. 두 번째 단계는 차를 고르는 것입니다. 하지만 만약 당신이 고른 차가 너무 무겁고 투박해서 연료를 엄청나게 잡아먹는다면, 원래 계획했던 만큼 멀리 가지 못하게 될 수도 있습니다. 이것이 바로 이 논문이 다루는 문제입니다. 이 논문은 두뇌의 크기를 먼저 정한 다음 나서서 자동차를 걱정해도 된다고 주장합니다. 당신은 두뇌와 자동차를 함께 설계해야 합니다. 왜냐하면 두뇌의 형태가 자동차가 얼마나 효율적으로 달릴 수 있는지를 바꾸기 때문입니다. 만약 자동차의 엔진을 무시한다면, 당신은 너무 무거워서 움직이지 못하는 "완벽한" 두로를 갖게 되어 출발선에 갇혀 버릴 수도 있습니다.
문제점: 들어가지 않는 "완벽한" 두뇌
이 논문은 MOSAIC(Model Optimization via Systems-Aware TraIning Co-design)라는 새로운 사고방식을 소개합니다. Amazon AGI Foundations에서 일하는 저자들은 기존의 방식이 기회비용을 낭비하고 있다는 점을 발견했습니다. 전통적으로 연구자들은 "컴퓨트 최적(Compute-Optimal)" 모델을 계산하곤 했습니다. 이는 주어진 컴퓨터 연산량 내에서 최고의 결과를 얻을 수 있는 모델 크기를 의미하며, 모든 전력이 완벽하게 사용된다고 가정합니다.
하지만 저자들은 숨겨진 함정을 발견했습니다. 그들은 **혼합 전문가(Mixture-of-Experts, MoE)**라고 불리는 특수한 AI 아키텍처에 주목했습니다. 이것은 거대한 도서관을 상상하는 것과 같습니다. 모든 책을 읽는 한 명의 거대한 사서 대신, 수천 명의 작고 전문화된 전문가들이 있는 것입니다. 질문이 들어오면 스마트한 라우터가 질문을 처리하기 위해 단 몇 명의 전문가(예를 들어 100명 중 2명)에게만 보냅니다. 이 방식은 모든 도서관을 깨울 필요가 없기 때문에 매우 빠르고 효율적입니다.
기존의 수학은 모델을 최대한 크게 만들고, 깨우는 전문가의 수는 최소화해야 한다고 제안했습니다. 즉, "최적의" 모델은 극도로 희소(sparse)해야 한다는 것입니다(대부분 비어 있는 상태). 즉, 단순히 "계산량이 얼마나 필요한가?"라는 순수 수학적 관점에서만 본다면, 정답은 항상 "가능한 한 가장 희소하게 만들어라"가 됩니다. 수학적으로는 최적의 희소성이 가능한 경계 지점에 있습니다.
반전: 자동차 엔진이 중요하다
여기서 이야기가 바뀝니다. 저자들은 수학이 "매우 희소하게 만들어라"라고 말할지라도, 컴퓨터 칩이라는 물리적 현실은 "안 된다"라고 말한다는 것을 깨달았습니다.
수천 명의 작은 전문가가 있는 모델의 경우, 컴퓨터는 어떤 전문가를 깨울지 결정하고 정보를 전달하는 데 많은 추가 작업을 수행해야 합니다. 이는 마치 거대한 사무실 건물에서 매니저가 업무를 수행하는 시간보다 메모를 전달하기 위해 칸막이 사이를 뛰어다니는 데 시간을 더 많이 쓰는 것과 같습니다. 모델이 더 희소해질수록, 컴퓨터는 실제 사고(계산)를 하는 데 쓰는 시간보다 이러한 "돌아다니는" 작업(통신 비용이라고 불림)에 더 많은 시간을 낭비하게 됩니다.
논문은 기존의 "컴퓨트 최적" 수학이 결함이 있다고 주장합니다. 왜냐하면 컴퓨터가 연산력의 100%를 실제 사고하는 데 사용할 수 있다고 가정했기 때문입니다. 실제로 매우 희소한 모델은 컴퓨터 전력의 8%만을 실제 사고에 사용하고, 약간 더 밀도가 높은 모델은 15%를 사용할 수도 있습니다.
해결책: MOSAIC
이를 해결하기 위해 팀은 MOSAIC을 구축했습니다. "정해진 양의 수학적 계산을 위한 최적의 모델은 무엇인가?"라고 묻는 대신, 그들은 "우리 특정 컴퓨터 클러스터에서 정해진 시간 내에 실제로 실행할 수 있는 최적의 모델은 무엇인가?"라고 물었습니다.
그들은 두 가지를 결합했습니다:
- 스케일링 법칙(Scaling Law): 모델의 크기와 형태에 따라 모델이 얼마나 똑똑해질지를 예측합니다.
- 성능 모델(Performance Model): "돌아다니는" 비용을 고려하여 실제 하드웨어에서 모델이 얼마나 빨리 실행될지를 예측하는 시뮬레이터입니다.
MOSAIC을 실행했을 때 결과는 놀라웠습니다. "완벽한" 모델은 극단적인 희소성을 가진 모델이 아니었습니다. 대신, 최적의 모델은 내부적인(interior) 해답, 즉 적절한 절충안이었습니다. 그것은 효율적일 만큼 희소하면서도, 컴퓨터가 그 수많은 작은 전문가들을 관리하느라 과부하에 걸리지 않을 만큼의 밀도를 유지했습니다.
그들이 발견한 것
팀은 NVIDIA B200 GPU를 사용하여 실제 하드웨어에서 테스트를 진행했습니다. 그들은 활성 파라미터 7억 개에서 180억 개(총 파라미터 최대 790억 개)에 이르는 모델을 테스트했습니다.
- 기존 방식: 만약 기존의 수학을 그대로 따랐다면, 희소도가 약 0.985(즉, 전문가의 98.5%가 잠들어 있는 상태)인 모델을 선택했을 것입니다. 하지만 그들의 특정 클러스터에서 이 모델은 너무 느려서 학습에 시간이 너무 오래 걸릴 것이며, 실제로 약간 더 밀도가 높은 모델보다 덜 똑똑해질 것입니다.
- MOSAIC 방식: 시스템은 약 0.96의 희소도가 최적의 지점임을 찾아냈습니다. 이 모델은 "이론적"으로는 최고가 아닐지 모르지만, "실질적"으로는 최고였습니다. 이 모델은 더 빠르게 실행되었고, 컴퓨터의 전력을 더 효율적으로 사용했으며, 이론적 최적 모델보다 더 낮은 오차율(즉, 더 똑똑함)을 달しまいました.
사실, 그들은 종이 위에서 가장 좋아 보였던 모델(가장 많은 "Model FLOPs"를 가진 모델)이 실제 생활에서는 가장 느리게 학습된다는 것을 보여주었습니다. 승리한 모델은 수학과 하드웨어의 현실 사이에서 균형을 잡은 모델이었습니다.
이것이 중요한 이유
이 논문은 AI 모델의 설계와 그 모델을 실행하는 컴퓨터의 설계를 별개의 단계로 취급하는 것을 멈춰야 한다고 시사합니다. 단순히 모델 크기를 정하고 컴퓨터가 이를 감당할 수 있기를 바랄 수는 없습니다. 모델의 형태가 컴퓨터의 동작 방식을 바꿉니다.
저자들은 자신들의 연구 결과가 사용된 특정 컴퓨터 칩(NVIDIA B200)과 특정 소프트웨어에 국한된다는 점을 주의 깊게 명시했습니다. 그들은 우주의 모든 컴퓨터에 적용되는 보편적인 법칙을 발견한 것은 아닙니다. 그러나 그들은 프런티어 AI 학습에서 "시스템"(하드웨어 및 데이터 이동 방식)을 무시하는 것이 최적이 아닌 결과를 초래한다는 것을 증м했습니다.
MOSAIC을 사용하여, 그들은 "최적의" 모델이 그래프 위의 고정된 점이 아니라, 당신의 특정 하드웨어 예산에 따라 변하는 움직이는 목표라는 것을 보여주었습니다. 가장 효율적인 모델은 당신의 클러스터에 장갑처럼 딱 맞는 모델이지, 종이 위에 가장 좋아 보이는 모델이 아닙니다. 이것은 "컴퓨트 최적(Compute-Optimal)"에서 "클러스터 최적(Cluster-Optimal)"으로의 전환입니다.
요약하자면, 가능하다면 가장 똑똑한 AI를 만들고 싶다면, 단순히 더 큰 두뇌를 갖는 것만으로는 부족합니다. 당신이 살아가게 될 몸(하드웨어)에 꼭 맞는 두뇌가 필요합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.