← 최신 논문
💬 NLP

MoE-Prism: Disentangling Monolithic Experts for Elastic MoE Services via Model-System Co-Designs

MoE-Prism은 단일 구조의 전문가(expert)를 세밀한 하위 전문가(sub-expert)로 분해하고 kk-aware 런타임을 구현함으로써, 혼합 전문가(Mixture-of-Experts, MoE) 서빙에서 요청 수준의 컴퓨팅 탄력성을 가능하게 하여 이질적인 워크로드에 대해 처리량을 크게 향상시키고 지연 시간을 단축하는 모델-시스템 공동 설계 프레임워크이다.

원저자: Xinfeng Xia, Xiaofeng Hou, Jiacheng Liu, Wenfeng Wang, Mingxuan Zhang, Peng Tang, Chao Li, Minyi Guo

게시일 2026-08-11
📖 4 분 읽기☕ 가벼운 읽기

원저자: Xinfeng Xia, Xiaofeng Hou, Jiacheng Liu, Wenfeng Wang, Mingxuan Zhang, Peng Tang, Chao Li, Minyi Guo

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 거대한 디지털 두뇌인 '대규모 언어 모델(LLM)'에 의해 쓰인 책들이 가득한, 거대하고 똑똑한 도서관을 운영하고 있다고 상상해 보십시오. 이 두뇌들은 매일 더 커지고 똑똑해지고 있지만, 그만큼 전기와 컴퓨터 자원을 엄청나게 갈구합니다. 이를 더 빠르고 저렴하게 운영하기 위해 과학자들은 '전문가 혼합(Mixture-of-Experts, MoE)'이라는 영리한 기술을 발명했습니다. MoE 모델을 하나의 거대한 두뇌가 아니라, 함께 협력하는 여러 명의 작은 전문가 팀이라고 생각하십시오. 질문을 던지면 시스템은 전체 팀을 모두 깨우는 대신, 해당 주제에 가장 적합한 몇 명의 특정 전문가만을 호출합니다. 이는 마치 사서에게 도서관 전체를 당신의 책상으로 끌고 오는 대신 '공상 과학 소설' 섹션에서 책만 가져오라고 요청하는 것과 같습니다.

하지만 여기에는 함정이 있습니다. 현재 이러한 시스템은 다소 경직되어 있습니다. 당신이 "오늘 날씨 어때?"와 같은 간단한 질문을 하든, "이 50페이지짜리 법률 계약서를 분석해 줘"와 같은 복형적인 질문을 하든, 시스템은 종종 똑같은 수의 전문가를 깨웁니다. 이는 마치 액자 하나를 걸기 위해 건설 현장 인부 전체를 고용하거나, 마천루를 짓기 위해 단 한 명의 인턴을 보내는 것과 같습니다. 이는 쉬운 작업에는 에너지를 낭비하고, 어려운 작업에는 충분한 힘을 주지 못하게 만듭니다. 큰 질문은 이것입니다. 우리가 이 AI 팀을 더 유연하게 만들어, 작업의 난이도에 따라 전문가의 수를 조절할 수 있으면서도 시스템을 빠르고 효율적으로 유지할 수 있을까요?

이것이 바로 MOE-PRISM을 개발한 연구자들이 해결하고자 했던 문제입니다. 그들은 MoE처럼 전문가의 수를 "조절"한다는 아이디어가 훌륭하다는 것을 깨달았지만, 현재의 기술로는 이를 부드럽게 수행하기에 너무 투박하다는 것을 알게 되었습니다. 그들은 기존 시스템이 각 전문가를 거대하고 나눌 수 없는 하나의 '벽돌'처럼 취급한다는 것을 발견했습니다. 즉, 벽돌의 절반을 사용할 수는 없다는 것입니다. 만약 전력이 조금 덜 필요하다면, 전문가 한 명을 통째로 제거해야 하는데, 이는 답변의 품질을 크게 떨어뜨리는 급격한 변화를 초상합니다. 또한, 시스템이 동시에 많은 요청을 처리하려고 할 때(마치 바쁜 도서관처럼), 시스템은 모든 요청을 하나로 묶어 모두에게 가장 높은 설정을 적용함으로써, 배치 크기를 유지하기 위해 쉬운 요청에도 에너지를 낭비하는 경향이 있습니다.

이 문제를 해결하기 위해 연구팀은 MOE-PRISM이라는 새로운 프레임워크를 구축했습니다. 그들은 '모델'(두뇌 자체)과 '시스템'(도서관 관리자)이라는 두 가지 측면에서 접근했습니다.

첫째, 모델 측면에서, 그들은 거대한 '전문가 벽돌'을 더 작고 미세한 조각들로 나누는 방법을 발명했습니다. 커다란 치즈 덩어리를 가져와 작은 큐브 모양으로 썰어내는 것을 상상해 보십시오. 그들은 AI의 내부 뉴런(전문가 내부의 작은 처리 단위)이 작동할 때 어떻게 빛나는지를 관찰함으로써 이 작업을 수행했습니다. 그들은 어떤 특정 작업에 대해서는 이 뉴런들의 특정 부분 집합만이 정말 중요하다는 것을 발견했습니다. 그래서 그들은 전문가들을 더 작은 '서브 전문가(sub-experts)'로 쪼개어, 이 중요한 뉴런들을 함께 묶었습니다. 이를 통해 시스템은 12개 또는 13개의 온전한 전문가를 선택해야 하는 강요 없이, 예를 들어 12.5개의 서브 전문가를 선택할 수 있게 되었습니다. 이는 전체 AI를 처음부터 다시 학습시킬 필요 없이, 컴퓨팅 파워를 조절할 수 있는 훨씬 더 부드러운 '다이얼'을 제공합니다.

둘째, 시스템 측면에서, 그들은 더 똑똑한 '도서관 관리자'를 만들었습니다. 단순히 모든 요청을 하나의 큰 더미로 던져 넣고 모두에게 가장 높은 설정을 적용하는 대신, 이 새로운 관리자는 필요한 전력량이 비슷한 요청들을 그룹화합니다. 쉬운 질문들이 많이 들어오면, 낮은 전력 설정으로 함께 처리됩니다. 어려운 질문들이 들어오면, 그들만의 높은 전력 그룹을 갖게 됩니다. 이는 배치를 채우기 위해 쉬운 작업에 과도한 서비스를 제공하여 에너지를 낭비하는 것을 방지합니다. 또한, 그들은 컴퓨터 그래픽(CUDA 그래프)을 효율적으로 처리하는 특별한 '교통 관제사'를 구축하여, 다양한 설정 속에서도 시스템이 메모리 문제로 인해 느려지지 않도록 했습니다.

연구팀이 세 가지 인기 있는 AI 모델에 대해 MOE-PRISM을 테스트했을 때, 결과는 유망했습니다. 미세한 입도의 전문가와 스마트한 스케줄링을 사용함으로써,서버가 처리할 수 있는 '전력 설정'의 수를 4배로 늘릴 수 있음을 발견했습니다. 테스트 결과, 오프라인 작업의 경우 처리량(throughput)이 33.9% 향상되었습니다. 혼합된 워크로드를 다루는 온라인 작업의 경우, 첫 번째 단어가 나오는 시간(Time-to-First-Token)을 단축했습니다.

이 논문은 이러한 접근 방식이 단순히 전기 요금을 아끼는 것뿐만 아니라, AI를 더 적응 가능하게 만든다고 시사합니다. 이는 당신이 AI의 내부 구조를 '재구성'하고 작업 스케줄링을 '재고'함으로써, 비용을 낭비하거나 속도를 늦추지 않고도 어려운 작업에는 컴퓨팅 파워를 높이고 쉬운 작업에는 줄일 수 있는 '탄력적인' 단일 AI 모델을 가질 수 있음을 증명합니다. 현재 테스트는 두 개의 그래픽 카드를 사용하는 특정 설정에서 수행되었지만, 이 결과는 AI의 내부 구조를 재편하고 작업 스케줄링을 다시 생각하는 것이 실제 세상에서 더 효율적이고 유연한 AI를 향한 중요한 진전이 될 수 있음을 나타냅니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →