MAPLE: MoE Adaptive Plug-and-play Layer-wise Expert allocation
MAPLE은 가중치 수정이나 재학습 없이도 민감도에 따라 레이어 전반에 걸쳐 전문가 예산을 이질적으로 분석적 및 유전적으로 재할당함으로써 사전 학습된 MoE(Mixture-of-Experts) 모델의 효율성을 최적화하는 플러그 앤 플레이 프레임워크입니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
현대 인공지능은 종종 트랜스포머(Transformer)라고 불리는 거대한 디지털 두뇌에 의존하며, 이는 언어를 처리하기 위해 긴 레이어의 사슬을 통해 정보를 전달합니다. 이 레이어들을 모델이 문맥, 문법, 의미를 이해하도록 학습하는 일련의 처리 스테이션이라고 생각할 수 있습니다. 최근 몇 년 동안 엔지니어들은 '전문가 혼합(Mixture-of-Experts)'이라는 설계를 사용하여 이러한 모델을 더욱 효율적으로 만들었습니다. 모든 스테이션이 동일한 양의 컴퓨팅 파워를 사용하는 대신, 모델은 텍ền을 읽을 때마다 소수의 특화된 하위 네트워크, 즉 '전문가(experts)'만을 활성화합니다. 이를 통해 시스템은 실행하는 데 불가능한 수준의 에너지를 요구하지 않으면서도 매우 거대하고 유능해질 수 있습니다. 그러나 기존에는 이 전문가들이 사용되는 방식에 있어 표준적인 규칙이 존재했습니다. 즉, 각 레이어가 실제로 그 정도의 도움이 필요한지 여부와 상관없이, 체인의 모든 레이어가 정확히 동일한 수의 전문가를 활성화하도록 강제되었습니다.
브리스톨 대학교의 연구진은 이 균일한 규칙에 도전하며, AI 모델의 각 레이어가 매우 서로 다른 필요를 가지고 있다고 제안했습니다. 어떤 레이어는 매우 민감하여 제대로 기능하기 위해 많은 전문가를 필요로 하는 반면, 어떤 레이어는 중복적이며 정확도를 잃지 않고도 훨씬 적은 수의 전문가로 작동할 수 있습니다. 그들은 'MAPLE'이라 불리는 새로운 방법을 개발했는데, 이는 플러그 앤 플레이(plug-and-play) 도구처럼 작동합니다. 즉, 기존의 사전 학습된 모델을 재학습하거나 내부 가중치를 변경할 필요 없이 적용할 수 있다는 의미입니다. 이 시스템은 먼저 각 레이어의 전문가 수를 줄였을 때 성능이 얼마나 떨어지는지를 테스트하는 방식으로 작동합니다. 그런 다음 이 측정값을 사용하여 커스텀 지도를 생성함으로써, 여유가 있는 레이어로부터 컴퓨팅 예산을 가져와 가장 필요한 레이어로 자원을 재배치합니다.
이 접근 방식의 결과는 놀랍습니다. 연구진이 네 가지 서로 다른 대규모 언어 모델에 대해 MAPLE을 테스트했을 때, 기존의 자원을 단순히 재분배하는 것이 모든 자원을 균등하게 사용하는 것보다 더 효과적이라는 것을 발견했습니다. DeepSeek-MoE-16B라는 모델을 사용한 특정 테스트에서, 이 새로운 방법은 가용 전문가의 75%만 사용하면서도 원래의 전체 로드 모델보다 더 뛰어난 성능을 보여주었습니다. 여러 추론 벤치마크에서 정확도가 크게 향상되었는데, 예를 들어 과학 질의응답 작업에서는 점수가 65.09에서 71.40으로 뛰었고, 논리 추론 테스트에서는 48.49에서 51.50으로 상승했습니다. 이는 균일성이라는 오래된 가정이 모델을 제약하고 있었음을 입증하며, 노력의 더 스마트하고 불균형한 배분이 더 나은 결과를 낳는다는 것을 보여줍니다.
더 똑똑한 답변을 얻는 것을 넘어, 이 방법은 모델을 더 빠르고 저렴하게 실행할 수 있게 해줍니다. 더 적은 수의 전문가가 활성화되기 때문에, 컴퓨터는 질문에 답할 때마다 수행해야 할 작업량이 줄어듭니다. 연구진이 실제 서비스 시스템에 MAPLE을 구현했을 때, 단일 그래픽 카드에서 응답을 생성하는 데 걸리는 시간이 32.2% 감소했음을 측정했습니다. 동시에, 시스템은 초당 47.4% 더 많은 요청을 처리할 수 있었습니다. 이러한 이점은 모델의 핵심 구조를 변경하거나 학습된 지식을 버리지 않고도 달성되었습니다. 시스템은 단순히 기존의 부품들을 더 효율적으로 사용하는 법을 배운 것입니다. 연구진은 이러한 개선이 특정 테스트의 우연한 결과가 아니라, 다양한 유형의 추론 작업과 모델의 규모 확장 또는 축소 시에도 유지되는 견고한 발견임을 확인했습니다.
또한 이 연구는 모델이 문제를 해결하기 위해 긴 사고의 사슬을 생성해야 하는 복잡한 다단계 추론 과제를 어떻게 처리하는지도 탐구했습니다. 이러한 까다로운 시나리오에서도 재배치된 모델은 정확도를 유지하면서 문제를 해결하는 데 필요한 총 시간을 일부 사례에서 절반 이상 단축했습니다. 연구진은 이 방법이 다양한 모델에 적용될 수 있을 만큼 유연하며, 생성된 할당 계획은 매번 다시 계산할 필요 없이 다양한 작업에 재사용될 수 있음을 보여주었습니다. 일률적인 접근 방식이 최선이 아님을 증명함으로써, 이 연구는 대규모 인공지능 시스템을 더 효율적이고 강력하며 실전 배포가 가능하도록 만드는 실용적이고 원칙적인 방법을 제시합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.