← 최신 논문
🤖 machine learning

Sticky Routing: Training MoE Models for Memory-Efficient Inference

이 논문은 StickyMoE를 제안하는데, 이는 미세한 퍼플렉시티 저하를 최소화하면서 엣지 디바이스에서의 메모리 집약적인 가중치 스와핑을 크게 줄이기 위해, 의미론적으로 일관된 토큰 구간 전반에 걸쳐 전문가 할당을 유지하도록 Mixture-of-Experts 모델을 학습시키는 미분 가능한 라우팅 일관성 손실 함수이다.

원저자: Ali Kayyam

게시일 2026-07-13
📖 4 분 읽기☕ 가벼운 읽기

원저자: Ali Kayyam

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신에게 64명의 서로 다른 전문가 사서들이 있는 거대한 도서관이 있다고 상상해 보세요. 하지만 당신의 아주 작은 엣지 디바이스(예: 스마트폰이나 스마트 스피커)에는 책상 위에 한 번에 2명의 사서만 올려둘 수 있는 정도의 공간밖에 없습니다. 나머지 사서들은 느리고 먼지 쌓인 지하실에 보관되어 있습니다.

표준적인 "전문가 혼합(Mixture-of-Experts, MoE)" 모델에서는, AI가 새로운 단어를 읽을 때마다 어떤 사서에게 물어볼지 결정하기 위해 동전을 던집니다. 문제는 이 동전을 매 단어마다 던진다는 것입니다. 그래서 AI는 "사과(apple)"를 위해 사서 A에게 물어본 다음, "파이(pie)"를 위해 사서 B에게 물어보고, "크러스트(crust)"를 위해 사서 C에게 물어봅니다. 매번 바뀔 때마다 AI는 지하실로 달려가서 사서 B를 쫓아내고 사서 C를 끌고 올라와야 합니다. 이렇게 "왔다 갔다 하는" 과정이 너무 느려서, AI는 이야기를 읽는 시간보다 사서를 데려오는 데 더 많은 시간을 쓰게 됩니다.

StickyMoE는 모델이 이렇게 동전을 너무 무작정 던지지 않도록 학습시키는 새로운 방법입니다. 대신 모델은 "끈기 있게(sticky)" 행동하는 법을 배웁니다. 만약 모델이 "사과"를 위해 사서 A에게 물어봤다면, 주제가 논리적으로 이어지는 한 "파이"와 "크러스트"에 대해서도 사서 A에게 계속 물어보도록 권장되는 방식입니다.

핵심 발견: 제대로 훈련시켜라, 나중에 고치려 하지 말고

저자들은 이 "왔다 갔다 하는" 문제를 해결하기 위해 몇 가지 방법을 시도했으며, 다음과 같은 결과를 얻었습니다.

  1. "사후(Post-Hoc)" 수정의 실패: 그들은 이미 훈련된 모델을 가져와서 동전 던지기 메커니즘(라우터)을 덜 무작위적이도록 "미세 조정(fine-tuning)"하는 시도를 했습니다. 이를 ReMoE라고 불렀습니다. 결과는? 실패했습니다. 전환율은 거의 변하지 않았습니다(절대 변화량 0.5% 미만). 저자들은 이미 사서들(전문가들)이 특정하고 고립된 단어들을 위한 전문가로 훈련되었기 때문이라고 주장합니다. 만약 사서들 자체가 긴 연속적인 주제를 다룰 준비가 되어 있지 않다면, 동전 던지기 기계에게 "더 끈기 있게" 행동하라고 말하는 것은 소용이 없습니다. 이는 마치 단거리 선수의 출발 자세만 바꾼다고 해서 그를 마라톤 선수로 만들 수 없다고 말하는 것과 같습니다. 근육(전문가 가중치) 자체가 짧은 폭발력을 위해 만들어졌기 때문입니다.
  2. "강제적(Hard)" 수정의 경직성: 그들은 또한 엄격한 규칙("Hard-Window")을 사용하여 모델이 정해진 단어 수 동안 한 명의 사서에게 붙어 있도록 강제하는 방법도 시도했습니다. 이 방법은 전환을 줄였지만, AI의 답변 품질을 크게 떨어뜨렸습니다(중형 모델에서 퍼플렉시티(perplexity)가 최대 6.8% 증가). 이는 마치 한 사서에게 장르가 완전히 바뀌더라도 소설 한 권을 통째로 읽으라고 강요하는 것과 같았으며, 그 결과 이야기의 질이 저하되었습니다.
  3. "Sticky" 솔루션의 성공: 승리한 방법인 StickyMoE는 훈련의 매우 첫 단계에 부드러운 "일관성 페널티(consistency penalty)"를 추가합니다. 이는 모델에게 이렇게 말하는 것과 같습니다: "이봐, 만약 바로 옆에 있는 두 단어 사이에서 전문가를 바꾼다면, 그것은 약간의 페널티 대상이야." 이를 통해 모델은 언어를 배우는 동시에 '끈기'를 함께 학습하게 됩니다.

결과: 끈기 있는 것이 더 낫다

그들이 WikiText-2 데이터셋(위키피디아 기사 모음)을 사용하여 소형 및 중형 모델에 테스트했을 때, 결과는 명확했습니다.

  • 적은 전환: 단 하나의 노브(λ라고 불리는 숫자)를 조절함으로써, 전문가를 교체하는 횟수를 최대 **59%**까지 줄일 수 있었습니다. 예를 들어, 중형 모델의 경우 전환율이 0.71(거의 매번 전환함)에서 0.29로 떨어졌습니다.
  • 더 나은 속도 (시뮬레이션): 모델이 덜 전환했기 때문에, 2명의 전문가를 담을 수 있는 캐시(책상 선반)를 시뮬레이션했습니다. "캐시 적중률(Cache Hit Rate, 맞는 사서가 이미 책상 위에 있는 비율)"이 0.54에서 0.88로 급증했습니다. 이는 모델이 이전보다 지하실로 달려가야 하는 횟수가 3.92배 적게 된다는 것을 의미합니다.
  • 더 나은 품질: 놀랍게도, 중형 모델에서 적당한 양의 "끈기"(λ = 0.05)를 사용했을 때 AI는 오히려 더 똑똑해졌으며, 퍼플렉시티(혼란도를 나타내는 척도)를 4.1% 낮추었습니다. 모델은 주제에 집중하는 것이 문맥을 이해하는 데 도움이 된다는 것을 배웠습니다.
  • 붕괴 없음: 모델이 게을러져서 하나의 사서만 모든 것에 사용하는 것이 아니냐는 큰 우려가 있었으나, "이용 엔트로피(Utilisation Entropy)"는 높은 수준(최대 2.0 비트 중 1.92 비트 이상)을 유지했습니다. 즉, 4명의 전문가가 여전히 공평하게 사용되고 있었습니다. 모델은 게을러진 것이 아니라, 조직적으로 변한 것입니다.

무엇이 효과가 없었나 (그리고 왜인가)

논문은 모델이 구축된 후에 이 문제를 해결할 수 있다는 생각을 명시적으로 부정합니다. ReMoE 방식(기존 모델을 미세 조정하는 것)은 효과가 없는 것으로 나타났는데, 이는 "전문가 표현(expert representations, 사서들의 뇌)"이 이미 주제를 지속하는 데 신경 쓰지 않는 훈련 과정에 의해 형성되었기 때문입니다. 국소성(locality)은 사후에 덧붙일 수 있는 것이 아니라, 처음부터 심어 넣어야 하는 것입니다.

또한, 모델의 가장 첫 번째 레이어(Layer 0)가 가장 "끈기 있게" 만들기 어렵다는 점을 언급했습니다. 최상의 설정을 사용하더라도 이 레이어의 전환율은 0.49 이상으로 유지되었습니다. 이는 첫 번째 레이어가 문맥과 섞이기 전의 가공되지 않은 단어들을 보기 때문에, "사과"와 "파이"가 이 단계에서는 실제로 매우 다르게 보일 수 있기 때문입니다.

결론

이 논문은 만약 당신이 메모리가 제한된 기기에서 빠르게 작동하는 AI를 원한다면, 단순히 똑똑한 캐싱 규칙을 적용하거나 나중에 모델을 고치려고 애쓰지 말아야 한다고 제안합니다. 대신, 훈련 첫날부터 모델이 "끈기 있게" 행동하도록 훈련시켜야 합니다. 인접한 단어 사이에서 전문가를 너무 자주 바꾸는 것에 대해 간단한 페널티를 부여함으로써, 모델은 자연스럽게 주제에 집중하고, 느린 지하실로 가는 횟수를 줄이며, 실제로 이야기를 더 잘 이해하게 됩니다.

저자들은 이 연구가 시뮬레이션에 기반하며, 소형 및 중형 모델(최대 22M 파라미터)의 특정 데이터셋(WikiText-2)에서 수행되었다는 점을 인정합니다. 그들은 모델이 커질수록 이 "끈기"가 더 잘 작동할 수 있다고 제곡하지만, 아직 수십억 개의 파라미터를 가진 거대 모델에 대해서는 테스트하지 못했습니다. 또한, 현재 방식은 문장이 끝나는 시점을 알지 못하므로, 문단 구분 사이에서도 "너무 끈끈하게" 행동할 수 있다는 점을 언급하며, 이는 향후 해결해야 할 과제로 남겨두었습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →