← 최신 논문
💬 NLP

Less is MoE: Trimming Experts in Domain-Specialist Language Models

이 논문은 피셔 중요도(Fisher importance)를 사용하여 FFN 레이어 내의 작업 결정적인 중간 차원을 식별하고 제거함으로써, 범용 벤치마크에서의 성능을 유지하면서도 Mixture-of-Experts 모델의 메모리와 처리량 측면에서 상당한 이득을 가능하게 하는 압축 방법인 Fisher-MoE를 소개한다.

원저자: Haoze He, Xinkai Zou, Xuan Jiang, Xingyuan Ding, Ao Qu, Juncheng Billy Li, Heather Miller

게시일 2026-06-05
📖 3 분 읽기☕ 가벼운 읽기

원저자: Haoze He, Xinkai Zou, Xuan Jiang, Xingyuan Ding, Ao Qu, Juncheng Billy Li, Heather Miller

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

거대한 고성능 언어 모델을 간단한 토스트부터 복잡한 5코스 요리까지 어떤 종류의 식사든 만들어낼 수 있도록 설계된 거대한 주방이라고 상상해 보세요.

문제점: 집에 담기에는 너무 큰 주방

이 주방(이를 Mixture-of-Experts 또는 MoE 모델이라 부릅니다)은 수백 명의 전문 셰프(이를 "전문가"라고 부릅니다)를 보유하고 있어 매우 똑똑합니다. 여러분이 질문을 던지면, 스마트한 매니저(이를 "라우터"라고 부릅니다)가 특정 작업에 가장 적합한 몇 명의 셰프를 선발합니다.

하지만 이 주방은 너무 거대합니다. 공간(메모리)을 너무 많이 차지하고, 대기 중인 셰프가 너무 많아서 일반적인 가정(표준 컴퓨터나 스마트폰)에 넣는 것이 불가능합니다. 여러분은 맛있는 요리를 만드는 능력을 잃지 않으면서도 이 주방을 줄여야 합니다.

기존 방식: 셰프 전체를 해고하기

이전의 시도들은 마치 셰프 전체를 해고하는 것과 같았습니다.

  • 만약 어떤 셰프가 자주 요리하지 않거나 앞치마가 작다는 이유로, 매니저들은 그들을 해고했습니다.
  • 결과: 이는 재앙이었습니다. 비록 "최고의" 셰프들만 남겼을지라도, 여러분은 완벽한 수학 문제를 만드는 데 필요한 비밀 재료를 알고 있는 단 한 명의 사람을 실수로 해고해 버렸습니다. 갑자기 주방은 농담은 할 수 있을지 몰라도(지식), 기본적인 산수는 더 이상 할 수 없게 되었습니다. 시스템 전체가 무너진 것입니다.

새로운 발견: 문제는 셰프가 아니라 칼이다

이 논문의 저자들은 놀라운 사실을 발견했습니다: 문제는 어떤 셰프를 남기느냐가 아니라, 그들이 사용하는 구체적인 도구가 무엇인가 하는 점입니다.

모든 셰프의 작업대 안에는 수천 개의 작은 도구들(이를 "중간 차원"이라고 부릅니다)이 있습니다.

  • 대부분의 도구는 그저 먼지만 쌓인 채 놓여 있습니다.
  • 하지만 아주 소수의 특정 도구들은 절대적으로 중요합니다. 예를 들어, 어떤 특정한 "칼"은 주방이 수학 문제를 풀 수 있게 해주는 유일한 도구일 수 있고, 또 다른 "숟가락"은 코드를 작성하는 데 필수적일 수 있습니다.

기존의 방식은 어떤 셰프가 "먼지 쌓인 숟가락"을 사용한다는 이유로 그 셰프의 작업대 전체를 버리는 것과 같았습니다. 그 셰프가 동시에 "중요한 수학용 칼"을 들고 있다는 사실을 깨닫지 못한 채 말이죠.

해결책: "Fisher-MoE" (정밀한 메스)

저자들은 Fisher-MoE라고 불리는 새로운 방법을 제안합니다. 셰프를 해고하는 대신, 그들은 특별한 스캐너(이를 Fisher Importance라고 부릅니다)를 사용하여 주방의 모든 도구를 살펴봅니다.

  1. 스캐너: 특정 도구를 제거했을 때 주방의 성능이 얼마나 떨어지는지를 측정합니다.
    • 비유: 주방의 모든 칼을 테스트한다고 상상해 보세요. "칼 A"를 제거해도 주방은 여전히 토스트를 만들 수 있습니다. 하지만 "칼 B"를 제거하면 주방은 더 이상 토마토를 썰 수 없습니다. 스캐너는 "칼 B"가 결정적이라는 것을 식별해 냅니다.
  2. 다듬기: 그들은 아무도 해고하지 않습니다. 대신, 작업대를 물리적으로 축소합니다. 그들은 "먼지 쌓인 숟가락"과 "사용되지 않는 뒤집개"(점수가 낮은 도구들)를 제거하지만, "결정적인 칼"(점수가 높은 도구들)은 그대로 유지합니다.
  3. 결과: 그들은 주방을 50% 축소할 수 있었습니다(도구의 절반을 제거함). 그럼에도 불구하고 주방은 거의 완벽하게 작동합니다.
    • 여전히 어려운 수학 문제를 풀 수 있습니다.
    • 여전히 코드를 작성할 수 있습니다.
    • 여전히 상식을 대답할 수 있습니다.
    • 보너스: 주방이 더 작아졌기 때문에 더 빠르게 요리하며(21% 더 빠름), 훨씬 작은 공간에 들어갑니다(45% 적은 메모리).

이것이 왜 중요한가

  • 무차별적이지 않은 정밀함: 기존의 방식이 망치(사람 전체를 해고하는 것)였다면, 이 새로운 방식은 메스(도구의 쓸모없는 부분만 제거하는 것)입니다.
  • "수학"의 미스터리: 연구진은 만약 135만 개 중 단 12개의 특정 도구만 제거하더라도, 주방이 다른 모든 것은 기억하면서도 즉시 수학을 하는 법을 잊어버린다는 것을 발견했습니다. 이는 복잡한 기술이 모델 전체에 고르게 퍼져 있는 것이 아니라, 아주 작고 구체적인 구석에 숨겨져 있다는 것을 증명합니다.
  • 호환성: 이 축소 방법은 다른 공간 절약 기술("양자화")과도 완벽하게 호환됩니다. 즉, 모델을 망가뜨리지 않고도 훨씬 더 작게 줄일 수 있다는 뜻입니다.

요약하자면

이 논문은 다음과 같이 말합니다: 전문가를 해고하지 말고, 그들의 도구 상이를 다듬으세요. 스마트한 스캐너를 사용하여 전문가 내부의 쓸모없는 "도구"만을 식별하고 제거함으로써, 우리는 이 거대한 AI 모델들을 이전만큼 똑똑하게 유지하면서도 크기는 절반으로 줄이고 속도는 두 배로 빠르게 만들 수 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →