← 최신 논문
🤖 machine learning

Uncovering Intra-expert Activation Sparsity for Efficient Mixture-of-Expert Model Execution

본 논문은 기존 사전 학습된 전문가 혼합 (MoE) 모델이 본질적으로 상당한 전문가 내부 활성화 희소성을 지니고 있음을 밝히며, 이를 vLLM 실행 파이프라인을 수정하여 비활성 뉴런 연산을 건너뛰도록 함으로써 모델 재학습이나 매개변수 수정 없이 MoE 레이어 실행에서 최대 2.5 배, 엔드투엔드에서 1.2 배의 속도 향상을 달성할 수 있음을 보여줍니다.

원저자: Jongseok Park, Sunga Kim, Zhenyu Gu, Ion Stoica, Alvin Cheung

게시일 2026-05-12
📖 4 분 읽기☕ 가벼운 읽기

원저자: Jongseok Park, Sunga Kim, Zhenyu Gu, Ion Stoica, Alvin Cheung

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

이 논문은 간단한 언어와 창의적인 비유를 사용하여 설명합니다.

핵심 아이디어: AI 속의 "잠자는 거인" 찾기

수백 명의 전문 셰프 (전문가, Experts) 를 보유한 거대하고 고급스러운 레스토랑 주방 (AI 모델) 을 상상해 보세요. 표준적인 "전문가 혼합 (Mixture of Experts, MoE)" 방식에서는 고객이 요리를 주문하면 수석 셰프 (라우터, Router) 가 해당 주문을 처리할 몇몇 특정 전문가만 선택합니다. 예를 들어, 주문이 "매운 카레"라면 라우터는 "매운맛 전문가"와 "카레 전문가"를 깨우지만, "디저트 전문가"와 "빵 전문가"는 잠자게 둡니다.

이 방식은 모든 주문마다 100 명의 셰프 모두를 가동하지 않기 때문에 이미 효율적입니다. 하지만 이 논문의 연구자들은 새로운 질문을 던졌습니다. "셰프가 깨어 있고 일하고 있을지라도, 그들이 모든 에너지를 사용하고 있을까?"

그들은 깨어 있는 셰프조차 대부분 아무것도 하지 않고 서 있는 경우가 많다는 것을 발견했습니다. 그들은 단일 전문가 내에서 최대 90% 의 뉴런(AI 의 개별 뇌 세포) 이 주어진 입력에 대해 사실상 "잠자고" 있거나 0 을 출력한다는 사실을 발견했습니다.

문제: 셰프를 더 많이 추가할 수 없는 이유

과거에는 AI 를 더 빠르게 만들기 위해 연구자들이 더 많은 셰프를 추가하고 적은 수의 셰프만 깨우는 방식으로 주방을 더 효율화하려 했습니다 (전문가 간 희소성 증가). 하지만 이는 매우 어려워지고 있습니다.

  • 훈련의 어려움: 셰프가 너무 많고 깨우는 셰프가 적으면 주방이 혼란스러워집니다. 일부 셰프는 모든 일을 맡게 되고 (부하 불균형), 다른 셰프들은 전혀 훈련받지 못해 쓸모없게 됩니다 (전문가 붕괴).
  • 한계: 모델을 망치지 않고는 "누가 일할지" 선택을 더 효율적으로 만드는 데 한계에 부딪히고 있습니다.

해결책: "게으른 셰프" 전략

셰프를 더 적게 고르려 하기보다, 저자들은 개별 셰프를 더 효율적으로 만들기로 결정했습니다. 그들은 셰프가 일하고 있을지라도 모든 도구를 사용할 필요는 없다는 사실을 깨달았습니다.

비유:
장인 (전문가) 이 의자를 만드는 상황을 상상해 보세요.

  • 옛 방식: 장인은 망치와 나사못만 필요할지라도, 공구 Shed 에 있는 모든 망치, 톱, 나사못을 집어 듭니다. 그들은 작업 현장으로 공구 Shed 전체를 운반합니다.
  • 새로운 방식 (이 논문): 장인은 작업을 보고 망치와 나사못만 필요하다는 것을 깨닫고, 톱과 나머지 도구 90% 는 Shed 에 남겨둡니다. 그들은 필요한 것만 운반합니다.

연구자들은 기존에 사전 훈련된 AI 모델 (Qwen, Llama, DeepSeek 등) 에서 이러한 "게으른" 행동이 이미 자연스럽게 발생하고 있음을 발견했습니다. 모델 내부의 수학 연산이 대부분의 작업을 자연스럽게 0 으로 만들었습니다. 그들은 단지 컴퓨터에게 그 낭비되는 작업을 건너뛰게 하도록 가르쳐야 했습니다.

실행 방법: "건너뛰기 목록 (Skip-List)" 시스템

팀은 vLLM 이라는 인기 있는 고속 AI 엔진 (음식을 주방에서 고객에게 전달하는 배달 서비스라고 생각하세요) 을 가져와 업그레이드했습니다.

  1. 확인: "셰프"가 요리를 시작하기 전에 시스템이 실제로 필요한 도구 (뉴런) 가 무엇인지 빠르게 확인합니다.
  2. 건너뛰기: 도구가 필요하지 않다면 (값이 너무 낮다면), 시스템은 그것을 메모리에 로드하거나 사용하려고 시도조차 하지 않습니다. 문자 그대로 계산을 건너뜁니다.
  3. 결과: 그들은 소프트웨어에 특별한 "고속 차선"을 구축했습니다. 주문 건수가 적을 때 (조용한 점심 시간과 같은 경우), 시스템은 이 고속 차선을 사용하여 무거운 작업을 건너뜁니다. 주방이 매우 바쁠 때 (거대한 저녁 시간과 같은 경우), 안정성을 유지하기 위해 표준적인 무거운 작업 모드로 전환합니다.

발견한 점 (결과)

그들은 10 억 개 파라미터의 작은 모델부터 4,000 억 개 파라미터의 거대 모델에 이르기까지 여덟 가지 다른 거대 AI 모델을 테스트했습니다.

  • 정확도: 전문가 내부의 작업을 최대 **90%**까지 건너뛸 수 있었으며, AI 는 여전히 95% 의 확률로 정답을 맞췄습니다. 마치 레시피의 재료를 90% 건너뛰어도 요리가 여전히 95% 만큼 맛있다는 것과 같습니다.
  • 속도:
    • AI 의 특정 "요리" 부분 (MoE 레이어) 에서는 최대 2.5 배의 속도 향상을 보였습니다.
    • 전체 시스템 (종단 간) 에서는 1.2 배의 속도 향상을 보였습니다.
  • 하드웨어: 속도 향상은 소비자용 게이밍 그래픽 카드와 같은 작고 덜 강력한 그래픽 카드에서 가장 극적으로 나타났으며, 이는 더 저렴한 하드웨어에서 거대 AI 모델을 실행할 수 있는 훌륭한 방법임을 입증했습니다.

주의점 (한계)

논문은 한계를 솔직하게 인정합니다.

  • 문지기: 시스템은 건너뛸 수 있기 전에 어떤 도구가 필요한지 확인해야 합니다. 이 "확인" 작업은 시간이 걸리며 아직은 건너뛸 수 없습니다. 셰프들이 모든 도구를 사용하지 않더라도, 매니저가 여전히 주방을 돌아다니며 셰프들에게 어떤 도구를 집어야 할지 말해줘야 하는 것과 같습니다.
  • 배치 크기: 속도 향상은 AI 가 한 번에 몇 개의 요청을 처리할 때 가장 좋습니다. 수천 개의 요청을 동시에 처리하면 "확인" 오버헤드가 병목 현상이 되어 속도 향상이 감소합니다.

요약

이 논문은 새로운 유형의 AI 를 발명하거나 처음부터 새로운 모델을 훈련시킨 것이 아닙니다. 대신 그들은 기존에 존재하는 강력한 AI 모델을 살펴보고, **"이 모델들은 '활발'할지라도 이미 많은 불필요한 작업을 하고 있구나"**라고 깨달았습니다.

이 낭비되는 노력을 인식하고 단순히 건너뛰는 시스템을 구축함으로써, 그들은 이러한 거대 AI 모델들이 특히 비싸지 않은 하드웨어에서 훨씬 더 빠르고 효율적으로 실행되도록 만들었습니다. 이는 현재 세대의 AI 모델을 실행하는 것을 더 실용적으로 만드는 "스마트 건너뛰기" 기술입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →