← 최신 논문
💻 computer science

Predatory MoE: Serving Mixture-of-Experts with a Sequence-Local Expert Roster

이 논문은 훈련과 추론 과정 모두에서 이 제약을 일관되게 적용함으로써, MoE 모델 서빙 중 메모리 점유율과 전문가 전송을 획기적으로 줄이기 위해 시퀀스당 소수의 전문가를 고정하는 시퀀스 로컬 전문가 로스터 전략을 제안하며, 이를 통해 훨씬 적은 상주 가중치로도 거의 전체 상주 수준의 처리량을 달성한다.

원저자: ChaeWoo Son

게시일 2026-08-19
📖 4 분 읽기☕ 가벼운 읽기

원저자: ChaeWoo Son

원본 논문은 CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

텍스트를 생성하는 현대의 인공지능 시스템은 종종 '전문가 혼합(mixture of experts)'이라 불리는 설계 방식에 의존합니다. 이를 방대한 지식을 가진 전문 작업자들이 모인 거대한 도서관이라고 상상해 보십시오. 각 작업자는 특정하고 좁은 주제에 정통한 전문가입니다. 시스템이 질문에 답해야 할 때, 시스템은 모든 전문가를 한꺼번에 활성화하지 않습니다. 대신, 그 순간에 가장 관련성이 높은 극소수의 전문가만을 선택합니다. 이러한 접근 방식 덕분에 시스템은 매우 거대하고 유능하면서도, 단어를 하나 생성할 때마다 비교적 적은 컴퓨팅 자원을 사용할 수 있습니다. 그러나 이러한 시스템을 일반적인 컴퓨터에서 구동할 때는 심각한 병목 현상이 발생합니다. 비록 특정 순간에는 소수의 전문가만 사용되지만, 컴퓨터의 메모리는 다음에 어떤 전문가가 필요할지 미리 알 수 없기 때문에 전체 전문가 라이브러리를 즉시 사용할 수 있도록 대기 상태로 유지해야 합니다. 이 요구 사항 때문에 전체 메모리 크기는 사용되는 작은 그룹이 아니라 전체 라이브러리의 크기에 맞춰져야 하며, 이는 메모리가 제한된 기기에서 이러한 강력한 모델을 실행하는 것을 어렵게 만듭니다.

연구자들은 사용하지 않는 전문가들을 하드 드라이브에 저장해 두었다가 필요할 때마다 메모리로 불러오는 방식으로 이를 해결하려 노력했습니다. 하지만 이는 새로운 문제를 야기했습니다. 시스템이 흩어진 방식으로 전문가를 선택하기 때문에, 끊임없이 새로운 전문가를 불러오게 되어 프로세스가 느려지는 것입니다. 독립 연구자인 손채우(ChaeWoo Son)가 이끄는 팀은 다른 질문을 던졌습니다. 컴퓨터가 흩어진 전문가를 빠르게 불러오는 방법을 찾는 대신, 시스템이 하나의 대화가 진행되는 동안 자연스럽게 작고 일관된 전문가 그룹에 머물도록 바꿀 수는 없을까? 그들은 시스템이 '시퀀스 로컬(sequence-local)'이 되도록, 즉 대화가 시작되면 동일한 소규모 팀이 전체 대화 흐름을 처리하도록 훈련시켜, 컴퓨터가 해당 팀만을 메모리에 유지할 수 있는지 확인하고자 했습니다.

연구진은 먼저 이 행동을 시스템에 직접 가르치려고 시도했습니다. 그들은 모델이 현재 대화에서 이미 사용했던 전문가를 선호하도록 훈련시켜, 이 습관이 시스템의 지능의 일부로 영구적으로 자리 잡기를 바랐습니다. 연구 결과, 훈련이 진행되는 동안에는 이 기술이 효과가 있었지만, 그 행동은 지속되지 않았습니다. 훈련 압박이 제거되자마자 시스템은 이전의 흩어진 습관으로 돌아갔습니다. 심지어 시스템이 자신의 편향된 선택으로부터 학습하도록 강화하려 했을 때도, 과정은 불안정해졌고 텍스트의 품질은 저하되었습니다. 연구는 시스템이 새로운 기술을 배우는 것이 아니라, 단지 일시적인 규칙에 반응하고 있을 뿐이라는 결론을 내렸습니다. 연구진은 시스템이 이 행동을 내면화하도록 강요하는 것이 잘못된 접근 방식임을 깨달았습니다.

시스템의 '뇌'를 바꾸는 대신, 연구진은 게임의 규칙을 바꾸기로 했습니다. 그들은 훈련 중과 실제 사용 시 모두 적용되는 엄격하고 영구적인 규칙을 부과했습니다. 이 새로운 규칙 아래에서는, 텍스트의 첫 몇 단어를 바탕으로 모든 대화에 소수의 고정된 전문가 팀이 배정됩니다. 일단 이 팀이 선택되면, 시스템은 해당 대화가 끝날 때까지 다른 누구로도 교체될 수 없습니다. 이 규칙은 마치 예산처럼 작동합니다. 컴퓨터는 오직 그 특정 소규모 팀만을 빠른 메모리에 유지하면 되고, 나머지 라이브러리는 더 느린 저장 장치에 머물 수 있습니다. 팀이 대화 내내 고정되어 있기 때문에, 컴퓨터는 전문가를 계속해서 넣었다 뺐다 할 필요가 없습니다.

이 접근 방식의 결과는 놀라웠습니다. 연구진이 이 규칙을 테스트 모델에 적용하고 새로운 제약 조건에 적응하도록 짧은 재학습 기간을 부여했을 때, 시스템은 규칙이 없을 때와 거의 비슷하게 성능을 발휘하면서도 메모리 사용량은 대폭 줄였습니다. 테스트 결과, 전체 전문가의 4분의 1만을 메모리에 유지하면서도 기존 방식과 거의 동일한 속도를 달升할 수 있었습니다. 시스템은 기존 방식에 비해 느린 저장 드라이브에서 데이터를 가져와야 하는 횟수를 32배나 줄였습니다. 텍s 품질은 가장 극단적인 메모리 절감 시나리오에서 약 5% 정도 약간 떨어졌지만, 이러한 트레이드오프 덕분에 모델을 훨씬 더 작고 접근 가능한 하드웨어에서 실행할 수 있었습니다.

또한 이 연구는 이러한 시스템이 어떻게 학습하는지에 대한 예상치 못한 통찰을 보여주었습니다. 연구진은 이러한 메모리 제약 없이 모델을 오래 훈련할수록, 나중에 이 효율적인 패턴으로 강제하는 것이 더 어려워진다는 것을 발견했습니다. 시스템의 주의력을 분산시키려는 자연스러운 경향은 시간이 지남에 따라 더 강해지며, 이는 사후에 메모리 제한에 적응하는 데 더 많은 비용을 들게 만듭니다. 이는 만약 우리가 이러한 모델을 일상적인 기기에서 효율적으로 만들고 싶다면, 문제가 발생한 후에 해결하려 하기보다 처음부터 효율적이 되도록 가르쳐야 할 수도 있음을 시사합니다.

이 연구는 모든 가능한 상황에 대한 해결책을 제시한다고 주장하는 것이 아니며, 연구진은 자신들의 테스트가 합성 데이터와 더 작은 모델을 대상으로 수행되었음을 주의 깊게 명시했습니다. 그들은 대화 도중 주제가 갑작스럽게 바뀌면 고정된 전문가 팀이 어려움을 겪을 수 있다는 점을 관찰했지만, 테스트 결과 주제가 바뀌더라도 시스템이 약간의 품질 저하를 감수하며 적응할 수 있음을 보여주었습니다. 이 연구는 메모리 제약을 학습 목표가 아닌 하나의 규칙으로 취급함으로써, 이러한 거대 모델을 훨씬 더 실용적으로 만들 수 있다는 개념 증명 역할을 합니다. 이는 더 빠른 하드웨어를 만드는 것에서 벗어나, 시스템이 자원을 사용하는 더 스마트한 규칙을 설계하는 쪽으로 초점을 옮김으로써, 현재로서는 너무 작아 담을 수 없는 기기에서도 강력한 인공지능이 실행될 수 있는 길을 열어줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →