← 최신 논문
🤖 machine learning

WiSP: A Working-Set View of Mixture-of-Experts Serving on Extremely Low-Resource Hardware

이 논문은 저사양 하드웨어에서 Mixture-of-Experts 모델을 위한 라우팅 인식 워킹 셋 관리 시스템인 WiSP를 소개하며, 이는 기본 서빙 엔진을 수정하지 않고도 전문가 가중치를 동적으로 페이징하고 전문가와 KV 캐시 간의 VRAM 할당을 최적화하여 디코드 처리량을 크게 향상시킨다.

원저자: Jiamu Zhang, Liang Wu, Mayank Darbari, Liangjie Hong

게시일 2026-06-23
📖 4 분 읽기☕ 가벼운 읽기

원저자: Jiamu Zhang, Liang Wu, Mayank Darbari, Liangjie Hong

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

큰 문제: "너무 커서 담을 수 없는" AI

당신이 수천억 페이지가 담긴 거대한 도서관(AI 모델)을 가지고 있다고 상상해 보세요. 당신은 이 책들을 아주 작은 휴대용 전자책 단말기(표준 컴퓨터 그래픽 카드 또는 GPU)로 읽고 싶어 합니다.

문제는 전자책 단말기에 이 도서관 전체를 한꺼번에 담을 만큼의 메모리가 부족하다는 점입니다. 하지만 문장 하나를 읽을 때마다, 당신은 오직 몇 권의 특정 책에서 몇 개의 특정 페이지들만 필요로 할 뿐입니다. 나머지 도서관의 책들은 사용되지 않은 채 놓여 있습니다.

현재의 해결책들은 이 문제를 해결하기 위해 도서관 전체를 창고(컴퓨터의 메인 메모리)에 보관해 두었다가, 페이지를 넘길 때마다 필요한 페이지를 가져오기 위해 창고로 달려가는 방식을 사용합니다. 하지만 창고로 가는 길(데이터 전송)이 오래 걸리기 때문에 이 방식은 매우 느립니다.

WiSP 솔루션: "똑똑한 사서"

저자들은 WiSP(Working-Set Paging)라는 시스템을 만들었습니다. WiSP는 단순히 매번 창고로 달려가는 대신, 당신이 무엇을 읽고 있는지 관찰하고, 곧 필요할 것 같은 책들을 골라 당신의 책상(GPU 메모리) 위에 작은 큐레이션 스택으로 준비해 두는 똑똑한 사서 역할을 합니다.

작동 방식은 세 가지 간단한 부분으로 나뉩 됩니다.

1. "스마트 스택" (전문가 페이징 - Expert Paging)

"Mixture-of-Experts"(MoE)라고 불리는 AI 모델에는 여러 가지 "전문가"(특화된 하위 모델)들이 있지만, 모델은 단어를 생성할 때마다 그중 몇 가지만 사용합니다.

  • 기존 방식: 시스템은 레이어의 모든 전문가를 가져옵니다. 설령 두 개만 사용하더라도 말이죠. 이는 공간과 시간을 낭비합니다.
  • WiSP 방식: WiSP는 실제로 사용 중인 특정 전문가들만 책상 위에 유지합니다. 만약 새로운 전문가가 필요하면, 스택에서 기존의 것을 빠르게 빼내고 새 전문가를 창고에서 가져옵니다.
  • 결과: 필요한 아주 작은 조각들만 이동하기 때문에 훨씬 더 빠릅니다. 논문에 따르면, 작은 컴퓨터에서 이 방식은 기존 방식보다 AI를 최대 2배 더 빠르게 실행합니다.

2. "공유된 책상" (메모리 할당 - Memory Allocation)

당신의 책상(GPU 메모리)은 매우 작습니다. 여기에는 두 가지 요소가 공간을 차지하기 위해 싸우고 있습니다:

  1. 전문가 스택 (Expert Stack): 지금 당장 읽어야 할 책들.
  2. 문맥 노트 (KV Cache): 지금까지 읽은 이야기의 내용을 잊지 않기 위해 적어둔 메모들.

만약 책상에 책을 너무 많이 올려두면, 메모를 적을 공간이 없습니다. 반대로 메모를 너무 많이 적어두면, 책을 가져올 공간이 부족해집니다.

  • WiSP 솔루션 (MV-WSA): 이것은 책상의 공간을 어떻게 나눌지 결정하는 똑똑한 규칙입니다. 시스템은 끊임없이 자문합니다: "지금 책을 더 많이 올려두는 게 좋을까, 아니면 메모를 더 많이 적는 게 좋을까?"
  • 이 시스템은 공간 분할을 동적으로 조정합니다. 긴 이야기를 쓰고 있다면 메모를 위한 공간을 더 많이 주고, 주제를 빠르게 전환하고 있다면 책을 위한 공간을 더 많이 줍니다. 이를 통해 어느 한쪽이 부족해서 공간이 모자라는 일이 없도록 보장합니다.

3. "수정구슬"의 신화 (예측이 도움이 되지 않은 이유)

연구진은 다음과 같은 의문을 가졌습니다: "만약 우리가 수정구슬(AI 예측)을 사용하여 다음에 어떤 책이 필요할지 미리 짐작하고, 당신이 요청하기도 전에 미리 가져다 놓는다면 어떨까?"

  • 놀라운 사실: 연구진은 이 특정한 환경(한 번에 한 문장씩 읽는 상황)에서는 예측이 속도를 높여주지 못한다는 것을 발견했습니다.
  • 이유는 무엇일까요? 창고와 책상 사이의 "도로"(데이터 연결)가 너무 좁기 때문입니다. 설령 완벽하게 예측한다 하더라도, 트럭이 한 번에 실을 수 있는 양은 정해져 있습니다. 병목 현상은 무엇을 맞출 것인가의 문제가 아니라, 트럭의 속도 자체에 있습니다.
  • 진짜 가치: "수정구슬"은 여전히 유용하지만, 속도를 위해서가 아닙니다. 그것은 사서가 당신에게 딱 맞는 크기로 스택을 얼마나 구성해야 하는지 알 수 있게 도와줍니다. 이를 통해 시스템은 스택의 크기를 완벽한 사이즈로 줄여서, 결과적으로 메모를 위한 책상 공간을 더 많이 확보할 수 있게 해줍니다.

핵심 요약

이 논문은 거대한 AI 모델을 작은 컴퓨터에서 실행하는 것은 단순히 계산 능력의 문제가 아니라 메모리 관리의 문제라고 주장합니다.

  • WiSP는 똑똑한 사서처럼 행동하며, 필요한 책들만 책상 위에 두고 효율적으로 교체하는 도구입니다.
  • 이는 AI 모델 자체를 바꾸는 것이 아니라, 메모리를 더 잘 관리하는 것입니다.
  • 불필요한 데이터를 옮기는 데 시간을 낭비하지 않음으로써, 작은 기기에서도 AI를 훨씬 빠르게 실행하게 해줍니다.
  • 우리는 이 과정을 통해, 이 특정 시나리오에서는 미래를 예측하려고 노력하는 것보다 작업 공간을 효율적으로 관리하는 것이 더 중요하다는 것을 배울 수 있습니다.

이 시스템은 매우 효과적이어서, 이전에는 아예 감당할 수 없었던 단일 컴퓨터 카드에서도 거대한 AI 모델을 실행할 수 있게 해주며, 이 과정에서 AI가 내놓는 답변의 품질은 전혀 떨어뜨리지 않습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →