← 최신 논문
💻 computer science

Multi-Tenant Edge-Cloud Hybrid LLM Serving using Speculative Decoding and Quantization

본 논문은 개인정보 보호, 지연 시간 및 자원 활용도 문제를 동시에 해결하기 위해 W4A16 양자화된 추측적 디코딩(speculative decoding)을 비동기 통신 및 멀티 테넌트 검증 오케스트레이터와 결로한 멀티 테넌트 엣지-클라우드 하이브리드 LLM 서빙 아키텍처를 제안한다.

원저자: Jui-Yu Lin

게시일 2026-07-13
📖 4 분 읽기☕ 가벼운 읽기

원저자: Jui-Yu Lin

원본 논문은 CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신에게 이야기를 쓰고, 수학 문제를 풀고, 인간처럼 대화할 수 있는 초지능 로봇 두뇌(거대 언어 모델)가 있다고 상상해 보세요. 하지만 함정이 있습니다. 이 두뇌는 너무 거대해서 당신의 주머니에 들어가지 않으며, 만약 어디든 들고 다니려고 하면 휴대폰 배터리가 즉시 방전되어 버립니다.

그래서 우리에게는 두 가지 나쁜 선택지가 있습니다:

  1. 클라우드(The Cloud): 멀리 떨어진 곳에 있는 거대한 슈퍼컴퓨터로 질문을 보냅니다. 똑똑하긴 하지만, 메시지가 그곳까지 갔다가 돌아오는 데 시간이 오래 걸려(마치 전령 비둘기로 편지를 보내는 것처럼) 채팅이 느리고 답답하게 느껴집니다. 게다가 당신의 사적인 비밀을 그 비둘기에게 맡겨야 합니다.
  2. 엣지(The Edge): 휴대폰에서 직접 전체 로봇 두뇌를 실행하려고 시도합니다. 빠르고 프라이버시 보호에도 좋지만, 휴대폰의 성능이 충분하지 않아 모델을 너무 많이 축소하다 보면 답변이 조금 엉뚱해질 수 있습니다.

이 논문은 이 둘 사이의 영리한 절충안인, 마치 고속 릴레이 경주에 약간의 반전을 더한 것 같은 휴대폰과 클라우드의 팀워크를 제안합니다.

팀워크: "초안 작성" 조수와 "검증" 보스

이 새로운 시스템이 어떻게 작동하는지에 대한 저자들의 설명은 다음과 같습니다.

1. 엣지 조수 (당신의 휴대폰)
휴대폰은 클라우드의 답변을 기다리는 대신, 아주 작고 압축된 버전의 로봇 두뇌를 실행합니다. 저자들은 **W4A16 양자화(quantization)**라고 불리는 특정 "압축 기술"을 사용할 것을 제고합니다. 이것은 고화획 HD 영화를 줄거리를 이해하는 데 충분할 만큼 작은 파일로 압축하는 것과 같습니다.

  • 마법: 이 작은 버전은 문장의 다음 몇 단어(토큰)를 매우 빠르게 추측할 수 있을 만큼 똑똑합니다. 논문에서는 모델을 축소하면 정확도(퍼플렉서티 점수)가 약간 떨어지지만(5.47에서 약 5.74 또는 5.83으로), 여전히 견고한 추측을 하기에는 충분하다고 언급합니다.
  • 규칙: 저자들은 이를 더 많이 축소하는 것(예: W4A4)에 대해 명시적으로 반대합니다. 너무 많이 압축하면 추측이 너무 형편없어져서 이를 수정하는 데 시간을 허비하게 되고, 결국 전체 속도를 늦추게 된다고 말합니다. 따라서 그들은 "딱 적당한" 크기인 W4A16을 고수합니다.

2. 클라우드 보스 (슈퍼컴퓨터)
휴대폰이 다음 몇 단어를 추측하는 동안, 클라우드는 본격적인 무거운 작업을 수행합니다. 클라우드는 크고 완벽한 형태의 로봇 두뇌를 보유하고 있습니다. 클라우드의 역할은 처음부터 시작하는 것이 아니라, 휴대폰이 추측한 내용을 검증하는 것입니다.

  • 반전: 기존 시스템에서는 휴대폰이 단어를 추측한 뒤 멈춰서 클라우드가 "예" 또는 "아니오"라고 답할 때까지 기다렸습니다. 이것은 "상호 대기(mutual waiting)"라고 불리는데, 마치 테니스 라켓을 휘두르기도 전에 공이 돌아오기를 기다리는 게임과 같습니다.
  • 새로운 기술: 이 논문은 비동기(asynchronous, non-blocking) 프로토콜을 제안합니다. 휴대폰은 클라우드가 이전 단어들을 확인하는 동안에도 계속해서 다음 단어들을 추측합니다. 이는 마치 컨베이어 벨트 위에서 클라우드가 이미 올라온 상자들에 도장을 찍는 동안, 휴대폰은 계속해서 다음 상자들을 포장하는 것과 같습니다. 이 방식은 네트워크 지연 시간(latency)을 숨겨서 지연을 느끼지 못하게 합니다.

3. 멀티 테넌트 오케스트라 (Multi-Tenant Orchestra)
여기에는 두 번째 큰 비결이 있습니다. 보통 100명이 클라우드를 사용하면, 컴퓨터는 각 사람에게 자신만의 작고 빈 방을 할당합니다. 이는 낭비입니다.
저자들은 **멀티 테넌트 오케스트레이터(Multi-Tenant Orchestrator)**를 제안합니다. 이는 바쁜 레스토랑 주방을 상상하면 쉽습니다. 모든 고객에게 개인 요리사를 붙여주는 대신(요리사가 주문을 기다리며 앉아 있게 되는 셈이죠), 주방에는 모든 주문을 동시에 처리하는 매우 효율적인 팀이 있는 것과 같습니다.

  • 클라우드는 여러 휴대폰에서 오는 요청을 하나의 큰 "배치(batch)"로 묶어 한꺼번에 검사합니다.
  • 이를 통해 클 클라우드의 강력한 그래픽 카드(GPU)가 한 사람의 입력을 기다리며 유휴 상태로 있는 것이 아니라, 100% 용량으로 작동하도록 유지합니다.

수학이 말하는 것 (하지만 단순하게 유지하세요)

저자들은 이 아이디어가 유효한지 확인하기 위해 수학적 모델을 구축했습니다. 그들은 아직 수천 명의 사용자를 대상으로 한 대규모 실세계 테스트를 수행한 것이 아니라, 시스템이 어떻게 작동해야 하는지를 보여주는 공식을 사용하여 시뮬레이션했습니다.

  • 속도 제한: 클 클라우드가 휴대폰이 다음 배치를 만드는 동안 현재 배치의 추측을 검사할 수 있을 만큼 빠르다면, 인터넷 지연 시간은 방정식에서 사라진다고 계산했습니다.
  • 병목 현상: 이 시스템은 클라우드가 과부하에 걸리지 않을 때 가장 잘 작동합니다. 너무 많은 사람이 파티에 참여하면 클라우드가 "대기 지연(queuing delay)"에 빠지게 됩니다. 모델은 시스템에 참여하는 인원을 세심하게 조절함으로써 높은 속도를 유지할 수 있음을 시사합니다.
  • 결과: 시뮬레이션 결과, 이 설정은 휴대폰에서 모델을 완전히 실행할 때와 유사한 속도를 달면서도, 거대한 클라우드 두뇌의 정확도를 유지하고, 동시에 당신의 개인 데이터를 대부분 기기에 안전하게 보관할 수 있음을 보여줍니다.

이 논문이 말하고 있지 않은

이 논문이 주장하지 않는다는 점을 아는 것이 중요합니다:

  • 수천 명의 사용자가 사용하는 실제 환경에서의 배포를 통해 증명된 것은 아닙니다. 저자들은 기존 도구들(휴대폰을 위한 llama.cpp 및 클라우드를 위한 vLLM)을 기반으로 이 아키텍처를 이론적 모델로서 제안하고 있습니다.
  • 모든 프라이버시 문제를 해결한다고 주장하지 않습니다. 원본 프롬프트는 로컬에 유지되지만, 일부 추측 데이터는 여전히 클라우드로 전송됩니다.
  • 모든 모델 크기에 적용된다고 말하지 않습니다. 수학적 모델은 클라우드가 휴대폰의 추측 속도를 따라잡을 수 있을 만큼 충분히 빠르다는 특정 조건에 의존합니다.

결론

저자들은 당신의 주머니 속에 슈퍼컴퓨터를 넣지 않고도 AI 채팅을 즉각적이고 프라이빗하게 만들 수 있는 방법을 제안합니다. 휴대폰이 빠르고 "적당히 좋은" 추측을 하게 하고, 클라우드가 이를 바쁘고 효율적인 그룹 단위로 검사하게 함으로써, 기존의 경험을 망치던 느린 인터넷 지연을 우회할 수 있다고 제안합니다. 이는 매우 유망한 청사진으로, 우리가 올바른 "릴레이 경주" 팀을 구축한다면 최고의 장점만을 결합한 결과를 얻을 수 있음을 시사합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →