← 최신 논문
💻 computer science

HetRoute Heterogeneous and Cost-aware Collaborative Routing Framework for Distributed Edge MoE Inference

본 논문은 전송, 연산 및 품질 비용을 단일 모델로 통합하여 전문가 배치와 온라인 라우팅을 최적화함으로써, 품질 제약을 유지하면서도 지연 시간과 트래픽을 크게 감소시키는 분산 엣지 MoE 추론을 위한 협업 라우팅 프레임워크인 HetRoute를 제안한다.

원저자: Xin Yuan, Ning Li, Wenchao Xu, Athanasios V. Vasilakos, Song Guo, Haijun Zhang

게시일 2026-08-04
📖 6 분 읽기🧠 심층 분석

원저자: Xin Yuan, Ning Li, Wenchao Xu, Athanasios V. Vasilakos, Song Guo, Haijun Zhang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 거대하고 복잡한 퍼즐을 풀려고 노력하고 있다고 상상해 보세요. 하지만 퍼즐 조각들은 서로 다른 집들에 흩어져 있습니다. 어떤 집에는 초고속 컴퓨터가 있고, 어떤 집에는 느린 컴퓨터가 있으며, 어떤 집들은 광섬유를 통해 빛의 속도로 연결되어 있는 반면, 어떤 집들은 울퉁불퉁하고 느린 흙길로 연결되어 있습니다. 인공지능의 세계에서, 거대한 "전문가 혼합(Mixture-of-Experts, MoE)" 모델을 실행하려고 할 때 정확히 이런 일이 발생합니다. 이 모델들은 거대한 AI 두뇌이지만, 모든 질문에 대해 자신의 모든 부분을 사용하지는 않습니다. 대신 문제를 해결하기 위해 몇 개의 특정 "전문가(expert)" 부분만을 깨웁니다. 문제는 질문을 어디로 보내야 답이 빠르게 돌아오고, 교통 체증에 갇히거나 정확도를 잃지 않을지 결정하는 것입니다. 만약 단순히 가장 가까운 집으로 질문을 보낸다면, 그 집의 컴퓨터가 지쳐 있거나 하드 드라이브가 가득 차 있어서 느릴 수도 있습니다. 만약 너무 먼 곳으로 보낸다면, 느린 도로 위에서 교통 체증에 갇힐 수도 있습니다. 과학자들은 이 질문들을 라우팅(경로 배정)하는 완벽한 방법을 찾기 위해 노력해 왔지만, 기존의 방법들은 마치 한 번에 자동차 한 대만 보거나, 도로의 상태나 내부 컴퓨터의 상태를 무시한 채 집과의 거리만을 고려하는 교통경찰과 같았습니다.

이 논문은 HetRoute라고 불리는 더 똑똑하고 새로운 시스템을 소개합니다. HetRoute는 단순히 하나의 집이나 하나의 도로만을 보는 것이 아니라, 하나의 퍼즐 조각에 대한 전체 배송 경로를 한꺼번에 살펴보는 매우 조직적인 배송 서비스와 같습니다. 이 시스템은 집 사이의 도로 속도, 내부 컴퓨터의 성능, 컴퓨터가 현재 얼마나 바쁜지(예: 대기 줄이 있는지), 그리고 공간을 절약하기 위해 퍼즐 조각의 "압축된" 버전을 사용하고 있는지(이로 인해 답이 약간 덜 완벽해질 수 있음)까지 모든 것을 고려합니다. HetRoute는 개별 전문가에 대해 별도의 탐욕적인(greedy) 결정을 내리는 대신, 단일 질문에 필요한 전체 전문가 그룹을 위한 통합된 계획을 세웁니다. 이렇게 함으로써, HetRoute는 AI의 답변을 평균 59.0% 더 빠르게 도착하게 만들고 최악의 지연 시간을 58.0% 줄일 수 있음을 발견했습니다. 또한, 원본 버전과 거의 동일한 수준의 품질을 유지하면서도 집 사이를 이동하는 데이터의 양을 72.1% 줄였습니다.

문제점: 길을 잃는 "스마트한" AI

왜 HetRoute가 중요한지 이해하려면, 먼저 "전문가 혼합(Mixture-of-Experts, MoE)" 모델을 이해해야 합니다. 모든 책이 특정 주제에 대한 "전문가"인 거대한 도서관을 상상해 보세요. 질문을 던지면 도서관은 모든 책을 읽는 것이 아니라, 가장 관련성이 높은 상위 몇 권의 책("Top-k" 전문가)만을 꺼냅니다. 이는 요리에 관한 질문을 하고 있는데 수학에 관한 책을 읽으며 시간을 낭비하지 않기 때문에 효율적입니다.

하지만 현실 세계에서 이러한 도서관들은 종-종 당신 근처의 에지 서버(edge server)와 같이 서로 다른 장소에 위치한 여러 서버(컴퓨터)로 나뉘어 있습니다. 질문이 들어오면, 필요한 "Top-k" 전문가들이 세 개의 서로 다른 서버에 흩어져 있을 수 있습니다. 이를 처리하는 기존 방식은 친구에게 세 군데의 집을 뛰어가서 세 권의 책을 가져오라고 부탁하는 것과 같았습니다. 만약 친구가 가장 가까운 집으로 먼저 달려간다면, 그 책이 느린 CPU(중앙처리장치)에 저장되어 있어 열쇠를 기다리느라 시간이 걸릴 수도 있습니다. 또는, 책이 고속 선반(빠른 GPU 메모리)에 있는 멀리 떨어진 집으로 달려갈 수도 있지만, 그곳으로 가는 길이 교통 체증으로 막혀 있을 수도 있습니다.

이전의 방법들은 다음 중 하나를 통해 이 문제를 해결하려고 시도했습니다:

  1. 로컬에 머물기: 해당 서버가 느리거나 바쁘더라도 항상 가장 가까운 서버의 전문가를 사용하려고 시도합니다.
  2. 탐욕적 선택(Greedy Selection): 각 전문가에 대해 개별적으로 "최적의" 서버를 선택하지만, 특정 전문가를 위해 최적의 서버를 선택하는 것이 다른 전문가에게 최악의 경로를 강요하여 전체 그룹을 느리게 만들 수 있다는 점을 간과합니다.

논문은 이러한 기존 방식들이 전문가들을 독립적인 여행자로 취급하기 때문에 결함이 있다고 주장합니다. 실제로 그들은 하나의 팀입니다. 한 팀원이 느려지면 전체 팀이 느려집니다.

해결책: HetRoute의 "팀 캡틴"

HetRoute는 출발선에서 아무도 움직이기 전에 전체 미션을 계획하는 뛰어난 팀 캡틴 역할을 합니다. Het-Route는 네 가지 요소를 동시에 가중치로 두는 "통합 비용 모델(unified cost model)"을 사용합니다:

  1. 전송 비용(Transmission Cost): 인터넷을 통해 서버로 질문을 보내는 데 걸리는 시간.
  2. 로딩 비용(Loading Cost): 전문가가 이미 거기에 있지 않은 경우, 느린 하드 드라이브(CPU)에서 빠른 메모리 뱅크(GPU)로 이동하는 데 걸리는 시간.
  3. 계산 및 대기열(Computation & Queueing): 서버가 생각하는 속도와 질문이 다른 질문들 뒤에서 대기해야 하는 시간.
  4. 품질 페널티(Quality Penalty): 공간을 절약하기 위해 서버가 전문가의 "압축된" 버전을 사용하는 경우, 답변의 품질이 얼마나 저하되는지.

Het-Route는 오프라인(Offline) 단계와 온라인(Online) 단계의 두 단계로 작동합니다.

오프라인 단계 (지도 제작자):
질문이 던져지기 전에, Het-Route는 네트워크를 살펴보고 전문가의 복사본을 어디에 둘지 결정합니다. 이는 단순히 가장 가까운 서버에 두는 것이 아닙니다. 이 시스템은 다음과 같이 자문합니다: "만약 우리가 이 전문가의 복사본을 서버 B에 둔다면, 나중에 시간을 절약할 수 있을까?" 또한 어떤 전문가가 빠른 "GPU" 메모리에 머물러야 하고, 어떤 전문가가 느린 "CPU" 메모리에 머물 수 있는지 결정합니다. 결정적으로, Het-Route는 "중복(redundant)" 복사본을 생성합니다. 자동차에 스페어 타이어를 두는 것처럼, Het-Route는 인기 있는 전문가의 추가 복사본을 서로 다른 서버에 배치합니다. 이를 통해 특정 서버가 바쁘거나 고장 나더라도 팀 캡틴에게 다른 옵션이 있도록 보장합니다.

온라인 단계 (실시간 내비게이터):
실제 질문이 도착하면, Het-Route는 단순히 가장 가까운 서버를 선택하지 않습니다. 질문에 필요한 전문가 그룹 전체를 살펴봅니다. 이 시스템은 다음과 같이 묻습니다: "만약 우리가 전문가 A를 서버 X로 보내고 전문가 B를 서버 Y로 보낸다면, 총 소요 시간은 얼마인가?" 그리고 "병목 현상(bottleneck)"—즉, 팀에서 가장 느린 부분—을 계산합니다. 만약 서버 X는 빠르지만 서버 Y가 교통 체증에 갇혀 있다면, Het-Route는 비록 서버 Z가 조금 더 멀더라도, 팀 전체가 더 빨리 끝날 수 있다면 두 전문가 모두를 서버 Z로 보내기로 결정할 수 있습니다.

이 시스템은 "빔 서치(beam search)"(마치 손전등으로 몇 가지 최선의 경로를 동시에 비추는 것과 같은 기법)라는 영리한 기술을 사용하여, 가능성의 미로에 빠지지 않고 완벽한 서버 조합을 찾아냅니다.

결과: 더 빠르고, 더 똑똑하며, 더 안전하게

저자들은 다양한 속도와 연결성을 가진 10개의 에지 서버 네트워크에서 Het-Route를 테스트했습니다. 성능을 확인하기 위해 세 가지 서로 다른 대규모 AI 모델을 사용했습니다.

결과는 인상적이었습니다:

  • 속도: Het-Route는 기존의 가장 우수한 방법들과 비교했을 때 답변을 받는 데 걸리는 평균 시간을 59.0% 단축했습니다. 또한 "테일 레이턴시(tail latency)"(문제가 발생했을 때 나타나는 최악의 지연 시간)를 58.0% 줄였습니다.
  • 트래픽: 서버 간에 이동하는 데이터의 양을 72.1% 줄였습니다. 이는 데이터를 인터넷을 통해 보내는 것이 느리고 비용이 많이 들기 때문에 매우 중요한 성과입니다.
  • 처리량(Throughput): 이 시스템은 다른 방법들보다 초당 2.13배 더 많은 질문을 처리할 수 있었습니다.
  • 품질: 더 빨라졌음에도 불구하고, 답변의 품질은 매우 높게 유지되었습니다. "품질 저하(quality degradation)"(답변이 얼마나 나빠지는지)는 사전에 설정된 아주 작은 예산인 2% 이내로 유지되었습니다.

또한 논문은 자신들의 시스템이 수학적으로 "품질 안전(quality-safe)"함을 증명했습니다. 네트워크가 매우 바빠져서 일반적인 빠른 경로가 차단되더라도, Het-Route는 "풀 프리시전(full-precision)" 전문가(가장 높은 품질의 버전)로 질문을 라우팅하는 "폴백(fallback)" 계획을 가지고 있습니다. 이 전문가는 반드시 어딘가에 존재하도록 보장되어 있으므로, 시간이 조금 더 걸리더라도 답변의 품질이 나빠지는 일은 없을 것입니다.

이것이 왜 중요한가

이 논문은 우리가 속도와 품질 사이에서, 혹은 로컬 컴퓨팅과 원격 컴퓨팅 사이에서 하나를 포기할 필요가 없다는 것을 보여줍니다. AI 전문가를 개별적인 주자가 아닌 협력하는 팀으로 취급하고, 실시간 교통 상황과 컴퓨터의 상태를 기반으로 전체 경로를 계획함으로써, 우리는 강력한 AI를 네트워크의 "에지"(예: 당신의 휴대폰이나 로컬 서버)에서도 원활하게 실행할 수 있습니다. Het-Route는 AI의 미래가 단순히 더 큰 모델을 만드는 것뿐만 아니라, 모델을 어떻게 이동시키는지에 대해 더 똑똑해지는 것에 있다는 것을 시사합니다. 이는 혼란스럽고 교통 체증이 심한 네트워크를, 모든 전문가가 업무를 가장 빠르게 완수하기 위해 어디로 가야 할지 정확히 알고 있는 잘 짜인 기계로 탈바꿈시킵니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →