← 최신 논문
🤖 machine learning

OrderMoE: An expert similarity driven distributed edge MoE inference

OrderMoE는 전문가 유사성을 활용하여 원격 전문가를 위한 로컬 대체(local substitution)를 가능하게 함으로써, 추론 품질을 제어 가능한 수준으로 유지하면서도 지연 시간과 통신 오버헤드를 크게 줄여 분산 엣지 MoE 추론을 가속화하는 새로운 프레임워크이다.

원저자: Xin Yuan, Ning Li, Quan Chen, Wenchao Xu, Athanasios V. Vasilakos, Song Guo, Haijun Zhang

게시일 2026-07-21
📖 3 분 읽기☕ 가벼운 읽기

원저자: Xin Yuan, Ning Li, Quan Chen, Wenchao Xu, Athanasios V. Vasilakos, Song Guo, Haijun Zhang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

인터넷을 거대하고 북적이는 도시라고 상상해 보세요. 그곳에는 매우 똑똑한 컴퓨터들(거대 언어 모델이라고 불리는)이 살고 있습니다. 이 컴퓨터들은 어떤 질문에도 답할 수 있고, 이야기를 쓰거나 수학 문제를 풀 수도 있는 아주 명석한 사서들과 같습니다. 하지만 이 사서들은 너무 크고 무거워서 여러분의 휴대폰이나 동네 커피숍의 컴퓨터 안에는 들어갈 수 없습니다. 보통 질문을 하려면, 여러분의 휴대폰은 도시 너머에 있는 거대한 데이터 센터를 향해 질문을 외쳐야 하고, 거대한 사서가 생각할 시간을 기다린 뒤, 다시 답변이 돌아올 때까지 기다려야 합니다. 이 과정은 시간이 걸리며 도시의 "도로 공간"(대역폭)을 많이 사용합니다.

이를 더 빠르게 만들기 위해, 과학자들은 "전문가 혼합(Mixture of Experts, MoE)"이라는 새로운 종류의 사서를 발명했습니다. 하나의 거대한 두뇌 대신, 이 사서는 여러 명의 작은 전문가들로 이루어진 팀과 같습니다. 여러분이 질문을 하면, 똑똑한 매니저(라우터라고 불리는)가 특정 작업에 필요한 단 두세 명의 전문가만을 빠르게 골라내고 나머지는 무시합니다. 이 덕분에 사서는 훨씬 더 빠르고 가벼워집니다. 하지만 까다로운 점이 있습니다. 분산된 에지 시스템(distributed edge system)에서는, 이 전문가들이 하나의 큰 건물에 모여 있는 대신 서로 다른 로컬 서버들(예를 들어 서로 다른 커피숍이나 동네 허브들)에 흩어져 있습니다. 만약 라우터가 세 마을 떨어진 커피숍에서 일하고 있는 전문가를 선택한다면, 여러분의 휴대폰은 질문을 저 멀리까지 보내야 하고 답변이 돌아오기를 기다려야 합니다. 도로가 좁고 붐비는 도시에서는, 이 이동 시간이 거대한 데이터 센터와 대화하는 것만큼이나 느릴 수 있습니다.

여기에서 OrderMoE라는 새로운 연구가 등장합니다. 8개의 물리적 서버로 구성된 실제 테스트베드에서 연구를 진행한 연구진은 단순하지만 영리한 질문을 던졌습니다. "만약 라우터가 선택한 '정확한' 전문가에게 항상 질문을 보내는 대신, 바로 옆에 있고 거의 같은 일을 하는 '다른' 전문가를 사용할 수 있다면 어떨까?"

이 논문은 많은 전문가가 비록 이름은 다르더라도 실제로 매우 유사한 방식으로 사고한다는 점을 시사합니다. 저자들은 이들의 "사고 패턴"(라우터 유도 로짓이라고 불리는 것 사용)이 얼마나 유사한지 측정함으로써, 이 전문가들을 하나의 가족으로 묶을 수 있다는 것을 발견했습니다. 만약 라우터가 멀리 떨어진 곳에 있는 전문가를 선택하면, OrderMoE는 근처에 그 일을 대신 할 수 있을 만큼 충분히 유사한 "사촌" 전문가가 있는지 확인합니다. 만약 사촌이 있다면, 질문은 로컬에서 처리되어 도시를 가로지르는 길고 느린 여정을 아낄 수 있습니다.

하지만 연구진은 이것이 섬세한 균형 잡기라는 점을 알고 있었습니다. 진짜 전문가 대신 사촌을 사용하는 것은 시간을 절약할 수는 있지만, 답변이 아주 약간 덜 완벽해질 수도 있기 때문입니다. 이를 해결하기 위해 그들은 모든 질문에 대해, 근처의 사촌을 사용하는 것이 안전한지 아니면 멀리 있는 정확한 전문가를 기다리는 것이 가치가 있는지를 결정하는 스마트한 교통 관제사를 만들었습니다. 이 관제사는 또한 앞을 내다보며, 다음 단계에 대한 질문이 어디로 가야 할지 미리 생각하여, 다음 단계에 좋지 않은 곳으로 질문을 보내는 실수를 범하지 않도록 합니다.

연구진이 서로 다른 속도와 메모리 크기를 가진 8개의 서버 네트워크에서 OrderMoE를 테스트했을 때, 결과는 인상적이었습니다. 이 시스템은 다른 방법들과 비교했을 때 평균 대기 시간(지연 시간)을 약 40%에서 51%까지 줄였으며, 서버 간에 이동하는 데이터의 양을 엄청난 차이로 줄였습니다. 아마도 가장 중요한 점은, 답변의 품질이 거의 떨어지지 않았다는 것입니다—단지 아주 미미하고 거의 눈에 띄지 않는 수준이었습니다. 이 연구는 로컬 서버들이 유사한 전문가로 교체되도록 허용함으로써, 더 크고 비싼 데이터 센터를 구축하지 않고도 AI를 훨씬 더 빠르고 반응성이 좋게 만들 수 있음을 보여줍니다. 이는 마치 특정 종류의 샌드위치를 먹기 위해 옆 동네까지 운전해서 갈 필요가 없다는 것을 깨닫는 것과 같습니다. 바로 길 건너편 가게에도 아주 비슷한 샌드위치가 있고, 그것을 몇 초 만에 바로 먹을 수 있는 것처럼 말이죠.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →