← 최신 논문
💬 NLP

OmniMoE: An Efficient MoE by Orchestrating Atomic Experts at Scale

OmniMoE는 카테시안 곱 라우터(Cartesian Product Router)와 전문가 중심 스케줄링(Expert-Centric Scheduling)과 같은 새로운 구성 요소를 통해 혼합 전문가(Mixture-of-Experts)의 입도(granularity)를 벡터 수준까지 밀어붙임으로써 높은 정확도와 상당한 추론 속도 향상을 모두 달성하는 시스템-알고리즘 공동 설계 프레임워크입니다.

원저자: Jingze Shi, Zhangyang Peng, Yizhang Zhu, Yifan Wu, Guang Liu, Yuyu Luo

게시일 2026-07-02
📖 3 분 읽기☕ 가벼운 읽기

원저자: Jingze Shi, Zhangyang Peng, Yizhang Zhu, Yifan Wu, Guang Liu, Yuyu Luo

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 수백만 권의 책(데이터)을 즉각적으로 처리해야 하는 거대하고 고속인 도서관을 운영하고 있다고 상상해 보십시오. 인공지능의 세계에서 이 도서관은 "모델"이며, 책들은 모델이 이해해야 할 정보입니다.

오랫동안 이 도서관들은 두 가지 주요 작업 방식을 가졌으나, 두 방식 모두 큰 문제를 안고 있었습니다:

  1. "대규모 팀" 방식 (Coarse-Grained, 거친 입자): 당신이 질문을 던질 때마다 256명의 사서로 구성된 팀 전체를 호출하는 것과 같습니다. 단 하나의 특정 사실만 필요하더라도 256명의 사서가 모두 일을 시작합니다. 이 방식은 그룹으로 함께 움직이기 때문에 빠르지만, 대부분의 사서가 당신의 구체적인 질문과 관련 없는 일을 하게 되므로 엄청난 에너지 낭비가 발생합니다.
  2. "개별 전문가" 방식 (Fine-Grained, 미세한 입자): 에너지를 아끼기 위해 수백만 명의 작고 초전문화된 사서들을 고용합니다. 질문을 할 때마다 그 사실을 정확히 알고 있는 단 한 명의 완벽한 사서만을 호출합니다. 이는 자원 측면에서 매우 효율적이지만, 물류 측면에서는 악몽입니다. 흩어져 있는 수백만 명의 작은 전문가들을 찾아 도서관을 돌아다니는 데 너무 많은 시간이 걸립니다. 사서들이 책을 읽는 시간보다 자신의 책상으로 걸어가는 데 더 많은 시간을 쓰게 됩니다.

OmniMoE의 등장: 궁극의 사서 시스템

이 논문은 두 세계의 장점을 결합한 새로운 시스템인 OmniMoE를 소개합니다. 이것은 마치 믿을 수 없을 정도로 정밀하면서도 번개처럼 빠른 도서관과 같습니다. 작동 원리는 다음과 같이 세 부분으로 나뉩니다:

1. "원자적" 사서들 (작은 전문가들)

전체 팀을 고용하는 대신, OmniMoE는 "원자적 전문가(Atomic Experts)"를 고용합니다. 이들은 지식의 가장 작은 단위입니다. 즉, 책의 한 장(Chapter)이 아니라 단 하나의 완벽한 문장이나 사실 같은 형태를 띱니다.

  • 혁신: 질문을 하면 시스템은 단순히 한 명의 사서를 선택하는 것이 아니라, 그 질문만을 위한 맞춤형 팀을 동적으로 구성합니다. 이는 당신이 입력하는 매 단어마다 맞춤형 퍼즐 조각을 만드는 것과 같습니다.

2. "카테시안 곱(Cartesian Product)" 지도 (스마트 주소 시스템)

수백만 명의 작은 전문가를 보유하는 것의 문제는, 그들을 어떻게 빨리 찾느냐는 것입니다. 만약 1,000만 명의 이름을 일일이 확인해야 한다면 너무 오래 걸릴 것입니다.

  • 해결책: OmniMoE는 "카테시안 곱 라우터(Cartesian Product Router)"를 사용합니다. 도서관이 이름이 적힌 거대한 명단이 아니라, 거대한 격자(엑셀 시트의 행과 열 같은 구조)라고 상상해 보십시오.
  • 도움이 되는 방식: 시스템은 수백만 명의 이름 중에서 특정 이름을 찾는 대신, 그 사서가 앉아 있는 "행(Row)"과 "열(Column)"을 찾습니다. 이는 "사서 Bob"을 찾는 대신 "5행 3열로 가시오"라고 말하는 것과 같습니다. 이 방식은 거대하고 느린 검색을 작고 즉각적인 계산으로 바꿔줍니다.

3. "전문가 중심" 버스 시간표 (교통 체증 해결사)

스마트한 지도가 있더라도, 버스가 흩어져 있는 1,000명의 전문가를 한 명씩 태우러 다닌다면 버스는 교통 체증(이를 "메모리 병목 현상"이라고 합니다)에 갇히게 될 것입니다. 버스는 멈추고 출발하는 데 모든 시간을 허비할 것입니다.

  • 해결책: OmniMoO는 작업 순서를 변경합니다. 버스가 각 질문마다 전문가를 한 명씩 태우러 가는 대신, 전문가들을 먼저 그룹화합니다.
  • 비유: 버스 기사가 "자, '과학' 섹션으로 가는 분들 먼저 타세요. 그다음 '역사' 섹션 분들을 태우겠습니다"라고 말하는 것과 같습니다. 버스는 한 번에 한 그룹의 전문가를 태워 작업 구역으로 이동하며, 그들은 커다란 효율적인 블록을 이루어 함께 일합니다. 이는 혼란스럽고 멈추고 가기를 반복하는 교통 체증을 매끄럽고 고속인 고속도로로 바꿉니다.

결과: 빠르고, 저렴하며, 똑똑함

이 시스템은 현재 최고의 방법들과 성능을 테스트했습니다:

  • 속도: 이전 최고의 "작은 전문가" 시스템보다 10.9배 더 빠릅니다. 73밀리초(ms) 걸리던 작업을 단 6.7밀리초로 단축했습니다.
  • 지능: 또한 더 정확합니다. 희귀하고 구체적인 사실을 다루는 작은 전문가들 옆에 "공통 밀집 MLP(Shared Dense MLP, 일반 상식과 문법을 처리하는 범용 뇌)"를 유지함으로써, 추론 능력을 잃지 않습니다.
  • 효율성: 컴퓨터 메모리를 훨씬 더 잘 사용하여, 시스템을 느리게 만드는 "교통 체증"을 방지합니다.

요약하자면
OmniMoE는 AI 모델이 속도를 늦추지 않으면서도 수백만 개의 작고 초정밀한 전문가를 사용할 수 있게 해주는 영리한 기술입니다. 이는 전문가들을 격자 형태로 조직하여(빠르게 찾기 위해) 그리고 버스 시간표처럼 업무를 그룹화하여(빠르게 이동하기 위해) 수행합니다. 그 결과, 매우 상세한 지식을 갖추면서도 실용적일 만큼 빠른 AI가 탄생했습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →