← 최신 논문
💬 NLP

\infty-MoE: Generalizing Mixture of Experts to Infinite Experts

이 논문은 토큰당 거대 피드포워드 네트워크 파라미터의 연속적인 부분을 선택함으로써 전문가 혼합(Mixture of Experts)을 무한한 공간으로 일반화하여, 방대한 수의 전문가를 통한 효과적인 학습을 가능하게 하는 동시에 훨씬 더 큰 밀집 모델(dense models)에 필적하는 성능을 달성하고 유연한 정확도-속도 트레이드오프를 제공하는 새로운 아키텍처인 \infty-MoE를 제안한다.

원저자: Shota Takashiro, Takeshi Kojima, Shohei Taniguchi, Yusuke Iwasawa, Yutaka Matsuo

게시일 2026-01-27
📖 4 분 읽기☕ 가벼운 읽기

원저자: Shota Takashiro, Takeshi Kojima, Shohei Taniguchi, Yusuke Iwasawa, Yutaka Matsuo

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 모든 책이 지식의 조각을 나타내는 거대하고 첨단 기술이 집약된 도서관을 운영하고 있다고 상상해 보세요. 전통적인 도서관(표준 AI 모델)에서는 몇 명의 매우 크고 범용적인 사서들이 있습니다. 당신이 질문을 하면, 모든 사서가 그 질문에 답하려고 노력하며, 그들의 답변은 하나로 혼합됩니다. 이는 정확하지만, 모든 질문에 대해 그들 모두를 고용해야 하므로 느리고 비용이 많이 듭니다.

이를 해결하기 위해 연구자들은 **Mixture of Experts (MoE)**를 발명했습니다. 모든 사람이 일하게 하는 대신, "수석 사서"(라우터라고 불림)가 당신의 질문을 보고 딱 두 명의 특정 사서만을 골라 답변하게 합니다. 이는 훨씬 빠르고 저렴합니다. 하지만 함정이 있습니다. 이 전통적인 설정에서는 사서를 정확히 몇 명 고용할지(예: 16명 또는 100명) 미리 결정해야 합니다. 만약 너무 많은 사서를 고용하면, 수석 사서가 누구를 선택해야 할지 혼란스러워하며 전체 시스템을 훈련시키는 것이 악몽이 됩니다. 이는 마치 한 번에 두 명하고만 대화할 수 있는 상황에서 1,000명의 팀을 관리하려는 것과 같습니다. 모두의 발을 맞추기가 매우 어렵습니다.

새로운 아이디어: ∞-MoE (무한 전문가 혼합)

이 논문의 저자들(도쿄 대학교)은 대담한 질문을 던졌습니다: 만약 전문가의 수가 정해져 있지 않다면 어떨까? 만약 우리가 무한한 수의 전문가를 가질 수 있다면?

그들은 이 새로운 시스템을 ∞-MoE라고 부릅니다. 다음은 간단한 비유를 통한 작동 방식입니다:

1. 연속적인 "전문가 공간" (Continuous "Expert Space")

사서 #1, 사서 #2, 사서 #3이 한 줄로 앉아 있는 대신, 사서들이 무한하고 연속적인 지도 위에 퍼져 있다고 상상해 보세요.

  • 기존 시스템에서는 지도의 특정 지점(예: "좌표 5에 있는 사서")을 선택해야 했습니다.
  • 새로운 시스템에서 수석 사서는 당신이 질문을 던질 때마다 지도 위에 하나의 **구름(cloud)**을 그립니다. 이 구름은 도움이 될 수도 있는 전문가들의 범위를 나타냅니다.

2. 선택이 아닌 샘플링 (Sampling Instead of Picking)

당신이 질문을 하면, 수석 사서는 단순히 특정 인물 두 명을 고르는 것이 아닙니다. 대신, 그 구름으로부터 "스냅샷"(샘플)을 찍습니다.

  • 그는 좌표 5.2 지점을 선택할 수도 있습니다.
  • 그는 좌표 5.3 지점을 선택할 수도 있습니다.
  • 지도가 연속적이기 때문에, 그가 스냅샷을 찍을 때마다 그는 이전에 존재한 적 없는 고유한 전문가를 얻게 됩니다.

3. "마스크" (뉴런을 켜고 끄는 법)

무한한 전문가를 가지면서 어떻게 무한한 컴퓨터를 만들지 않을 수 있을까요? 비밀은 **마스크(mask)**에 있습니다.
AI의 뇌를 거대한 전구 격자(뉴urn)라고 생각해 보세요.

  • 표준 AI에서는 모든 전구가 켜져 있습니다.
  • 기존의 MoE에서는 라우터가 전문가 #1을 위한 특정 전구 블록을 켜고, 전문가 #2를 위한 다른 블록을 켭니다.
  • ∞-MoE에서는, "샘플"(지도의 좌표)이 스텐실(stencil) 역할을 합니다. 시스템은 거대한 전구 격자를 가져와서 스텐실을 사용하여 해당 질문에 대해 가장 밝은 상위 25%의 전구만을 켭니다.
  • 샘플이 연속적인 숫자이기 때문에, 매 질문마다 켜지는 전구의 패턴이 약간씩 달라집니다. 이는 마치 당신이 입력하는 모든 문장에 대해 고유하고 맞춤 제작된 도구를 갖는 것과 같지만, 이미 가지고 있는 부품들로만 그 도구를 만드는 것과 같습니다.

이것이 왜 큰 뉴스인가요?

저자들은 이 모델을 두 가지 모델(GPT-2 Small 및 Medium)로 테스트했으며 놀라운 결과를 발견했습니다:

  1. 더 적은 "활성" 뇌로 더 나은 성능 구현:
    1억 2,900만 개의 활성 파라미터(실제로 작동하는 부분)를 가진 ∞-MoE 모델은 3억 5,000만 개의 파라미터를 가진 표준 밀집(dense) 모델만큼 잘 작동했습니다. 이는 거대한 뇌의 지능을 얻으면서도 작은 뇌의 에너지만을 사용하는 것과 같습니다.

  2. 유연성:
    기존의 MoE에서는 속도를 높이고 싶다면 모델 전체를 다시 훈련시켜야 했습니다. 하지만 ∞-MoE에서는 질문을 던지는 순간에 "샘플"(스냅샷)의 수를 그냥 변경할 수 있습니다.

    • 속도가 필요하다면? 샘플(전문가)을 적게 가져옵니다.
    • 최대 정확도가 필요하다면? 샘플을 더 많이 가져옵니다.
    • 논문은 모델 자체를 바꾸지 않고도 이 설정을 조정하는 것만으로 표준 MoE보다 2.5%의 정확도 향상을 얻을 수 있음을 보여줍니다.
  3. 안정성:
    기존 시스템에 더 많은 전문가를 추가할 때 발생하는 문제 중 하나는 시스템이 불안정해지고 훈련하기 어려워진다는 것입니다. ∞-MoE는 전문가를 별개의 떨어진 목록이 아닌 매끄럽고 연속적인 공간으로 취급하기 때문에, 전문가의 "수"가 무한대를 향해 증가하더라도 훈련이 안정적으로 유지됩니다.

한계점 (Limitations)

저자들은 자신들이 아직 해결하지 못한 부분에 대해서도 솔직하게 밝히고 있습니다:

  • 규모 확장 (Scaling Up): 그들은 이 모델을 중간 규모의 모델로 테스트했습니다. 오늘날 기업들이 사용하는 거대한 모델(GPT-4 규모 등)에서도 어떻게 작동할지는 아직 확실하지 않지만, 잘 작동할 것으로 기대하고 있습니다.
  • 하드웨어 속도: 수학적으로는 빨라야 하지만, 실제 컴퓨터 코드는 까다롭습니다. 단어 하나하나마다 켜지는 "전구"가 바뀌기 때문에, 표준 컴퓨터 칩이 이들을 한꺼번에 효율적으로 처리하기 어렵습니다. 그들은 이를 빠르게 실행하기 위해 특수한 코드를 작성해야 했으며, 여전히 개선의 여지가 있습니다.

요 요약

∞-MoE는 고정된 전문가 팀에서 형태가 변하는 무한한 팀으로 업그레이드하는 것과 같습니다. 100명의 특정 인원을 고용하는 대신, 당신은 이미 가지고 있는 부품만을 사용하여 매 질문마다 고유하고 완벽한 전문가를 즉석에서 만들어내는 마법 같은 기계를 갖게 됩니다. 이를 통해 AI는 거대한 정적 뇌의 비용에 짓눌리지 않고도 더 똑똑하고 유연해질 수 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →