← 최신 논문
📊 statistics

Expert Merging in Sparse Mixture of Experts with Nash Bargaining

이 논문은 나쉬 협상(Nash Bargaining)과 복소 모멘텀(complex momentum)을 활용하여 균형 잡힌 협업과 가속화된 수렴을 달 수 있도록 설계된 희소 전문가 혼합(Sparse Mixture of Experts)을 위한 새로운 전문가 병합 프레임워크인 NAMEx를 소개하며, 다양한 태스크와 대규모 모델 전반에서 우수한 성능을 입증한다.

원저자: Dung V. Nguyen, Anh T. Nguyen, Minh H. Nguyen, Luc Q. Nguyen, Shiqi Jiang, Ethan Fetaya, Linh Duy Tran, Gal Chechik, Tan M. Nguyen

게시일 2026-06-01
📖 3 분 읽기☕ 가벼운 읽기

원저자: Dung V. Nguyen, Anh T. Nguyen, Minh H. Nguyen, Luc Q. Nguyen, Shiqi Jiang, Ethan Fetaya, Linh Duy Tran, Gal Chechik, Tan M. Nguyen

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 어렵고 복잡한 문제를 해결하기 위해 거대하고 똑똑한 전문가 팀(이하 "전문가")을 구축했다고 상상해 보십시오. 현대 AI에서 이러한 팀은 종-종 희소 전문가 혼합(Sparse Mixture of Experts, SMoE) 구조로 조직됩니다. 이것은 마치 거대한 병원과 같아서, 환자가 올 때마다 특정 분야의 의사 몇 명만 호출되고 나머지 의사들은 휴식을 취하는 것과 같습니다. 이는 에너지와 비용을 절약해주지만, 새로운 문제를 낳습니다: 모델을 배포할 때 이 모든 전문가의 지식을 어떻게 하나의 단일한 '슈퍼 의사'로 결합할 것인가?

현재 대부분의 AI 팀은 모든 전문가의 조언을 단순히 "평균 내는" 방식을 사용합니다. 이것은 마치 수십 명의 요리사에게 각자의 비밀 레시피를 적어오라고 한 뒤, 그 재료들을 커다란 솥에 넣고 섞어서 결과물이 맛있기를 바라는 것과 같습니다. 대개 결과는 좋지 않습니다. 어떤 요리사는 수프에는 뛰어나지만 디저트에는 형편없을 수 있는데, 이들을 단순히 평균 내버리면 수프도 디저트도 망쳐버리게 됩니다.

이 논문은 전문가들을 혼합하는 새로운 방법인 NAMEx(Nash Merging of Experts)를 소개합니다. 이 방식이 어떻게 작동하는지 쉬운 비유를 통해 설명하겠습니다.

1. 문제점: "평균"은 나쁜 타협안이다

저자들은 전문가를 단순히 평균 내는 것이 나쁜 협상과 같다고 주장합니다. 만약 한 전문가는 "소금을 넣으라"고 하고 다른 전문가는 "설탕을 넣으라"고 한다면, 단순 평균은 "둘 다 조금씩 넣으라"는 결과를 낼 수 있으며, 이는 결국 짜고 단 맛이 나는 이상한 수프를 만들 뿐입니다. 아무도 승리하지 못하는 결과입니다.

2. 해결책: "공정한 협상"의 게임

저자들은 단순히 평균을 내는 대신, 전문가들을 하나의 게임(구체적으로는 "내쉬 협상(Nash Bargaining)" 게임)의 플레이어로 취급합니다.

  • 플레이어: 각 전문가는 자신만의 고유한 "효용(utility)"(자신이 잘하는 것)을 가진 플레이어입니다.
  • 목표: 그들은 모두가 최대한 만족하면서도, 누구도 자신이 잘 못 하는 일을 강요받는다고 느끼지 않는 단 하나의 지침 세트(병합된 모델)에 합의해야 합니다.
  • 결과: 시스템은 "파레토 최적(Pareto optimal)" 지점을 찾아냅니다. 친구 무리가 어디서 저녁을 먹을지 결정하는 상황을 상상해 보십시오. 단순 평균은 모두에게 "괜찮지만" 누구에게도 최고는 아닌 장소를 고를 수 있습니다. 하지만 내쉬 협상 솔루션은 각자의 구체적인 요구가 존중되었기 때문에 모두가 진심으로 만족할 수 있는 식당을 찾아냅니다.

논문에서 저자들은 이 "공정한 협상"이 단순히 평균을 내는 것보다 더 나은 최종 모델을 만든다는 것을 수학적으로 증명합니다.

3. 속도 향상: "복소 모멘텀(Complex Momentum)"

이전 방식(EP-CAMEx라고 불림)도 이와 유사한 시도를 했으나, 마치 내용을 이해하지 못한 채 같은 페이지를 계속 반복해서 읽는 학생처럼 학습 속도가 느렸습니다.

저자들은 NAMEx에 **복소 모멘텀(Complex Momentum)**을 추가했습니다.

  • 비유: 무거운 쇼핑 카트를 미는 상황을 상상해 보십시오.
    • 표준 모멘텀: 카트를 앞으로 밀면, 카트가 앞으로 계속 조금씩 굴러갑니다.
    • 복소 모멘텀: 카트가 단순히 앞뒤로만 움직이는 것이 아니라, 복잡하게 소용돌이치며 옆으로도 움직일 수 있는 궤도 위에 있다고 상상해 보십시오. 이는 카트가 까다로운 코너(전문가 간의 충돌)를 훨씬 더 빠르고 부드럽게 통과하도록 도와줍니다.
  • 주장: 이 수학적 기법은 전문가들이 최종 모델에 대해 "합의"하는 과정을 훨씬 더 빠르고 안정적으로 만들어 줍니다. 특히 전문가들의 의견이 매우 다르거나 서로 충돌할 때 더욱 효과적입니다.

4. 테스트 내용 (결과)

연구팀은 이 새로운 "협상 팀"을 여러 실제 작업에 테스트했습니다.

  • 언어: AI가 더 나은 텍스트를 쓰도록 함 (WikiText-103).
  • 이해력: 질문에 답하고 문장을 이해함 (GLUE 벤치마크).
  • 시각: 이미지에서 사물을 인식함 (ImageNet). 이때 이미지가 흐릿하거나, 예술적이거나, 이상한 형태(손상된 데이터)인 경우를 포함합니다.
  • 거대 모델: DeepSeek-MoEQwen1.5-MoE(수십억 개의 파라미터를 가진 모델)와 같은 거대하고 실제적인 AI 시스템에서도 테스트했습니다.

결과:
거의 모든 테스트에서 "협상 팀"(NAMEx)은 "단순 평균 팀"과 "느린 기존 팀"을 압도했습니다. NAMEx는 글쓰기, 이해력, 사물 인식 능력에서 더 뛰어난 성능을 보였습니다. 이미지가 지저도 있거나 질문이 어려울 때도 NAMEx는 다른 모델들보다 더 강력한 성능을 유지하며 버텨냈습니다.

요약

이 논문은 AI 전문가들을 단순히 섞는 대신, 게임 이론을 사용하여 그들이 협상하게 해야 한다고 제안합니다. 병합 과정을 공정한 협상 게임으로 취급하고, 이를 가속화하기 위해 특수한 "복소 모멘텀"을 추가함으로써, 언어, 시각 및 대규모 작업 전반에서 더 강력하고 견고한 AI 모델을 구축하는 방법을 만들어냈습니다.

참고: 이 논문은 이러한 AI 시스템을 구축하고 병합하는 수학적 방법에 전적으로 집중하며, 성능을 표준 벤치마크로 테스트하는 데 목적이 있습니다. 이 모델이 의료적 적용, 임상적 용도 또는 이 외의 구체적인 미래의 영향력을 가진다는 주장은 하지 않습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →