← 최신 논문
💬 NLP

Mix-MoE: Improving Multilingual Machine Translation of Large Language Models through Mixed MoEs

본 논문은 언어 모델과 기계 번역 전문가를 분리하고 푸리에 변환 기반 라우팅을 활용하여 매개변수 간섭을 효과적으로 완화하고 대규모 언어 모델에서 다국어 기계 번역 성능을 크게 향상시키는 2 단계 전문가 혼합 (Mix-MoE) 프레임워크를 제안합니다.

원저자: Bo Li, Tianyu Dong, Shaolin Zhu, Deyi Xiong

게시일 2026-05-26
📖 3 분 읽기☕ 가벼운 읽기

원저자: Bo Li, Tianyu Dong, Shaolin Zhu, Deyi Xiong

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

상상해 보세요. 여러분은 수년 동안 여러 언어로 된 수백만 권의 책을 읽어 온 천재적인 다국어 사서 (대형 언어 모델) 를 보유하고 있습니다. 이 사서는 자신이 읽어 온 어떤 언어에서도 이야기, 문법, 사실을 이해하는 데 놀라운 능력을 지니고 있습니다. 하지만 이 사서에게 새로운 업무를 맡긴다면? 바로 한 언어에서 다른 언어로 책을 번역하는 일입니다. 이때 그들은 혼란을 겪을 수 있습니다.

왜일까요? 사서가 읽기번역을 위해 동일한 뇌 세포를 사용하려 하기 때문입니다. 새로운 번역 업무에 집중할 때, 그들은 이미 가지고 있던 깊은 읽기 실수를 실수로 "덮어쓰기"하거나 잊어버릴 수 있습니다. 이를 파라미터 간섭이라고 합니다. 즉, 새로운 업무가 기존 실력을 망가뜨리는 것입니다.

이 논문은 이러한 사서들이 아무것도 잊지 않고 두 가지 업무 모두를 완벽하게 수행할 수 있도록 훈련시키는 새로운 지적인 방법인 Mix-MoE를 소개합니다. 작동 원리를 간단한 부분으로 나누어 설명해 보겠습니다.

1. "전문 팀" 비유

한 개의 뇌에게 모든 일을 시키는 대신, Mix-MoE 는 작업을 두 개의 전문 팀으로 나눕니다. 마치 도서관에 두 개의 서로 다른 부서를 고용하는 것과 같습니다.

  • "읽기 팀" (LM 전문가): 이들은 사서의 원래 초능력을 유지하는 전문가들입니다. 언어가 작동하는 방식 (문법, 어휘, 이야기 구성) 에 대한 도서관의 방대한 지식을 유지하도록 훈련됩니다. 그들의 임무는 사서가 언어를 이해하는 방법을 결코 잊지 않도록 보장하는 것입니다.
  • "번역 팀" (MT 전문가): 이들은 언어 A 에서 언어 B 로 단어를 바꾸는 방법을 배우기 위해 특별히 고용된 새로운 전문가들입니다. 오직 번역 쌍 (translation pairs) 만으로 훈련됩니다.

마법의 트릭: 사서가 번역을 배우는 동안 "읽기 팀"은 "동결 (frozen)" 상태로 설정됩니다. 그들은 단 한 가지도 변경되지 않습니다. 이로써 사서의 원래 지식이 안전하게 보존되는 동안, "번역 팀"이 새로운 업무를 위한 모든 중량을 담당하게 됩니다.

2. "이단계 훈련" 과정

이 논문은 마치 두 학기제 학교 프로그램과 같은 구체적인 훈련 일정을 제안합니다.

  • 1 학기 (읽기 캠프): "읽기 팀"은 단일 언어로 된 책을 읽는 추가 연습을 받습니다. 이는 언어 구조에 대한 그들의 이해를 날카롭게 합니다.
  • 2 학기 (번역 캠프): 이제 "읽기 팀"은 sidelines (동결 상태) 에 앉아 있습니다. "번역 팀"은 문장 쌍 (예: 영어의 "Hello"와 스페인어의 "Hola") 을 사용하여 훈련을 시작합니다. 읽기 팀이 변경되지 않기 때문에, 사서는 새로운 번역 기술을 배우는 동안 원래 실력을 잃지 않습니다.

3. "주파수 튜너" (FFT 라우팅)

사서는 어떻게 도움을 받을 전문가를 호출해야 할지 알까요? 대부분의 시스템에서는 단어의 의미만 봅니다. 하지만 Mix-MoE 는 **FFT(고속 푸리에 변환)**라는 특별한 도구를 추가합니다.

언어를 단순히 단어가 아니라 노래로 생각해 보세요. 모든 언어는 고유한 리듬, 비트, 그리고 "주파수"를 가지고 있습니다 (드럼 비트와 바이올린의 차이처럼).

  • 표준 시스템은 가사(의미) 만 듣습니다.
  • Mix-MoE 의 라우팅 메커니즘은 문장의 리듬과 비트(구조적 패턴) 도 듣습니다.

텍스트의 "주파수"를 분석함으로써 시스템은 다음과 같이 더 잘 결정할 수 있습니다. "이 문장은 터키어 특유의 복잡한 리듬을 가지고 있으므로, 터키어 구조에 뛰어난 전문가 #2 를 호출하자" 또는 "이것은 간단한 영어 문장이니 전문가 #1 을 호출하자". 이를 통해 올바른 전문가가 업무를 더 효율적으로 수행할 수 있습니다.

4. 결과

저자들은 이 시스템을 중국어 - 영어, 독일어 - 영어 등 14 가지 다른 언어 쌍으로 테스트했습니다.

  • 문제: 기존 방법들은 번역을 배우려 할 때 종종 사서의 원래 읽기 실력을 떨어뜨렸습니다.
  • Mix-MoE 해결책: 새로운 방법은 읽기 실력을 온전하게 유지하면서 번역 품질을 크게 향상시켰습니다. 이는 모든 다른 "표준" 방법들을 능가하여, 한 개의 뇌에 모든 일을 강요하는 것보다 팀을 분리하고 언어의 "리듬"을 듣는 것이 더 효과적임을 입증했습니다.

요약

Mix-MoE는 다국어 전문가에게 번역 작업을 위한 전문 조수를 제공하는 것과 같습니다. 전문가의 뇌를 과부하시켜 원래 실력에 대한 기억 상실을 위험에 빠뜨리는 대신, 시스템은 전문가의 지식을 동결시키고 새로운 전문 팀이 번역을 처리하도록 합니다. 심지어 올바른 조수가 업무에 선택되도록 하는 "리듬 감지기"도 사용합니다. 그 결과, 언어를 처음부터 어떻게 말하는지 잊지 않으면서도 매우 숙련된 번역기가 탄생합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →