← 최신 논문
💬 NLP

Tying the Loop -- Tied Expert Layers in Mixture-of-Experts Language Models

이 논문은 Mixture-of-Experts 모델의 연속적인 트랜스포머 레이어 간에 전문가 파라미터를 공유함으로써 성능에 미치는 영향은 미미하면서도 메모리 요구량을 거의 절반으로 줄여, 대규모 언어 모델의 학습 및 확장을 위한 연산 대 메모리 효율성을 크게 개선하는 방법인 Expert Tying을 소개한다.

원저자: Martin Jaggi

게시일 2026-06-16
📖 4 분 읽기☕ 가벼운 읽기

원저자: Martin Jaggi

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

다음은 "Tying the Loop" 논문을 일상적인 비유와 쉬운 언어로 설명한 내용입니다.

거대한 문제: "거대한 도서관" vs. "작은 독자"

당신이 사람들이 이야기를 쓰거나 문제를 해결하는 것을 돕기 위해 아주 똑똑하고 거대한 로봇 사서(대규모 언어 모델, LLM)를 만들고 있다고 상상해 보세요.

이 사서를 믿을 수 없을 정도로 똑똑하게 만들기 위해, 당신은 그들에게 수십억 권의 책(이것들은 "파라미터" 또는 "전문가"입니다)이 있는 거대한 도서관에 대한 접근 권한을 줍니다. 하지만 사서가 빠르고 효율적으로 움직이게 하기 위해, 당신은 문장을 읽을 때마다 단 한두 권의 특정 책만 펼쳐서 답을 찾도록 결정합니다. 이것을 혼합 전문가(Mixture-of-Experts, MoE) 모델이라고 부릅니다.

문제점: 사서가 한 번에 아주 적은 양의 책만 읽더라도, 도서관 전체를 물리적으로 방 안에 계속 보관해야 합니다 (컴퓨터 메모리에). 만약 도서관에 1,000권의 책이 있는데 사서가 한 번에 10권만 펼쳐본다고 해도, 1,000권을 모두 수용할 수 있을 만큼 큰 방이 필요합니다. 이 때문에 "읽기"(연산)는 적은데도 "방"(메모리)은 너무 커서 시스템이 매우 비싸고 느려집니다.

해결책: "루프 묶기 (Tying the Loop)"

저자들은 **전문가 결합(Expert Tying)**이라는 영리한 트릭을 제안합니다.

사서가 32개의 방(레이어)이 있는 긴 복도에서 일한다고 상상해 보세요. 표준 설정에서는 모든 방이 각자 고유한 1,000권의 책 세트를 가지고 있습니다.

  • 기존 방식: 1번 방에는 A부터 Z까지의 책이 있고, 2번 방에도 A부터 Z까지의 책이 있으며(다른 복사본이지만), 3번 방에도 A부터 Z까지의 책이 있습니다(또 다른 복사본). 즉, 32세트의 책이 필요합니다.
  • 새로운 방식 (Expert Tying): 당신은 1번, 2번, 3번 방에 있는 책들이 사실 매우 유사한 일을 하고 있다는 것을 깨닫습니다. 그래서 이들을 하나로 묶기로(tie) 합니다. 하나의 책 세트를 이동식 카트에 담아 1번 방에서 2번 방, 3번 방으로 옮깁니다. 사서는 세 개의 방 모두에서 동일한 물리적 책을 사용합니다.

결과: 이제 32세트의 책이 필요하지 않습니다. 3개 방마다 단 1세트의 책만 있으면 됩니다. 이렇게 하면 "도서관"(메모리)의 크기를 거의 절반으로 줄일 수 있지만, 사서는 여전히 한 번에 한 권의 책만 펼쳐보기 때문에 읽는 속도는 그대로 유지됩니다.

핵심 비결: 무엇을 묶고 무엇을 분리할 것인가?

연구진은 단순히 무턱대고 모든 것을 묶은 것이 아닙니다. 그들은 사서를 멍청하게 만들지 않으면서 정확히 무엇을 공유할 수 있는지 알아내기 위해 실험을 진행했습니다.

도서관의 한 방을 네 가지 부분으로 나누어 생각해 봅시다:

  1. 책 (전문가/Experts): 실제 지식.
  2. 사서의 안경 (어텐션/Attention): 단어를 바라보는 방식.
  3. 인덱스 카드 (라우터/Router): 어떤 책을 고를지 결정.
  4. 책상 (정규화/Normalization): 노트를 정리하는 방식.

발견된 사실:

  • 책을 공유하는 것은 괜찮습니다: 여러 방에서 동일한 책을 공유할 수 있습니다. **안경(Attention)**이 방마다 다르기 때문에 사서는 여전히 훌륭한 일을 할 수 있습니다. 안경은 사서가 단어를 보는 방식을 바꾸며, 이를 통해 각 방이 동일한 책을 쓰더라도 각기 고유한 느낌을 갖게 합니다.
  • 안경을 공유하지 마세요: 만약 안경까지 공유한다면 사서는 혼란에 빠지고 품질이 떨어집니다.
  • "서곡과 종결(Prelude and Coda)" 규칙: 사서가 책을 받는 첫 번째 방과 답을 쓰는 마지막 방은 자신만의 고유한 책이 필요합니다. 만약 첫 번째와 마지막 단계에서도 공유 카트를 사용하도록 강제하면 품질이 저하됩니다. 따라서 처음 두 개와 마지막 두 개의 방은 고유하게 유지하고, 중간 단계의 것들을 서로 묶으십시오.

결과: 더 빠르고, 더 작으며, 똑똑하기까지 함

연구진은 이 기술을 세 가지 유명한 AI 모델(OLMoE, Qwen3, DeepSeek)에 테스트했습니다. 결과는 다음과 같습니다.

  1. 메모리 절감: 전문가들을 4개씩 묶음으로써, 전체 필요한 메모리를 **40%에서 50%**까지 줄였습니다. 이는 도서관의 크기를 절반으로 줄이는 것과 같습니다.
  2. 지능 저하 없음: "똑똑함"(Perplexity 및 정확도)은 거의 떨어지지 않았습니다. 원래의 거대한 모델과 거의 비슷했습니다.
  3. 속도 향 boost: 컴퓨터가 메모리에 불러와야 할 책이 적어졌기 때문에, 학습 과정이 23% 더 빨라졌습니다.
  4. "재투자" 트릭: 책을 공유함으로써 공간을 많이 아꼈기 때문에, 그 아낀 공간을 활용해 공유 카트에 더 많은 책을 추가했습니다. 그 결과, 동일한 메모리를 사용하면서도 원래 모델보다 오히려 더 나은 모델을 만들어냈습니다.

요약 비유

고층 빌딩을 짓는 건설팀을 상상해 보세요.

  • 기존 방식: 모든 층마다 고유하고 완벽하게 갖춰진 공구함이 있습니다. 모든 공구함을 실어 나르는 트럭은 거대하고 비용이 많이 듭니다.
  • 새로운 방식 (Tying the Loop): 3층부터 28층까지는 엘리베이터로 전달되는 동일한 공구함을 공유합니다. 1, 2, 29, 30층은 자신들만의 특별한 공구함을 가집니다.
  • 결과: 트럭의 크기가 절반으로 줄어들었고(비용과 공간 절약), 추가적인 무게를 실을 필요가 없어 팀원들이 더 빠르게 움직이며, 건물은 여전히 튼튼합니다. 사실, 트럭 비용을 아꼈기 때문에 공유 공구함에 더 좋은 도구를 구입하여 건물을 훨씬 더 튼튼하게 만들었습니다.

핵식 요점: 모델의 여러 레이어에 걸쳐 동일한 "지식"을 재사용하면 AI 모델을 훨씬 작고 빠르게 만들 수 있습니다. 단, 각 레이어의 "안경"(Attention)은 고유하게 유지하고, 맨 처음과 맨 마지막 레이어는 건드리지 않아야 합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →