← 최신 논문
💬 NLP

Dense vs Sparse Pretraining at Tiny Scale: Active-Parameter vs Total-Parameter Matching

25M 개 미만의 매개변수를 가진 초소규모 사전학습 환경에서, 전문가 혼합 모델은 활성 매개변수를 기준으로 할 때 밀집형 베이스라인보다 성능이 우수하지만 전체 매개변수 용량을 기준으로 할 때는 이를 능가하지 못한다.

원저자: Abdalrahman Wael

게시일 2026-05-14
📖 4 분 읽기☕ 가벼운 읽기

원저자: Abdalrahman Wael

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

작은 로봇에게 이야기하기를 가르치려 한다고 상상해 보세요. 이 프로젝트에 투자할 수 있는 '두뇌 능력'(컴퓨팅 자원) 은 제한적입니다. 이 논문은 단순한 질문을 던집니다: 로봇에게 하나의 크고 강력한 두뇌를 주는 것이 더 나은가, 아니면 전환할 수 있는 여러 개의 작고 전문화된 두뇌들을 주는 것이 더 나은가?

이는 Dense(단일 대형 두뇌) 모델과 Mixture-of-Experts(MoE, 여러 명의 작은 전문가들) 모델의 차이입니다.

아브달라흐만 와엘 (Abdalrahman Wael) 이라는 연구자가 'TinyStories'라는 작은 데이터셋으로 단일 컴퓨터 칩에서 이러한 실험을 수행하며 발견한 바는 다음과 같습니다.

'공정하게' 비교하는 두 가지 방법

이 두 가지 유형의 두뇌를 비교할 때 '공정함'이 무엇을 의미하는지 결정하는 것이 까다로운 부분입니다. 논문은 두 가지 다른 정의, 마치 경주를 평가하는 두 가지 다른 방식처럼 '공정함'의 두 가지 정의를 테스트합니다:

1. '활성 (Active)' 매칭 (사용하는 것의 규칙)
4 명의 요리사 팀 (MoE 모델) 이 있다고 상상해 보세요. 그들이 요리하는 모든 요리마다, 2 명의 요리사만 실제로 일하고 나머지 2 명은 쉬게 됩니다.

  • 공정성 테스트: 이 팀을 팀 내의 활성화된 2 명의 요리사만큼 열심히 일하는 단일 요리사 (Dense 모델) 와 비교합니다.
  • 결과: 4 명의 요리사 팀 (MoE) 이 쉽게 승리합니다. 어떤 순간에도 직원의 절반만 사용하더라도, 그 '백업' 인력을 활용할 수 있다는 사실이 단일 요리사가 혼자 일하는 것보다 더 잘 배우고 더 좋은 이야기를 할 수 있게 합니다.
  • 비유: 10 개의 도구가 있는 공구 상자를 가지고 있지만 한 번에 2 개만 사용하는 것과 같습니다. 2 개의 도구만 소유한 사람과 비교하면, 모든 10 개의 도구를 매초 사용하지 않더라도 특정 작업에 완벽한 도구를 선택할 옵션 이 있기 때문에 더 좋은 일을 해냅니다.

2. '총량 (Total)' 매칭 (소유하는 것의 규칙)
이제 규칙을 바꿔봅시다. 4 명의 요리사 팀 (MoE) 을 네 명의 요리사를 합친 것만큼 큰 두뇌를 가진 단일 요리사 (Dense) 와 비교합니다.

  • 공정성 테스트: 단일 요리사에게 전체 팀과 정확히 같은 양의 '두뇌 저장 공간'을 부여합니다.
  • 결과: 단일 요리사 (Dense) 가 승리하지만, 그 차이는 아주, 아주 미미합니다. 요리사 팀은 여전히 매우 훌륭하지만, 단일 거대 두뇌가 훈련의 마지막 부분에서 약간 더 낫습니다.
  • 비유: 단일 요리사에게 4 명의 요리사가 가진 도서관을 합친 것과 같은 거대한 책 도서관 (총 저장 공간) 을 준다면, 그 단일 요리사는 모든 것을 읽고 암기할 수 있습니다. 요리사 팀도 같은 총량의 도서관을 가지고 있지만, 그것을 나누어 가져야 합니다. 이 특정 작은 테스트에서 전체 도서관을 가진 한 사람이 약간 더 이깁니다.

큰 발견

논문의 주요 주장은 '공정함'을 어떻게 정의하느냐에 따라 승자가 달라진다는 것입니다.

  • 효율성(초당 수행되는 작업량)을 중요하게 여긴다면, MoE(전문가 팀) 가 명확한 승자입니다. 동일한 양의 활성 작업을 수행하는 모델과 비교할 때 MoE 는 더 빠르고 더 잘 학습합니다.
  • 총 저장 용량(모델이 메모리에 담을 수 있는 데이터 양)을 중요하게 여긴다면, Dense(단일 거대 모델) 가 여전히 약간 더 우세하지만, 그 격차는 매우 작습니다.

'팀'을 어떻게 고쳤는가

연구자는 전문가 팀을 단순히 모아놓는다고 해서 그들이 작동할 것이라고 기대할 수 없다는 것도 발견했습니다.

  • 문제: 처음에 전문가들은 게으렀습니다. 모두 같은 일을 하려고 하거나, 한 명의 전문가가 모든 일을 가져가고 나머지는 아무것도 하지 않았습니다. 이를 '붕괴 (collapsing)'라고 합니다.
  • 해결책: 연구자는 전문가들이 일을 고르게 나누도록 강요하는 '매니저'(라우팅 시스템) 를 추가했습니다.
    • Top-1 대 Top-2: 매니저가 단 한 명의 전문가만 선택하는 것만으로는 부족했습니다. 매니저가 모든 작업에 대해 최고의 2 명의 전문가를 선택하게 하는 것이 팀이 잘 작동하게 만든 비결이었습니다.
    • 'Z-Loss': 이는 전문가들이 너무 흥분하거나 너무 지루하지 않도록 매니저의 규칙에 가한 작은 조정입니다. 이는 안정성에 도움이 되었지만 성공의 주된 이유는 아니었습니다.

결론

이 작고 통제된 실험 (작은 데이터셋과 단일 컴퓨터 사용) 에서:

  1. MoE 모델은 강력합니다. 초당 실제로 수행하는 작업량으로 평가한다면, 동일한 활성 크기의 Dense 모델보다 성능이 뛰어납니다.
  2. Dense 모델은 여전히 약간 더 강력합니다. 보유하는 총 메모리 양으로 평가한다면, 하지만 훈련이 길어질수록 그 격차는 좁아지고 있습니다.
  3. 안정성이 중요합니다. 전문가들이 함께 작동하도록 하려면 좋은 '관리'(균형 조정 및 라우팅) 가 필요합니다. 그렇지 않으면 시스템이 고장 납니다.

이 논문은 조건부 계산 (전문가 간 전환) 이 적절한 기준선에 대해 공정하게 비교된다면 매우 작은 규모에서도 유용하다는 결론을 내립니다. 이것이 MoE 가 모든 AI 의 궁극적인 미래임을 증명하는 것은 아니지만, 규칙이 올바르게 설정될 때 '전문가 팀' 접근 방식이 놀라울 정도로 잘 작동한다는 것을 보여줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →