← 최신 논문
💬 NLP

M3M^3 Scaling Law: Optimizing Multi-Epoch, Multi-Lingual, and Multi-Stage Training for Low-Resource Language Models

이 논문은 고정된 연산량 및 코퍼스 제약 조건 하에서 멀티 에포크(multi-epoch), 다국어(multi-lingual), 그리고 멀티 스테이지(multi-stage) 전략을 비교함으로써 저자원 LLM 사전 학습을 최적화하는 통합 예측 모델인 M3M^3 스케일링 법칙을 소개하며, 다국어 2단계 학습이 희소 데이터에 최적임을 밝히고 이상적인 학습 에포크 수를 결정하는 정밀한 방법을 제공한다.

원저자: Kosuke Akimoto, Taiki Miyagawa, Masafumi Oyamada

게시일 2026-06-02
📖 3 분 읽기☕ 가벼운 읽기

원저자: Kosuke Akimoto, Taiki Miyagawa, Masafumi Oyamada

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 세계적인 수준의 요리(거대 언어 모델, 즉 LLM)를 만들려고 노력하는 셰프라고 상상해 보세요. 그런데 당신은 아주 특이하고 희귀한 재료(스와힐리어 또는 인도네시아어와 같은 저자원 언어)를 가지고 있는데, 그 양이 아주 적습니다. 반면, 흔한 재료(영어)는 엄청나게 많이 가지고 있고, 요리에 쓸 수 있는 시간과 돈(컴퓨팅 예산)에는 엄격한 제한이 있습니다.

가장 큰 질문은 이것입니다: 완벽한 레시피는 무엇인가?

다음 중 어떤 것을 선택해야 할까요?

  1. 희귀한 재료만 사용하되, 작은 양의 재료를 계속해서 맛보고 다시 요리하기 (Multi-epoch/다중 에포크)?
  2. 처음부터 희귀한 재료와 흔한 재료를 섞기 (Multi-lingual/다국어)?
  3. 처음에는 주로 흔한 재료로 시작했다가, 나중에 주로 희귀한 재료로 바꾸기 (Multi-stage/다단계)?

오랫동안 과학자들은 이 서로 다른 요리 스타일들을 비교할 수 있는 단일한 규칙을 가지고 있지 않았습니다. 그들은 "다시 요리하기"와 "섞기"에 대한 별도의 가이드는 가지고 있었지만, 희귀한 재료의 양이 매우 적고 예산이 고정되어 있을 때 어떤 것이 최선인지 말할 방법이 없었습니다.

해결책: "M3" 레시피 북

이 논문의 저자들은 **M3 스케일링 법칙(M3 Scaling Law)**이라는 새로운 통합 "레시피 북"을 만들었습니다. 이것은 당신이 조절할 수 있는 네 가지 주요 노브(knob)를 바탕으로, 당신의 요리가 얼마나 맛있는지(검증 손실, 즉 모델이 얼마나 혼란스러워하는지로 측정됨)를 정확하게 예측하는 마법의 수정 구슬과 같습니다:

  1. 모델 크기 (Model Size): 얼마나 큰 냄비를 사용할 것인가.
  2. 에포크 (Epochs, k): 희귀한 재료를 몇 번이나 다시 요리할 것인가.
  3. 혼합 비율 (Mix Ratio, r): 평균적으로 희귀한 재료와 흔한 재료를 얼마나 섞을 것인가.
  4. 최종 단계 비율 (Final Stage Ratio, rf): 요리의 마지막 단계에서 희귀한 재료를 얼마나 사용할 것인가.

주요 발견

이 새로운 수정 구슬을 사용하여, 저자들은 희귀한 재료로 요리할 때의 두 가지 놀라운 "황금 법칙"을 찾아냈습니다.

1. "2단계" 전환 방식이 승자입니다
희귀한 재료가 많이 있다면, 가장 좋은 전략은 간단합니다: 그 재료만 가지고 요리하는 것입니다 (Monolingual Single-Stage/단일 언어 단일 단계).
하지만 희귀한 재료의 공급량이 적어지는 즉시, 가장 좋은 전략은 2단계(Two-Stage) 방식으로 즉시 전환됩니다:

  • 1단계: 흔한 재료(영어)를 주로 사용하여 강력한 기초를 쌓습니다.
  • 2단계: 거의 전적으로 희귀한 재료를 사용하여 맛을 미세하게 조정(fine-tuning)합니다.

놀라운 점: "처음부터 모두 섞는" 방식(Multi-lingual Single-Stage/다국어 단일 단계)은 실험에서 결코 최선의 선택이 되지 못했습니다. 이는 마치 완벽한 프랑스 소스를 만들기 위해 첫 순간부터 간장을 섞는 것과 같습니다. 기초를 먼저 쌓고 마지막에 간장을 넣는 것만큼 효과적이지 않습니다.

2. 재요리를 위한 "희소성" 규칙
희귀한 재료를 몇 번이나 다시 요리해야 할까요(에포크)? 논문은 이 숫자가 특정 언어나 정확한 예산의 양에 따라 달라지는 것이 아니라는 것을 발견했습니다. 대신, 이 숫자는 단 하나의 "희소성 점수(Scarcity Score)"에 달려 있습니다.

  • 희귀한 데이터가 아주 많다면, 한 번만 요리하면 됩니다.
  • 희귀한 데이터가 아주 적다면, 여러 번 다시 요리해야 합니다.
  • 논문은 이 "희소성 점수"를 "재요리 횟수"에 대해 도표로 그리면, 서로 다른 언어와 예산의 모든 데이터 포인트가 하나의 단일 곡선으로 모인다는 것을 보여줍니다. 이는 요리의 보편적인 법칙과 같습니다: "재료가 희귀할수록, 더 많이 다시 요리해야 한다."

이것이 왜 중요한가

이 논문 이전에는 저자원 언어를 위한 모델을 훈련하고 싶을 때, 사실상 추측에 의존해야 했습니다. 당신은 재료를 섞거나, 다시 요리하거나, 혹은 2단계 과정을 거치는 등의 시도를 해볼 수는 있었지만, 자신의 특정 예산에서 어떤 것이 최상의 결과를 낼지는 알지 못했습니다.

M3 스케일링 법칙은 당신에게 정밀한 지도를 제공합니다. 이 법칙은 언제 단순한 레시피에서 복잡한 2단계 레시피로 전환해야 하는지, 그리고 컴퓨팅 예산을 낭비하지 않고 최상의 성능을 얻기 위해 희귀한 데이터를 몇 번이나 반복해야 하는지를 정확하게 알려줍니다.

요약하자면: 희귀한 재료와 흔한 재료를 처음부터 무작별로 섞지 마세요. 만약 희귀한 재료가 매우 적다면, 먼저 흔한 재료로 강력한 기초를 쌓은 다음, 마지막 다듬질을 위해 희귀한 재료로 전환하세요. 그리고 희귀한 데이터가 적다면, 데이터가 많을 때보다 훨씬 더 많이 연습(재요리)해야 합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →