← 최신 논문
🤖 machine learning

Data-Constrained Language Model Pretraining: Improved Regularization and Scaling Laws

이 논문은 검증 및 다운스트림 성능을 향상시키기 위해 마스크 입력 정규화(Masked-Input Regularization, MIR)를 도입하고, 고전적인 법칙들이 실패하는 반복 학습 에포크 하에서의 모델 크기와 데이터 크기 간의 상호작용을 정확하게 포착하는 새로운 스케일링 법칙인 SoftQ를 제안함으로써 언어 모델 사전 학습의 데이터 제약 환경을 다룹니다.

원저자: Zhiwei Xu, Shihao Wu, Hanseul Cho, Wei Hu, Yixin Wang

게시일 2026-06-08
📖 4 분 읽기☕ 가벼운 읽기

원저자: Zhiwei Xu, Shihao Wu, Hanseul Cho, Wei Hu, Yixin Wang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 학생(AI 모델)에게 이야기를 쓰는 법을 가르치려 한다고 상상해 보세요. 과거의 규칙은 이랬습니다: "학생에게 독특한 책들이 가득한 거대한 도서관을 주고, 각 책을 정확히 한 번씩 읽게 하라." 이 방식은 도서관이 매우 방대했고, 학생이 모든 것을 한 번씩 읽을 수 있는 충분한 시간이 있었기에 효과적이었습니다.

하지만 이제 상황이 바뀌었습니다. 우리는 초당 수백만 권의 책을 읽을 수 있는 초고속 컴퓨터(연산 능력)를 보유하게 되었지만, 새로운 독창적인 책(자연어 데이터)의 공급은 고갈되어 가고 있습니다. 우리는 지금 "데이터는 부족하고 연산 능력은 풍부한" 세상에 처해 있습니다. 이제 학생은 한정된 작은 도서관의 책들을 여러 번 반복해서 읽으며 지식을 채워야 합니다.

문제는 이겁니다. 만약 학생이 똑같은 책을 계속해서 반복해서 읽게 만든다면, 학생은 글쓰는 법을 배우는 대신 책을 암기하기 시작할 것입니다. 학생은 언어의 규칙을 이해하는 대신, 본 적 있는 문구들을 그대로 따라 하는 앵무새가 될 것입니다. 이를 "과적합(overfitting)"이라고 부릅니다.

이 논문은 두 가지 주요 질문을 다룹니다:

  1. 어떻게 하면 학생이 단순히 암기하는 것을 막을 수 있을까? (규제화/Regularization)
  2. 학생의 뇌 크기와 도서관의 크기 사이의 균형을 맞추는 가장 좋은 방법은 무엇인가? (스케일링 법칙/Scaling Laws)

다음은 이들의 연구 결과를 쉬운 비유를 사용하여 정리한 내용입니다.


1. "흐릿한 안경" 기법 (마스크 입력 규제화/Masked-Input Regularization)

문제점:
학생이 같은 책을 10번째 읽을 때, 학생은 이야기의 의미를 배우는 대신 5페이지에 있는 특이한 글꼴이나 오타까지 통째로 외워버릴 수 있습니다. 학생에게는 의미에 집중하도록 강제하는 방법이 필요합니다.

해결책 (MIR):
저자들은 **마스크 입력 규제화(Masked-Input Regularization, MIR)**라는 기법을 시도했습니다. 학생이 책을 읽는 동안 "흐릿한 안경"을 씌우거나 "스크램블러(섞기 장치)"를 사용하는 것을 상상해 보세요.

  • 학생이 문장을 읽을 때마다, 컴퓨터는 무작위로 몇 개의 단어를 숨겨서(masking) [MASK]로 바꿉니다.
  • 학생은 문맥을 바탕으로 빠진 단어를 추측해야 합니다. 마치 "빈칸 채우기" 게임처럼 말이죠.
  • 학생은 일반적인 독서와 이 과정을 병행하여 수행합니다.

결과:
이것은 스포츠 연습과 비슷합니다. 만약 당신이 완벽하고 평평한 경기장에서만 연습한다면, 바람이 불 때 대처하지 못할 수 있습니다. 하지만 "바람 기계(무작위 마스킹)"가 당신을 향해 바람을 일으키는 환경에서 연습한다면, 당신은 적응하는 법을 배우게 됩니다.

  • 논문에 따르면, 학생이 이미 엄격한 훈련(암기를 방지하는 엄격한 코치와 같은 "강한 가중치 감쇠/strong weight decay")을 받고 있더라도, 이 "흐릿한 안경" 기법을 추가했을 때 훨씬 더 나은 성과를 보였습니다.
  • 이 기법은 모델이 이상한 이름, 혼합된 언어, 혹은 깨진 텍스트와 같은 까다로운 상황을 훨씬 더 잘 처리하도록 도왔습니다.
  • 성과: 저자들은 이 기법을 사용하는 것이 수학적으로 학생에게 1.3배 더 많은 독창적인 책을 읽게 하는 것과 동일한 가치가 있다고 계산했습니다. 이는 우리가 가진 한정된 도서관으로부터 더 많은 가치를 끌어내는 방법입니다.

2. "결합된" 성장 규칙 (SoftQ 스케일링 법칙)

과거의 규칙 (친칠라/Chinchilla):
이전에는 전문가들이 책의 수에 따라 학생의 뇌 크기를 어떻게 결정해야 하는지에 대한 공식(친칠라 법칙)을 가지고 있었습니다.

  • 과거의 아이디어: "책의 수가 두 배가 되면, 뇌의 크기도 두 배가 되어야 한다." 이 방식은 뇌의 크기와 책의 수를 서로 별개로 더해지는 두 가지 요소로 취급했습니다.
  • 결함: 이 공식은 항상 새로운 책을 얻을 수 있다는 가정하에 만들어졌습니다. 하지만 책이 고갈되어 가는 우리 세상에서는 이 공식이 무너집니다. 이 공식은 학생의 뇌가 작든 크든, 책이 부족해서 생기는 불이익이 동일할 것이라고 예측했습니다.

새로운 규칙 (SoftQ):
저자들은 책이 한정된 세상에서는 뇌의 크기와 책의 수가 밀접하게 연결되어 있음을 깨달았습니다.

  • 비유: 양동이(뇌)와 호스(데이터)를 상상해 보세요.
    • 양동이가 아주 작다면, 호스가 아무리 커도 상관없습니다. 양동이는 금방 차버리고 남은 물은 그냥 넘쳐흐를 뿐입니다 (낭비되는 데이터).
    • 양동이는 엄청나게 큰데 호스가 아주 작다면, 양동이는 대부분 비어 있게 됩니다 (낭비되는 뇌 용량).
    • 호스가 작아서 생기는 "불이익"은 양동이가 커질수록 훨씬 더 심각해집니다. 거대한 양동이에 아주 작은 호스를 연결하는 것은 재앙입니다.

결과:
저자들은 SoftQ라고 불리는 새로운 공식을 제안했습니다.

  • 기존의 공식과 달리, SoftQ는 모델이 커질수록 독창적인 데이터에 대한 필요성이 더 빠르게 증가한다는 점을 이해하고, 이 둘을 하나로 "결합"합니다.
  • 테스트 결과, SoftQ는 특히 데이터가 제한적이고 모델이 동일한 데이터를 여러 번 반복해서 읽을 때, 기존의 친칠라 공식보다 모델의 성능을 훨씬 더 정확하게 예측했습니다.

"핵심 요약"

  1. 단순 반복 대신 섞어라: 한정된 데이터셋으로 학습해야 할 때는, 텍스트의 일부를 무작위로 숨기는 것(MIR)이 AI가 특정 문장을 외우는 대신 일반적인 규칙을 배우도록 강제합니다. 이는 교과서를 단순히 읽는 것이 아니라, 답을 가린 채 연습 문제를 풀며 시험 공부를 하는 것과 같습니다.
  2. 데이터가 부족할수록 크기가 중요하다: AI를 만드는 기존의 규칙은 "모델이 커지면 데이터와 상관없이 더 좋다"라고 말했습니다. 하지만 새로운 규칙(SoftQ)은 "모델을 더 크게 만들려면, 비례해서 훨씬 더 많은 독창적인 데이터가 필요하며, 그렇지 않으면 모델은 실패할 것"이라고 말합니다.
  3. 효율성: "섞기" 기법(MIR)과 새로운 "결합된" 공식(SoftQ)을 사용함으로써, 우리는 새로운 텍스트가 고갈되어 가는 상황에서도 더 나은 AI 모델을 구축할 수 있습니다.

이 논문이 말하지 않은 것:
이 논문은 이 기술이 즉각적으로 의료 진단을 해결하거나, 완벽한 고객 서비스 챗봇을 만들거나, 기후 변화를 해결할 것이라고 주장하지 않습니다. 이 논문은 오직 데이터가 부족할 때 이러한 모델을 얼마나 더 효율적으로 훈련할 것인가에 대한 수학적 측면에만 집중합니다. 결과는 14억 개의 파라미터를 가진 모델까지의 실험을 바탕으로 하고 있으며(오늘날 빅테크 기업들이 사용하는 거대 모델들에 비하면 작은 규모입니다), 이 원칙들은 더 큰 규모에도 적용될 수 있도록 설계되었습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →