← 최신 논문
💬 NLP

Skaling: Chinchilla's Exponents Meet Kaplan's Coupling

이 논문은 모델 용량과 데이터를 단일 상호작용 지수로 결합하여 손실 예측 정확도를 크게 향상시키고 대규모 언어 모델 학습을 위한 자원 효율적인 컴퓨팅 예산 할당을 가능하게 하는 일반화된 스케일링 프레임워크인 Skaling 법칙을 소개한다.

원저자: Mathurin Videau, Badr Youbi-Idrissi, David Lopez-Paz, Kartik Ahuja

게시일 2026-08-10
📖 4 분 읽기☕ 가벼운 읽기

원저자: Mathurin Videau, Badr Youbi-Idrissi, David Lopez-Paz, Kartik Ahuja

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

위대한 균형 잡기: AI는 어떻게 학습하는가

당신이 거대한 디지털 뇌가 세상의 모든 언어를 말할 수 있도록 가르치고 있다고 상상해 보세요. 이를 위해서는 두 가지 핵심 재료가 필요합니다. 더 큰 뇌(뉴런, 즉 "파라미터")와 더 많은 교과서(데이터, 즉 "토큰")입니다. 수년 동안 과학자들은 이 뇌가 얼마나 잘 수행할지를 예측하기 위해 "스케일링 법칙(scaling laws)"이라 불리는 일련의 규칙을 사용해 왔습니다. 이 규칙들을 완벽한 케이크를 만들기 위해 각 재료가 정확히 얼마나 필요한지 알려주는 요리책이라고 생각하면 됩니다.

"친칠라 법칙(Chinchilla law)"으로 알려진 가장 유명한 레시피는 뇌의 크기와 데이터의 양이 서로 다른 방에서 일하는 두 명의 별개 친구처럼 작동한다고 제안했습니다. 이 법칙은 뇌의 크기를 두 배로 늘리면 데이터의 양이 얼마이든 상관없이 개선 효과가 동일할 것이라고 가정했고, 그 반대도 마찬가지라고 보았습니다. 이 방식은 수학적으로 계산하기 쉬웠고 연구자들이 막대한 예산을 어떻게 사용할지 결정하는 데 도움을 주었습니다. 하지만 실제 레시피와 마찬가지로, 이 가정은 너무 단순할 수 있습니다. 만약 뇌와 데이터가 실제로 서로 대화를 나누어야 한다면 어떨까요? 더 많은 책을 읽을 때 더 큰 뇌는 다르게 학습하게 될까요? 만약 우리가 이 관계를 잘못 파악한다면, 데이터에 비해 너무 작거나 뇌에 비해 너무 큰 모델을 훈련시키는 데 수백만 달러를 낭비하게 되어 실망스러운 결과를 초래할 수 있습니다.

새로운 "스케일링(Skaling)" 법칙: 재료가 섞일 때

이 논문에서 Meta의 FAIR 랩 연구진은 Skaling 법칙(발음: "스케이-링")이라는 이름의 개선된 새로운 레시피를 소개합니다. 그들은 기존의 "친칠라" 레시피에 숨겨진 결함이 있다는 것을 발견했습니다. 즉, 기존 법칙은 모델 크기와 데이터를 완전히 독립적인 것으로 취급하여, 이들이 실제로 서로에게 영향을 미친다는 사실을 간과했다는 것입니다.

이를 시각화하기 위해, 자동차가 얼마나 빨리 달릴지 예측하려고 한다고 상상해 보세요. 기존의 규칙은 "속도는 엔진 크기와 연료량 각각에 달려 있다"라고 말했습니다. 하지만 새로운 연구에 따르면, 더 큰 엔진은 실제로 연료를 사용하는 효율성 자체를 변화시킵니다. 아주 작은 엔진이라면 연료를 더 추가해도 큰 도움이 되지 않습니다. 하지만 거대한 엔진을 가지고 있다면, 그 추가된 연료는 엄청난 차이를 만들어냅니다. 기존의 수학은 이러한 "결합(coupling)" 효과를 놓쳤으며, 이는 거대한 모델에 데이터가 매우 적거나, 아주 작은 모델에 데이터가 산더미처럼 많은 극단적인 상황에서 성능을 예측할 때 큰 오류를 일으켰습니다.

저자들은 방정식에 단 하나의 숫자( "결합 지수")를 추가함으로써 이 문제를 해결할 수 있다는 것을 발견했습니다. 이 새로운 숫자는 뇌의 크기와 데이터의 양을 연결하는 "혼합 다이얼" 역할을 합니다. 두 효과를 별개의 모래 더미처럼 단순히 더하는 대신, 새로운 법칙은 이들이 하나의 팀으로서 작동한다는 점을 인정하며 서로 곱해지는 방식을 취합니다.

발견한 내용: 더 적은 노력으로 더 똑똑한 예측을

연구진은 FarseerSK-Grid라고 불리는 두 가지 거대한 훈련 데이터 세트를 사용하여 이 새로운 법칙을 테스트했습니다. 이 데이터 세트에는 1억 개의 파라미터를 가진 작은 모델부터 수십억 개의 파라미터를 가진 거대 모델까지, 그리고 10억 단어부터 수천억 단어에 이르는 다양한 실험이 포함되어 있었습니다.

그들이 발견한 내용은 다음과 같습니다:

  1. 기존 법칙은 가장자리에서 틀렸다: 오류를 분석했을 때, 기존의 친칠라 법칙은 데이터의 중간 지점에서는 괜찮았지만 가장자리에서는 처참하게 실패했습니다. 모델 크기와 데이터 양이 불균형할 때 성능을 터무니없이 과대평가하거나 과소평가했습니다. 반면, 새로운 Skaling 법칙은 어디에서나 정확성을 유지하며, 기존 방식에 비해 예측 오차를 1.5배에서 3배 줄였습니다.
  2. "희소한(Sparse)" 방식의 훈련: 가장 멋진 발견 중 하나는, 규칙을 알아내기 위해 가능한 모든 조합의 뇌 크기와 데이터를 모두 훈련시킬 필요는 없다는 것입니다. 기존 방식은 엄청난 비용이 드는 "전체 그리드(full grid)" 실험을 요구했습니다. 하지만 새로운 Skaling 법칙은 그리드의 "L자형" 가장자리만을 훈련시켜도 동일하게 잘 작동합니다. 즉, 데이터가 많은 작은 모델과 데이터가 적은 큰 모델만을 테스트하는 것입니다. 이 "희소한" 전략을 통해 연구자들은 이전보다 약 10배 적은 컴퓨팅 파워만으로도 거대하고 비싼 모델의 성능을 예측할 수 있습니다.
  3. 더 나은 자원 배분: 새로운 법칙은 뇌와 데이터가 어떻게 상호작용하는지 이해하기 때문에, "내 모델에 얼마나 많은 데이터를 먹여야 하는가?"라는 질문에 더 정확한 답을 줍니다. 기존 법칙은 고정된 비율(예: 뉴런당 20단어)을 제시했지만, 새로운 법칙은 이 비율이 규모에 따라 실제로 변해야 한다고 제안합니다. 어떤 데이터 세트의 경우, 모델이 커짐에 따라 최적의 비율이 크게 변하며, 이는 기존의 조언이 기업들로 하여 help 돈을 낭비하게 만들 수 있음을 의미합니다.

이것이 중요한 이유

이 논문은 AI의 모든 것을 해결했다고 주장하는 것이 아니라, 우리가 현재 훈련 예산을 계획하는 방식이 약간 어긋나 있을 수 있음을 시사합니다. 모델 크기와 데이터가 독립적인 작업자가 아니라 결합된 하나의 팀이라는 점을 깨달음으로써, Skaling 법칙은 더 견고하고 자원 효율적인 프레임워크를 제공합니다. 이를 통해 연구자들은 수천 번의 값비싼 실험을 직접 수행하지 않고도 차세대 모델이 어떻게 작동할지에 대해 더 나은 추측을 할 수 있습니다.

요약하자면, 저자들은 수학에 "혼합" 파라미터 하나를 추가하는 간단한 수정만으로도 그동안 이 분야를 괴롭혀온 체계적인 오류를 제거할 수 있음을 보여주었습니다. 이는 AI의 세계에서 뇌의 크기와 읽을 자료의 양이 불가분하게 연결되어 있음을 이해함으로써, 우리가 더 빠르고 저렴하게, 더 나은 모델을 만들 수 있음을 의미합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →