← 최신 논문
💬 NLP

InfoLaw: Information Scaling Laws for Large Language Models with Quality-Weighted Mixture Data and Repetition

이 논문은 다양한 데이터 혼합물, 품질 가중치 및 반복 수준에 걸쳐 LLM 성능을 정확하게 예측하고, 과훈련 또는 데이터 제한 regimes 에서조차 최적의 데이터 레시피 선택을 가능하게 하기 위해 사전 훈련을 정보 축적으로 모델링하는 새로운 데이터 인식 확장 프레임워크인 InfoLaw 를 소개합니다.

원저자: Fengze Liu, Weidong Zhou, Binbin Liu, Ping Guo, Zijun Wang, Bingni Zhang, Yifan Zhang, Yifeng Yu, Xiaohuan Zhou, Taifeng Wang

게시일 2026-05-06
📖 4 분 읽기☕ 가벼운 읽기

원저자: Fengze Liu, Weidong Zhou, Binbin Liu, Ping Guo, Zijun Wang, Bingni Zhang, Yifan Zhang, Yifeng Yu, Xiaohuan Zhou, Taifeng Wang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

"InfoLaw" 논문에 대한 설명을 쉬운 언어와 일상적인 비유로 풀어냅니다.

큰 문제: 좋은 것이 너무 많다면?

AI(학생) 가 글을 잘 쓰도록 가르치려 한다고 상상해 보세요. 거대한 도서관이 있지만, 그중 정말 고품질의 고전책은 몇 권뿐입니다. 나머지는 평범하거나 그저 그런 책들입니다.

과거 연구자들은 최선의 전략이 학생에게 오직 고품질 고전책만 주는 것이라고 생각했습니다. 하지만 함정이 하나 있습니다. 학생의 전체 학습 일정을 채울 만큼 고전책이 충분하지 않다는 점입니다. 만약 학생이 시간을 채우기 위해 같은 100 권의 고전책을 반복해서 읽도록 강요한다면, 결국 지루해지고 같은 문구를 반복하며 실력이 오히려 떨어집니다. 이를 '반복 (repetition)'이라고 합니다.

반면, 시간을 채우기 위해 저품질 책을 섞어주면 학생은 더 다양한 것을 배우지만, 나쁜 습관을 배울 수도 있습니다.

큰 질문은 이것입니다: 고품질 책을 얼마나 반복해야 하며, 저품질 책을 얼마나 섞어야 할까요?

구식 방법: 망가진 지도로 추측하기

과거 과학자들은 AI 의 성과를 예측하기 위해 '스케일링 법칙 (Scaling Laws)'을 사용했습니다. 이를 지도로 생각하면, "10 시간 공부하면 B 학점, 100 시간 공부하면 A 학점"이라고 표시된 것과 같습니다.

그러나 이 논문은 같은 고품질 데이터를 반복하기 시작하면 이 구식 지도가 무너진다고 주장합니다.

  • 결함: 구식 지도는 공부 시간이 늘수록 항상 성적이 좋아진다고 가정합니다. 같은 책을 50 번 읽는 것이 처음 5 번 이후로는 도움이 되지 않는다는 사실을 고려하지 못합니다.
  • 결과: 연구자들이 이 구식 지도를 이용해 거대 AI 의 성과를 예측하려 할 때, 지도는 지나치게 낙관적이었습니다. AI 가 만점을 받을 것이라고 예측했지만, 실제로는 반복의 루프에 갇혀 혼란을 겪으며 부실한 성과를 냈습니다.

새로운 해결책: "InfoLaw"(정보 온도계)

저자들은 InfoLaw라는 새로운 프레임워크를 소개합니다. AI 가 '얼마나 많은 시간'을 공부했는지 (또는 몇 개의 토큰을 보았는지) 단순히 세는 대신, AI 가 실제로 배운 **"얼마나 많은 새로운 정보"**를 측정합니다.

그들이 이를 구축한 방법은 다음과 같습니다:

  1. 도서관 통: 그들은 거대한 텍스트 도서관을 품질에 따라 6 개의 통으로 분류했습니다 (최고급 '골드'부터 '쓰레기'까지).
  2. 혼합 레시피: 학습을 위한 다양한 '레시피'를 만들었습니다. 어떤 레시피는 80% 가 골드 책 (많은 반복 포함) 이었고, 다른 레시피는 골드와 실버 책의 혼합 (적은 반복) 이었습니다.
  3. 발견: 그들은 AI 의 학습이 특정 패턴을 따른다는 것을 발견했습니다.
    • 품질 밀도: 고품질 책은 처음 읽을 때 엄청난 '정보 부스트'를 제공합니다.
    • 체감 수익: 책을 다시 읽을 때마다 부스트는 점점 작아집니다. 마치 배터리가 방전되는 것과 같습니다. 결국 다시 읽는 것은 거의 가치를 더하지 않습니다.
    • 공식: 그들은 책의 품질과 반복 횟수를 결합하여 AI 가 흡수한 총 '정보'량을 계산하는 수학 공식을 만들었습니다.

마법 같은 결과: 하나의 직선

이 논문의 가장 놀라운 부분은 단순히 '소요 시간' 대신 새로운 '정보' 지표를 사용하여 결과를 그래프로 그렸을 때 일어난 일입니다.

  • 이전: 시간을 기준으로 결과를 그리면 데이터 점들이 여기저기 흩어져 있었습니다. 반복이 많은 레시피와 반복이 적은 레시피는 완전히 다르게 보였습니다.
  • 이후: 정보를 기준으로 결과를 그리자, 흩어져 있던 모든 점들이 하나의 완벽한 직선으로 수렴했습니다.

이는 어떤 '레시피'를 사용하든 (반복이 많은 고품질, 혹은 혼합 품질), AI 가 흡수한 총 '정보'량만 알면 그 성능을 완벽하게 예측할 수 있다는 뜻입니다.

이를 통해 무엇을 할 수 있을까요?

이 완벽한 직선 (InfoLaw) 을 가지고 있으므로, 거대 모델을 학습시키는 데 수백만 달러를 먼저 지출하지 않고도 두 가지 매우 유용한 일을 할 수 있습니다.

  1. 미래 예측: 특정 레시피로 작고 저렴한 모델 (예: 2 억 5 천만 파라미터 모델) 을 학습시킬 수 있습니다. InfoLaw 를 사용하면 동일한 레시피로 70 억 파라미터 거대 모델이 어떻게 수행할지 정확하게 예측할 수 있습니다.
  2. 최적 레시피 찾기: 그들은 공식을 사용하여 '최적의 혼합 비율'을 계산할 수 있습니다. 그들은 다음과 같은 사실을 발견했습니다.
    • 작은 모델(또는 작은 예산)은 약간의 반복을 감수하더라도 최고 품질 데이터에 집중해야 합니다.
    • 큰 모델(또는 큰 예산)은 다양성에서 더 큰 혜택을 봅니다. 반복의 '지루함'을 피하기 위해 더 많은 저품질 데이터를 섞어야 합니다.

요약 비유

AI 학습을 스튜를 끓이는 것으로 생각하세요.

  • 구식 방법: 냄비가 끓는 시간을 재기만 합니다. 1 시간보다 10 시간이 항상 더 낫다고 가정합니다. 하지만 같은 감자 3 개를 계속 반복해서 넣으면 스튜는 기괴하고 짜게 됩니다 (반복이 해롭습니다).
  • InfoLaw: 이 방법은 재료에서 추출된 실제 을 측정합니다. 끓이는 첫 시간에는 감자 맛의 90% 가 추출되지만, 10 번째 시간에는 거의 아무것도 추출되지 않는다는 것을 알고 있습니다.
  • 혜택: 이제 거대한 냄비에 소금과 감자를 얼마나 넣어야 할지 추측하는 대신, '맛 공식'을 사용하여 완벽한 레시피를 즉시 계산할 수 있어 재료와 시간을 낭비하지 않게 됩니다.

핵심 결론: 이 논문은 더 나은 AI 를 학습시키기 위해서는 단순히 사용하는 데이터의 양을 보는 것이 아니라, 특히 고품질 데이터를 반복해야 할 때 그 데이터가 제공하는 새로운 정보의 양을 보아야 함을 증명합니다. 이를 통해 우리는 성능을 정확하게 예측하고 모든 크기의 AI 에 대해 최상의 데이터 혼합을 선택할 수 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →