← 최신 논문
💬 NLP

LLMs on the Line: Data Determines Loss-to-Loss Scaling Laws

본 논문은 대규모 언어 모델에서 손실 대 손실 스케일링 법칙의 주요 결정 요인이 사전 학습 데이터임을 입증하는 반면, 모델 크기, 아키텍처, 하이퍼파라미터와 같은 요인들은 미미한 영향을 미치므로 하류 작업 성능을 최적화하기 위해 아키텍처 선택보다 데이터 선별이 더 중요함을 시사합니다.

원저자: Prasanna Mayilvahanan, Thaddäus Wiedemer, Sayak Mallick, Matthias Bethge, Wieland Brendel

게시일 2026-05-21
📖 3 분 읽기☕ 가벼운 읽기

원저자: Prasanna Mayilvahanan, Thaddäus Wiedemer, Sayak Mallick, Matthias Bethge, Wieland Brendel

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

완벽한 빵 한 덩이를 굽으려 한다고 상상해 보세요. 수년 동안 과학자들은 이 레시피에 매료되어 왔습니다. "밀가루 100 그램과 물 500 그램을 사용하면 특정 식감을 얻을 수 있다"는 것입니다. 이는 현재 우리가 대규모 언어 모델 (LLM) 을 구축하는 방식과 유사합니다. 우리는 사용 가능한 컴퓨터 성능에 기반하여 모델의 크기와 학습에 필요한 데이터 양을 알려주는 "스케일링 법칙"을 가지고 있습니다.

하지만 함정이 하나 있습니다. 모델이 레시피를 완벽하게 학습했다고 해서 그것이 훌륭한 케이크를 굽는다는 것 (실제 세계의 작업에서 잘 수행한다는 것) 을 의미하지는 않습니다.

이 논문인 **"LLMs on the Line: Data Determines Loss-to-Loss Scaling Laws"**는 단순한 질문을 던집니다. 모델이 학습을 마친 후 새로운 작업에서 실제로 얼마나 잘 수행하는지를 결정하는 것은 무엇일까요?

저자들은 수십 가지 변수를 테스트했습니다. 모델의 뇌 구조, 모델의 크기, 텍스트를 읽는 데 사용되는 도구, 그리고 모델을 가르치는 데 사용된 수학까지 변경해 보았습니다. 그들은 하나의 거대하고 놀라운 진실을 발견했습니다. 데이터만이 실제로 중요한 유일한 요소입니다.

간단한 비유를 사용하여 이를 분해해 보겠습니다.

1. "손실 대 손실 (Loss-to-Loss)" 선

학생을 훈련시킨다고 상상해 보세요. 연습 시험 (훈련 손실) 을 준 다음 기말고사 (테스트 손실) 를 치르게 합니다.

  • 발견: 연습 시험에서 얼마나 잘하는지와 기말고사에서 얼마나 잘하는지 사이에는 매우 예측 가능하고 직선적인 연결선이 존재합니다.
  • 비유: 학생이 연습 시험에서 90% 를 맞으면, 빨간 셔츠를 입든 파란 셔츠를 입든 기말고사에서도 거의 확실히 90% 를 맞을 것입니다. 이 논문은 이를 "이동된 멱법칙 (shifted power law)"이라고 부릅니다. 이는 거의 모든 것에 걸쳐 유효한 신뢰할 수 있는 규칙입니다.

2. "빅 3" 요소 (그리고 왜 중요하지 않은지)

연구자들은 훈련 과정에서 "매드립스 (Mad Libs)" 게임을 하듯 다양한 재료를 교체하여 최종 결과가 어떻게 변하는지 확인했습니다. 그들은 세 가지 주요 범주가 그 예측 가능한 선에 거의 영향이 없음을 발견했습니다.

  • 아키텍처 (뇌 구조): 그들은 Llama(표준 인간 뇌와 같은 트랜스포머) 와 Mamba(완전히 다른 유형의 외계인 뇌와 같은 상태 공간 모델) 를 비교했습니다.
    • 결과: 두 뇌에 정확히 같은 교과서를 공급하면, 둘은 정확히 같은 성능 선에 도달합니다. 뇌가 트랜스포머 모양이든 Mamba 모양이든 상관없습니다. 데이터가 같다면 결과도 같습니다.
  • 토크나이저 (사전): 이는 문장을 단어나 조각으로 나누는 도구입니다. 그들은 다양한 사전 (128,000 단어짜리, 50,000 단어짜리 등) 을 시도해 보았습니다.
    • 결과: 사전을 바꾸는 것은 교과서의 글꼴을 바꾸는 것과 같았습니다. 이는 학생이 자료를 얼마나 잘 학습했는지에는 영향을 미치지 않았습니다.
  • 설정 (학습 습관): 그들은 모델의 크기 (작음 vs 큼), 문장의 길이 (컨텍스트 길이), 그리고 실수를 수정하는 데 사용된 수학 (옵티마이저) 을 변경했습니다.
    • 결과: 학생이 10 분 동안 공부하든 10 시간 동안 공부하든, 빨간 펜을 쓰든 파란 펜을 쓰든, 연습 점수와 기말 점수 사이의 관계는 동일하게 유지되었습니다.

3. 중요한 "단 하나의 것": 데이터

뇌 구조, 사전, 학습 습관은 중요하지 않았지만, 교과서 자체는 모든 것을 변화시켰습니다.

  • 비유: 두 명의 학생을 상상해 보세요. 학생 A 는 요리에 관한 교과서를 읽고, 학생 B 는 천체물리학에 관한 교과서를 읽습니다.
    • 학생 A 가 슈퍼컴퓨터 뇌를 가지고 있고 학생 B 가 간단한 계산기 뇌를 가지고 있더라도, 학생 A 는 요리는 훌륭하지만 천체물리학은 형편없을 것입니다. 학생 B 는 그 반대일 것입니다.
    • 이 논문은 **사전 학습 데이터 (교과서)**를 변경하면 전체 성능 선이 이동한다는 것을 발견했습니다. 고품질의 교육 데이터 (예: "FineWeb-Edu") 로 학습하면 모델은 실제 세계 작업에서 더 잘 수행합니다. 반면, 엉망인 데이터로 학습하면 수행 능력이 떨어집니다.

실무자를 위한 교훈

이 논문은 AI 를 구축하는 모든 사람에게 명확한 메시지로 결론을 내립니다.

아키텍처에 집착하는 것을 멈추고 데이터에 집착하기 시작하세요.

실제 세계의 작업에서 잘 수행되는 모델을 원한다면 새로운 유형의 뇌를 발명하거나 수학 설정을 조정할 필요가 없습니다. 더 나은 데이터셋을 선별 (큐레이션) 해야 합니다.

  • 데이터가 운전수입니다. 이는 목적지를 결정합니다.
  • 아키텍처와 설정은 단지 자동차일 뿐입니다. 더 효율적이거나 저렴한 여행을 위해 페라리나 혼다로 차를 교체할 수는 있지만, GPS 에 잘못된 지도 (데이터) 를 넣으면 여전히 잘못된 곳에 도착하게 됩니다.

간단히 말해: 데이터가 목적지를 결정합니다. 나머지는 단지 그곳에 얼마나 효율적으로 도달하는지 결정할 뿐입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →