Scaling Domain Data Repetition in LLM Pretraining
이 논문은 대규모 언어 모델 사전 학습에서 데이터 반복과 과적합 사이의 절충 관계를 조사하며, 고품질 도메인 데이터에 대한 최적의 반복 횟수가 파라미터당 토큰 비율이 고정되었을 때 모델 크기에 따라 완만하게 증가하고 도메인의 검증 손실과 강한 음의 상관관계를 보인다는 점을 밝힘으로써, 더 작은 프록시 모델에서의 튜닝이 더 큰 모델을 위한 스케일링 전략을 효과적으로 안내할 수 있음을 시사한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 초지능 로봇에게 말하기, 쓰기, 그리고 생각하는 법을 가르치려 한다고 상상해 보세요. 이를 위해 당신은 로봇에게 방대한 텍스트 도서관을 입력하는데, 이 과정을 '사전 학습(pretraining)'이라고 부릅니다. 하지만 여기에는 함정이 있습니다. 로봇은 더 많은 '뇌세포(파라미터)'를 추가할수록 더 커지고 똑똑해지는데, 로봇이 혼란에 빠지거나 성능이 저하되는 것을 막으려면 훨씬 더 많은 양의 단어를 먹여줘야 합니다. 이것이 바로 거대 언어 모델(LLM)의 세계입니다. 문제는, 인터넷상의 일반적인 텍스트(예: 무작위 포럼 게시글이나 뉴스 기사)는 끝없이 쉽게 찾을 수 있지만, 진정으로 고품질인 전문 지식(예: 고급 수학, 코딩, 또는 의학적 사실)을 찾는 것은 마치 건초더미에서 바늘 찾기와 같습니다. 거대한 로봇에게 먹일 만큼의 고품질 데이터는 충분하지 않습니다.
그렇다면 좋은 데이터를 다 써버리면 어떻게 해야 할까요? 당신은 그것을 반복하기 시작합니다. 그 귀중한 수학 교과서를 가져와서 로봇에게 계속해서 반복해서 먹이는 것입니다. 하지만 이것은 매우 섬세한 균형 잡기입니다. 만약 좋은 데이터를 너무 많이 반복하면, 로봇이 실제 개념을 이해하는 대신 책의 내용을 글자 그대로 암기해 버리는 '과적합(overfitting)' 문제가 발생할 수 있습니다. 반대로 너무 적게 반복하면, 로봇은 일반적인 인터넷 노이즈의 바다에 휩쓸려 어려운 내용을 제대로 배우지 못하게 됩니다. 여기서 큰 질문이 생깁니다. 로봇이 혼란에 빠지기 전까지, 좋은 데이터를 몇 번이나 반복해야 할까요?
"Scaling Domain Data Repetition in LLM Pretraining"이라는 제목의 이 논문은 바로 그 질문을 깊이 있게 파고듭니다. 칭화 대학교와 ByteDance Seed의 연구진은 로봇이 커짐에 따라 고품질 데이터와 일반 데이터를 섞는 완벽한 레시피를 찾고자 했습니다. 그들은 이를 코드(Code), 수학(Math), 위키피디아(Wikipedia), 의료 기록(Medical records)이라는 네 가지 특별한 '맛'의 데이터로 테스트했습니다.
여기서 그들이 발견한 내용은 다음과 같으며, 이는 일종의 반전입니다. 오랫동안 사람들은 로봇이 커질수록 더 취약해지고 데이터를 더 빨리 과적합(암기)할 것이라고 생각했습니다. 기존의 조언은 "좋은 데이터를 너무 많이 반복하지 마라, 그렇지 않으면 큰 로봇이 망가질 것이다"였습니다. 하지만 저자들은 훈련 예산을 로봇의 크기에 비례하게 유지했을 때(고정된 '파라미터당 토큰' 비율 규칙) 놀라운 사실을 발견했습니다. 더 큰 로봇이 오히려 작은 로봇보다 더 많은 반복을 감당할 수 있다는 것입니다. 이는 마치 두 로봇 모두 동일한 강도로 훈련받는다면, 거대한 운동선수가 작은 선수보다 더 많은 바퀴를 돌 수 있는 것과 같습니다.
하지만 그들이 발견한 가장 중요한 규칙은 로봇의 크기가 아니라 데이터 자체의 품질에 관한 것이었습니다. 그들은 로봇이 특정 주제를 얼마나 잘 배우는지와 해당 주제를 얼마나 많이 반복할 수 있는지 사이에 강력한 연결 고리가 있음을 발견했습니다. 만약 로봇이 특정 도메인(예: 수학)을 매우 잘 배우고 '오차 점수(검증 손실)'가 낮다면, 그 데이터는 망가지지 않고 여러 번 반복해서 학습할 수 있습니다. 하지만 로봇이 특정 주제를 어려워하고 오차 점수가 높다면, 매우 빠르게 과적합이 발생하므로 해당 데이터를 아주 적게 반복해야 합니다.
흥미롭게도, 처음에 가지고 있는 고유 데이터의 양은 데이터를 몇 번 반복할지 결정하는 데 큰 영향을 미치지 않는 것으로 보였습니다. 아주 작은 수학 문제 더미를 가지고 있든 아주 큰 더미를 가지고 있든, 반복의 '최적점'은 거의 일정하게 유지되었습니다. 연구진은 만약 거대한 로봇을 훈련시키고 싶다면 추측할 필요가 없다고 제안합니다. 먼저 더 작은 '대리(proxy)' 로봇을 훈련시켜 그 로봇이 수학이나 코드를 얼마나 잘 배우는지 확인한 다음, 그 결과를 바탕으로 거대 로봇을 위해 데이터를 몇 번 반복할지 안전하게 예측할 수 있습니다.
또한 그들은 전체 '좋은 데이터'의 양을 동일하게 유지하면서, 고유 데이터를 반복 데이터로 교체했을 때 어떤 일이 일어나는지도 테스트했습니다. 그 결과, 수학과 같은 일부 주제의 경우 데이터를 반복하는 것이 새로운 고유 데이터를 추가하는 것만큼이나 효과적이라는 것을 발견했습니다. 하지만 위키피디아와 같은 다른 주제의 경우, 새로운 문장을 읽는 대신 똑같은 위키피디아 문장을 반복해서 듣는 것은 좋지 않은 선택이었습니다.
마지막으로, 그들은 로봇의 '학습 속도(learning rate)'가 훈련 중에 어떻게 변하는지 살펴보았습니다. 그들은 만약 훈련 초기에 로봇의 속도를 늦추면, 로봇이 반복에 더 민감해지고 더 빨리 과적합된다는 것을 발견했습니다. 반면, 학습 속도를 더 오랫동안 높게 유지한다면, 로봇은 암기하는 대신 학습하는 단계에 이르기 전까지 더 많은 반복을 견뎌낼 수 있습니다.
요약하자면, 이 논문은 데이터를 몇 번 반복해야 하는지에 대한 단 하나의 마법 같은 숫자는 존재하지 않는다는 것을 시사합니다. 대신, 최선의 전략은 로봇이 이미 그 특정 주제를 얼마나 잘 배우고 있는지에 달려 있습니다. 빠른 학습자라면 데이터를 더 많이 반복하세요. 느린 학습자라면 더 빨리 반복을 멈추세요. 그리고 놀랍게도, 적절한 양의 데이터를 로봇의 크기에 맞춰 제공하기만 한다면, 더 큰 로봇은 우리가 생각했던 것보다 반복에 훨씬 더 강합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.