Bridging Compute- and Data-Optimal Pretraining
이 논문은 계산량-데이터(Compute-Data, CD) 스케일링 법칙을 소개하는데, 이는 파생 데이터의 수확 감소를 토큰 효율성 함수를 통해 모델링하여 계산량 최적 및 데이터 최적 사전 학습 체제 사이의 간극을 메우는 통합된 프레임워크로서, 고전적인 계산량 최적 할당이 대부분의 실제 설정에서 차선책임을 밝혀낸다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 거대하고 똑똑한 로봇에게 인간의 언어를 가르치려 한다고 상상해 보세요. 수년 동안 과학자들은 그 비결이 아주 간단하다고 믿었습니다. 바로 로봇에게 새로운 이야기, 사실, 책들을 계속해서 더 많이 먹이는 것이라고 말이죠. 로봇의 뇌(모델 크기)가 커지고 더 많은 새로운 책을 제공할수록 로봇은 점점 더 똑똑해질 것이라는 아이디어였습니다. "스케일링 법칙(scaling laws)"이라고 알려진 이 개념은, 만약 충분한 컴퓨터 성능(연산량)만 있다면 더 많은 데이터를 구매함으로써 로봇을 영원히 더 똑똑하게 만들 수 있다고 제안했습니다.
하지만 함정이 있습니다. 우리는 신선하고 고품질인 책들이 고갈되어 가고 있습니다. 인터넷은 유한하며, 완벽한 새로운 이야기를 쓰는 데는 시간과 돈이 듭니다. 반면, 우리의 컴퓨터는 나날이 빨라지고 저렴해지고 있습니다. 이는 기묘한 문제를 만들어냅니다. 우리는 초강력 엔진(연산량)을 가지고 있지만, 연료 탱크(데이터)는 거의 비어 있는 상태가 된 것입니다. 과학자들의 큰 의문은 이것이었습니다. 만약 우리가 더 많은 신선한 책을 구할 수 없다면, 로봇이 더 똑똑해지도록 똑같은 책을 반복해서 읽게 하거나 다른 방식으로 다시 쓰게 할 수 있을까요? 이야기를 두 번 읽는 것이 새로운 것을 한 번 읽는 것만큼 도움이 될까요?
이것이 바로 연구자 티안 킨(Tian Qin), 키미아 하미디에(Kimia Hamidieh), 그리고 데이비드 알바레즈-멜리스(David Alvarez-Melis)가 새로운 논문에서 다룬 퍼즐입니다. 그들은 데이터가 부족할 때 AI 모델을 훈련하기 위한 완벽한 레시피를 찾고자 했습니다. 그들은 "컴퓨트-데이터(CD) 스케일링 법칙"이라는 새로운 규칙 세트를 개발했습니다. 이것을 여행을 위한 새로운 지도라고 생각해보세요. 예전 지도가 "계속 직진하세요"라고 말했다면, 새 지도는 "이봐, 길이 끝나가고 있어! 여기 우회하는 방법이 있어"라고 말하는 것과 같습니다.
연구팀은 단순히 오래된 데이터를 다시 읽는 것이 마법 같은 해결책이 아니라는 것을 발견했습니다. 그들은 "파생 토큰(derived tokens)"—책을 다시 읽거나 문장을 자신의 언어로 다시 쓰는 것—이 신선하고 독창적인 텍스트보다 가치가 낮다는 것을 발견했습니다. 더 많이 반복하거나 바꾸어 말할수록, 새로운 단어가 주는 가치는 줄어듭니다. 이것은 맛있는 케이크를 먹는 것과 같습니다. 첫 번째 조각은 환상적이고, 두 번째는 괜찮지만, 열 번째 조각에 이르면 당신은 이미 배가 불러서 더 이상 즐겁지 않은 것과 마찬가지입니다.
이를 증명하기 위해 그들은 1,400만 개의 "뉴런"을 가진 아주 작은 모델부터 6억 개의 뉴런을 가진 중간 크기의 모델까지 수십 개의 AI 모델을 훈련시켰으며, 돌마-3(Dolma-3)라는 방대한 텍xt 라이브러리를 사용했습니다. 그들은 두 가지 주요 전략을 테스트했습니다: 다중 에포크 반복(같은 책을 계속해서 읽기)과 패러프레이징(뉴스 기사를 수학 문제나 FAQ처럼 다른 스타일로 다시 쓰기).
그들의 결과는 놀랍고 매우 구체적이었습니다. 그들은 "재읽기"나 "다시 쓰기"의 가치가 로봇의 뇌 크기와 이미 본 신선한 데이터의 양에 따라 크게 달라진다는 것을 발견했습니다.
- 작은 로봇(6억 파라미터 미만)의 경우, 신선한 데이터가 제한적일 때 패러프레이징은 훌륭한 기술입니다. 이것은 로봇에게 같은 이야기라도 새로운 관점을 주는 것과 같아서 학습에 도움이 됩니다.
- 큰 로봇(70억 파라미터 이상)의 경우, 혹은 이미 많은 신선한 데이터를 가지고 있는 경우, 패러프레이징은 효과가 없습니다. 이것은 박사 과정 학생에게 동화책을 다시 써서 가르치려는 것과 같습니다. 그들은 이미 기초를 배웠고, 새로운 버전은 아무것도 새로 가르쳐주지 못합니다.
- 반복(같은 책을 다시 읽는 것)은 더 큰 모델에서 더 잘 작동하지만, 이 역시 한계가 있습니다. 똑같은 책을 영원히 읽는다고 해서 로봇이 무한히 똑똑해질 수는 없습니다.
논문은 "파생된" 단어가 "신선한" 단어에 비해 정확히 얼마나 가치가 있는지를 측정하기 위해 ** (에타)**라고 부르는 특별한 숫자를 도입했습니다. 만약 가 1이라면, 그 단어는 신선한 단어만큼 좋습니다. 만약 0이라면, 그것은 쓸모가 없습니다. 그들은 가 고정된 숫자가 아니며, 모델이 커질수록, 그리고 파생된 데이터를 더 많이 사용할수록 떨어진다는 것을 발견했습니다.
이것은 엔지니어들이 다음에 무엇을 해야 할지 결정하는 데 도움을 주는 세 가지 뚜렷한 "구간(zone)"으로 이어집니다:
- 컴퓨트 제한 구간(Compute-Bound): 신선한 데이터는 충분하지만 컴퓨터 연산 능력이 부족한 상태입니다. 여기서는 신선한 데이터에 대한 훈련을 계속해야 합니다.
- 데이터 제한 구간(Data-Bound): 신선한 데이터를 다 써버린 상태입니다. 여기서는 반복이나 패러프레이징에 더 많은 컴퓨터 성능을 쓸 수 있지만, 수익률이 빠르게 떨어지므로 주의해야 합니다.
- 모델 제한 구간(Model-Bound): 모든 데이터를 다 사용했고 컴퓨터 성능도 최대치에 도달한 상태입니다. 이제 똑똑해지는 유일한 방법은 더 큰 뇌(더 큰 모델)를 만드는 것입니다.
또한 그들은 가장 실용적인 시사점 중 하나인 책을 몇 번 읽어야 하는가에 대해 다루었습니다. 과거에는 데이터셋을 4번 읽는 것(4 에포크)이 일반적인 규칙이었습니다. 저자들은 이것이 특정 양의 데이터를 가진 중간 크기의 모델에게만 좋은 아이디어라는 것을 발견했습니다. 만약 당신이 거대한 모델이나 방대한 데이터셋을 가지고 있다면, 4번 읽는 것은 시간과 돈 낭비입니다. 훨씬 더 일찍 멈춰야 합니다. 반대로, 데이터가 아주 적은 매우 작은 모델의 경우에는 훨씬 더 많이 읽어야 할 수도 있습니다.
그들은 두 전략을 나란히 비교했습니다. 그들은 "티핑 포인트(전환점)"를 발견했습니다. 만약 모델이 작고(6억 미만) 데이터가 많지 않다면, 패러프레이징이 승자입니다. 하지만 모델이 커지거나(70억 이상) 데이터셋이 거대해지면, 반복이 더 나은 선택이 되며 패러프레이징은 오히려 효과가 없어집니다.
요약하자면, 이 논문은 "그저 더 많은 데이터를 사라"는 시대는 끝났음을 말해줍니다. 우리는 우리가 가진 데이터를 어떻게 스마트하게 사용할 것인가의 새로운 시대로 진입하고 있습니다. 단순히 컴퓨터 성능을 문제에 쏟아붓는다고 해서 작동할 것이라 기대할 수 없습니다. 우리는 언제 반복을 멈춰야 하는지, 언제 다시 쓰기를 시도해야 하는지, 그리고 언제 더 큰 뇌가 필요하다는 것을 인정해야 하는지를 정확히 알아야 합니다. 저자들은 대부분의 실질적인 상황에서, (데이터가 무한하다고 가정했던) 기존의 "친칠라(Chinchilla)" 규칙은 더 이상 최선의 가이드가 아니라고 제안합니다. 대신, 우리는 헛된 기술에 시간을 낭비하지 않기 위해 컴퓨터 성능, 모델 크기, 그리고 데이터 예산을 정교하게 균형 잡아야 합니다.
연구자들은 자신들의 발견에 매우 확신하고 있는데, 왜냐하면 그들은 다양한 모델 크기와 데이터 양에 걸쳐 이를 테스트했으며 수학적으로도 성립했기 때문입니다. 그들은 또한 이러한 기술로 훈련된 모델들이 실제 작업(질문에 답하거나 수학 문제를 푸는 등)에서 실제로 더 나아졌는지 확인했는데, 결과는 그렇습니다. "손실(loss, 로봇이 얼마나 혼란스러워하는지를 나타내는 척도)"이 낮을수록 로봇의 성능은 더 좋았습니다.
그러니 다음에 새로운 AI 모델에 대한 소식을 듣게 된다면, 기억하세요. 그것은 단순히 얼마나 많이 읽었느냐의 문제가 아니라, 어떻게 읽었느냐의 문제입니다. 그리고 만약 당신이 AI를 훈련시키는 사람이라면, 똑같은 플레이리스트를 계속 "반복" 재생하기만 하지 마세요. 때로는 리믹스가 필요하고, 때로는 그냥 더 큰 뇌를 가져야 할 때도 있습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.