The Limits of Training Data Size in Foundation Models: An Empirical Analysis of Quality Filtering under a Fixed Token Pool
고정된 2,400만 토큰 풀을 대상으로 한 경험적 실험을 통해, 본 논문은 고정된 연산 예산 하에서 공격적인 품질 필터링이 과도한 데이터 반복을 강제함으로써 종종 모델 성능을 저해하는 반면, 저품질 데이터를 유지하고 고품질 서브셋을 오버샘플링하는 것이 다양한 목표에 대해 더 우수하거나 동등한 결과를 도출한다는 것을 입증한다.
원본 논문은 CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 초지능 로봇에게 인간의 언어를 가르치려 한다고 상상해 보세요. 이를 위해 당신은 책, 웹사이트, 기사 등 방대한 양의 텍스트 라이브러리를 로봇에게 입력해야 합니다. 오랫동안 과학자들은 로봇에게 얼마나 많은 텍스트를 먹여주는지가 유일하게 중요한 요소라고 생각했습니다. 라이브러리가 커질수록 로봇은 더 똑똑해질 것이라는 생각이었죠. 이 개념을 "스케일링(scaling)"이라고 부르며, 이것이 오늘날 우리의 AI 비서들이 뛰어난 성능을 보이는 이유입니다.
하지만 함정이 있습니다. 모든 텍스트가 똑같은 가치를 지니는 것은 아닙니다. 어떤 페이지는 헛소리, 스팸, 또는 횡설수설로 가득 차 있는 반면, 어떤 페이지는 전문가들에 의해 작성되었으며 유용한 정보가 가득합니다. 그래서 연구자들은 다음과 같은 질문을 던지기 시작했습니다. "나쁜 것들을 버리고 가장 좋은 책들만 로봇에게 먹여야 할까?" 이것을 "품질 필터링(quality filtering)"이라고 부릅니다. 하지만 게임에는 두 번째 규칙이 있습니다. 로봇은 새로운 정보를 볼 때 가장 잘 배운다는 것입니다. 만약 로봇이 똑같은 몇 페이지를 계속해서 반복해서 읽게 만든다면, 로봇은 학습을 멈추고 그저 암기하기 시작할 것입니다. 이 논문은 까다로운 균형 문제를 탐구합니다. 즉, 나쁜 텍스트를 버리면 읽어야 할 페이지 수가 줄어들고, 이는 로봇이 좋은 페이지를 더 많이 반복해서 읽어야 함을 의미합니다. 더 적고 더 좋은 페이지를 갖는 것이 도움이 될까요, 아니면 로봇이 같은 것을 너무 많이 읽어서 지루해하고 혼란에 빠지게 될까요?
위대한 도서관 실험
이 연구에서 알렉산더 멤밍(Alexander Memming)이라는 연구자는 이 수수께끼를 풀기 위해 영리한 실험을 설계했습니다. 그는 전체 인터넷을 사용하지 않았습니다(테스트하기에는 너무 크기 때문입니다). 대신, 그는 약 2,400만 단어로 구성된 "고정된 풀(fixed pool)"을 구축했습니다. 이는 웹의 아주 작고 관리 가능한 조각입니다. 그런 다음 그는 이 동일한 단어 풀을 여러 개의 작은 AI 모델들에게 주었지만, 각 모델에 적용되는 규칙은 다르게 설정했습니다.
어떤 모델들에게는 모든 단어를 그대로 남겨두었습니다. 다른 모델들에게는 엄격한 사서처럼 행동하여, 컴퓨터가 "고품질"이라고 판단한 단어들만 남기고 나머지 절반, 4분의 1, 8분의 1, 혹은 심지어 상위 16분의 1만 남기고 나머지는 버렸습니다. 또한 그는 세 번째 접근 방식도 시도했습니다. 아무것도 버리는 대신, 전체 라이브러리를 유지하되 로봇에게 "좋은" 페이지를 "괜찮은" 페이지보다 훨씬 더 많이 읽도록 지시하는 방식입니다.
그 후 그는 세 가지 서로 다른 작업으로 이 로봇들을 테스트했습니다:
- 가공되지 않은 웹(The Raw Web): 라이브러리에 있던 것과 똑같이 모든 것이 섞여 있는 상태입니다.
- "교육용(Edu)" 텍스트: 고품질의 교육용 페이지들(로봇이 사랑하도록 훈련받은 종류의 데이터)입니다.
- 위키텍스트(WikiText): 로봇이 한 번도 본 적 없는 완전히 다른 백과사전 기사들입니다.
놀라운 결과들
결과는 마치 롤러코스터 같았으며, 세 가지 큰 방식으로 게임의 규칙을 바꾸어 놓았습니다.
1. 누구와 대화하느냐에 따라 달라진다
가장 놀라운 점은 "품질 필터링"이 항상 로봇을 더 똑똑하게 만드는 것은 아니라는 사실이었습니다. 그것은 전적으로 당신이 로봇에게 무엇을 원하는지에 달려 있습니다.
- 만약 당신이 지저분한 실제 인터넷을 이해하기를 원한다면: "나쁜" 텍스트를 버리는 것이 오히려 로봇에게 해가 되었습니다. 연구자가 더 많이 필터링할수록 로봇의 성능은 더 나빠졌습니다. 이는 완벽하고 텅 빈 트랙에서만 운전 연습을 하는 것과 같습니다. 마침내 포트홀과 교통 체증이 있는 실제 도로에 나갔을 때, 사고를 내고 마는 것이죠. 필터링된 데이터로 훈련된 로봇은 웹의 지저난 현실을 감당할 수 없었습니다.
- 만약 당신이 고품질 주제의 전문가가 되기를 원한다면: 필터링이 약간 도움이 되었습니다. 목표가 학자나 백과사전처럼 들리는 것이라면, 가장 좋은 페이지들만 남기는 것이 로봇을 조금 더 낫게 만들었습니다.
2. 더 많이 훈련할수록, 더 적게 필터링해야 한다
여기 가장 중요한 교훈이 있습니다: 당신의 예산 규모가 최선의 전략을 바꿉니다.
당신에게 적은 용돈(작은 훈련 예산)이 있다고 상상해 보세요. 당신은 가장 비싸고 고품질인 장난감만 사고 싶을 수도 있습니다. 하지만 당신에게 엄청난 용돈(거대한 예산)이 있다면, 비싼 장난감만 사는 것은 매우 빠르게 새로운 장난감을 고갈시킨다는 것을 의미합니다. 결국 당신은 똑같은 비싼 장난감을 가지고 지루해질 때까지 반복해서 가지고 놀게 될 것입니다.
연구에 따르면, 훈련 예산이 커짐에 따라 "최선의" 전략도 변했습니다. 처음에는 상위 1/16의 데이터만 남기는 것이 괜찮아 보였습니다. 하지만 로봇이 더 오래 훈련받으면서(데이터를 4.1번 읽는 대신 8.2번 읽음), 그 작은 필터링된 라이브러리는 재앙이 되었습니다. 로봇은 지루해졌고 실수를 하기 시작했습니다. 큰 예산을 위한 최선의 전략은 더 많은 데이터, 즉 지저분한 부분까지도 포함하여 유지함으로써 로봇이 계속해서 새로운 것을 볼 수 있게 하는 것이었습니다.
3. 버리지 말고, 더 많이 읽게 하라
연구자는 또한 "나쁜 텍스트를 버리는 것"과 "좋은 텍스트를 더 자주 읽는 것"을 비교했습니다.
- "버리기" 방식: 저품질 페이지를 삭제합니다.
- "더 읽기" 방식: 전체 페이지를 유지하되, 로봇에게 "이 상위 페이지들을 16번 읽고, 하위 페이지들은 1번만 읽어라"라고 말합니다.
연구자가 매우 공격적인 필터링(상위 1/16만 남김)을 시도했을 때, "더 읽기" 방식이 압도적인 차이로 승리했습니다. 이 방식은 "버리기" 방식보다 무려 0.39 nats(로봇이 다음 단어를 얼마나 잘 예측하는지를 나타내는 측정 단위) 더 높았습니다.
이렇게 생각해 보세요: 당신이 가장 좋아하는 노래가 있다면, 플레이리스트에서 다른 모든 노래를 삭제하고 그 노래만 16번 들을 수도 있고(버리기), 전체 플레이리스트를 유지하되 그 좋아하는 노래가 16번 더 자주 나오게 할 수도 있습니다(더 읽기). 두 번째 방법이 더 나은데, 왜냐하면 다른 노래들이 배경에서 계속 흥미를 유지해 주며, 전체 라이브러리의 독특한 다양성을 잃지 않기 때문입니다.
결론
이 논문은 우리가 AI를 더 똑똑하게 만들기 위해 노력을 멈춰야 한다고 말하는 것이 아닙니다. 대신, "나쁜" 데이터를 무턱대고 버려서는 안 된다고 경고합니다.
- 실제 세상을 이해하기를 원한다면 필터링하지 마세요: AI가 지저분한 인터넷을 이해하기를 원한다면, 그 지저분한 데이터도 유지하세요.
- 예산이 많다면 너무 많이 필터링하지 마세요: 컴퓨팅 파워가 많다면, 당신은 방대한 종류의 데이터가 필요합니다. 너무 엄격하게 필터링하면 AI가 반복하게 되어 학습을 방해하게 됩니다.
- 반복이 삭제보다 낫습니다: 정말로 최고의 데이터에 집중하고 싶다면, 나머지를 삭제하지 마세요. 대신 AI가 나쁜 것보다 좋은 것을 더 자주 보게 하세요.
이 연구는 작은 모델과 작은 데이터 조각을 대상으로 수행되었으므로, 미래의 거대 AI 모델에서 정확히 어떤 일이 일어날지 확언할 수는 없습니다. 하지만 교훈은 명확합니다: 데이터 품질과 데이터 양을 별개의 것으로 취급하는 것은 실수입니다. 이 둘은 연결되어 있으며, AI를 훈련하는 최선의 방법은 당신이 가진 시간과 비용에 따라 달라집니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.