A Bitter Lesson for Data Filtering
본 논문은 대규모 모델 사전 학습에 데이터 필터링이 필수적이라는 통념에 도전하여, 고연산·데이터 부족 환경에서의 확장성 연구를 통해 충분히 학습된 대규모 모델은 저품질 및 방해 데이터를 필터링하는 대신 포함하는 것이 오히려 유리함을 입증합니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
"데이터 필터링에 대한 쓴 교훈"이라는 논문에 대한 설명을 쉬운 언어와 창의적인 비유로 풀어보겠습니다.
핵심 아이디어: "필터 금지" 규칙
거대한 언어 모델이라는 초지능 학생에게 세상의 모든 것을 가르치려 한다고 상상해 보세요. 전통적인 방법은 엄격한 사서처럼 행동하는 것입니다. 거대한 도서관 (인터넷 또는 Common Crawl) 을 뒤져서 지저분하거나, poorly 쓰여진, 혹은 반복적인 책들을 버리고, 컬렉션 중 '최고'인 1% 만 학생에게 건네는 것이죠.
이 논문은 만약 학생을 가르칠 충분한 시간과 에너지 (컴퓨팅 파워) 가 있다면, 사서 역할을 멈추어야 한다고 주장합니다.
저자들은 학생에게 모든 것—좋은 책, 나쁜 책, 반복적인 목록, 그리고 무작위 노이즈까지—읽히면, 책을 필터링해 준 경우보다 결국 더 잘 배우게 된다는 사실을 발견했습니다. 사실, '쓰레기' 데이터는 충분히 크고 잘 훈련된 모델에게는 해롭지 않고 오히려 도움이 됩니다.
실험들: "헬스장" 비유
이를 검증하기 위해 연구자들은 AI 모델들을 위한 일련의 헬스장 같은 실험을 설계했습니다.
1. "깨끗한 대 지저분한" 식단
그들은 거대한 인터넷 텍스트 더미 ("풀") 를 가져와서 다음과 같이 다양한 버전을 만들었습니다.
- 풀: 원본, 필터링되지 않은 인터넷 텍스트.
- 필터들: 비영어권 텍스트, 반복되는 문단, 혹은 흔하지 않은 영어 단어 등을 제거한 버전들. 어떤 필터는 매우 엄격하여 텍스트의 2% 만 남겼고, 다른 것들은 비교적 느슨했습니다.
그들은 이 다양한 식단으로 작고 거대한 다양한 크기의 모델들을 훈련시켰습니다.
- 결과: 작은 모델이나 짧은 훈련 기간에서는 "깨끗한 식단" (필터링된 데이터) 이 더 잘 작동했습니다. 마치 어린아이가 사전보다 그림책으로 더 잘 배우는 것과 같죠.
- 반전: 모델을 더 크게 만들고 더 오래 훈련시킬수록 (더 많은 '컴퓨팅'을 할수록), "지저분한 식단" (전체, 필터링되지 않은 풀) 이 이기기 시작했습니다. 필터링된 데이터가 "더 높은 품질"이었음에도 불구하고, 전체 풀로 훈련된 모델들이 결국 필터링된 데이터로 훈련된 모델들을 추월했습니다.
2. "정크푸드" 주입
이 모델들이 얼마나 튼튼한지 보기 위해, 연구자들은 의도적으로 식단에 "정크"를 섞었습니다.
- 무작위 문자열: "htb hqovl bwdws"와 같이 만든 단어들.
- 순서가 뒤섞인 문장: 실제 문장의 단어 순서를 뒤섞은 것 (예: "Paris France of capital is The").
놀라운 사실: 이 쓰레기가 섞여 있음에도 불구하고, 거대한 모델들은 무너지지 않았습니다. 노이즈를 무시하는 법을 배웠습니다. 기이하게도, 어떤 경우에는 모델들이 깨끗한 데이터보다 뒤섞인 문장에서 더 잘 배웠습니다. 왜일까요? 단어가 뒤섞여 있더라도, "Paris"와 "France"가 자주 함께 나타난다는 사실을 모델이 여전히 파악할 수 있기 때문에, 두 단어 사이의 연결을 배우는 데 도움이 되었기 때문입니다. 이 "쓰레기"는 모델을 더 강하게 만드는 힘든 운동과 같은 역할을 했습니다.
"쓴 교훈"
이 논문은 리처드 서튼의 유명한 개념인 "The Bitter Lesson (쓴 교훈)"을 언급합니다. 그 교훈은 다음과 같습니다: 인간의 직관은 규모를 키울 때 종종 실패합니다.
우리는 인간으로서 "데이터가 너무 지저분하니까 우리가 선별해야 한다"고 생각합니다. 하지만 이 논문은 우리가 더 강력한 컴퓨터를 갖게 됨에 따라, "모든 것을 그냥 먹여라"라는 단순한 접근법이 데이터를 정제하기 위해 우리가 고안한 복잡한 규칙들을 이긴다고 제안합니다. 모델은 배울 시간이 충분하다면, 무엇이 유용하고 무엇이 노이즈인지 스스로 파악할 만큼 충분히 똑똑합니다.
함정: 엄청난 에너지가 필요합니다
이것이 작동하기 위한 주요 조건은 컴퓨팅 파워입니다.
논문은 "모든 것을 읽는" 접근법이 "모든 것을 필터링하는" 접근법을 이기려면 막대한 양의 컴퓨팅 파워가 필요하다고 계산합니다. 전체 Common Crawl 데이터셋 (240 조 단어) 의 경우, 필터링되지 않은 데이터를 명확한 승자로 만들기 위해 약 1e+30 FLOPs(연산 단위) 가 필요할 것으로 추정됩니다.
- 이렇게 생각해보세요: 예산이 적다면, 전문가 편집자를 고용해 데이터를 정리하는 것이 현명한 선택입니다. 하지만 수십억 달러의 예산이 있다면, 인터넷의 모든 페이지를 읽을 백만 명의 인턴을 고용할 여유가 있습니다. 그리고 그 압도적인 양의 독서가 편집자가 할 수 있는 것보다 AI 를 더 많이 가르쳐 줄 것입니다.
결론
이 논문은 거대 AI 모델의 미래를 위해 우리는 완벽한 큐레이터가 되려 애쓰는 것을 멈춰야 한다고 결론지었습니다. "나쁜" 데이터를 필터링하려는 데 막대한 자원을 쏟는 대신, 더 큰 모델을 구축하고 원본의 지저분하고 필터링되지 않은 인터넷에서 더 오랫동안 훈련시키는 데 집중해야 합니다. 모델들은 놀라울 정도로 회복력이 있습니다. 노이즈를 처리할 뿐만 아니라, 그것을 이용해 더 잘 배울 수도 있습니다.
요약하자면: 충분한 파워가 있다면, 최고의 필터는 아예 필터가 없는 것입니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.