CuraWeb: Joint Optimization of Quality, Redundancy, and Diversity for Web-Scale Pretraining Data
이 논문은 단일 목적의 큐레이션이 갖는 한계를 극복하기 위해 품질, 중복성, 다양성의 균형을 맞추는 공동 최적화 프레임워크를 통해 구축된 새로운 2T 토큰 규모의 영어 코퍼스인 CuraWeb을 소개하며, 이는 지식 집약적 및 추론 작업에서 LLM의 성능을 크게 향상시키는 더욱 총체적인 데이터 분포를 결과로 도출한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 초지능 로봇에게 세상을 이해하는 법을 가르치려 한다고 상상해 보세요. 이를 위해 단순히 몇 권의 교과서를 주는 것이 아니라, 인터넷 전체를 로봇의 뇌에 쏟아붓는 것입니다. 이것이 현대 인공지능(AI)이 학습하는 방식인 '사전 학습(pre-training)'입니다. 과학자들은 로봇이 인간의 언어, 사고방식, 문제 해결 능력을 배울 수 있도록 웹사이트, 뉴스 기사, 포럼에서 추출한 수십억 개의 문장을 읽게 합니다. 하지만 여기에는 함정이 있습니다. 인터넷은 엉망진창이라는 점입니다. 스팸, 복사해서 붙여넣은 무의미한 내용, 반복적인 광고로 가득 차 있습니다. 만약 로봇에게 정크 푸드 위주의 식단을 제공한다면, 로봇은 병이 들고 명확하게 생각할 수 없게 됩니다. 그래서 연구자들은 엄격한 영양사처럼 행동하며, 나쁜 것을 걸러내고 고품질의 다양하고 흥미로운 정보만을 남겨야 합니다. 그들이 씨름해 온 큰 질문은 이것입니다: 로봇을 진정으로 똑똑하게 만드는 희귀하고, 기이하며, 찬란한 아이디어들을 실수로 버리지 않으면서 어떻게 인터넷을 정화할 것인가?
여기, 이 복잡한 문제를 해결하려는 메이투안(Meituan) 연구진의 새로운 프로젝트, CuraWeb이 있습니다. 이전의 방법들을 모래 속에서 금을 걸러내기 위해 거대한 둔탁한 체를 사용하는 것에 비유한다면, CuraWeb은 다릅니다. 기존의 데이터 정제 방식은 단순한 규칙을 사용하여 '나쁜' 텍스트를 필터링했지만, 그 과정에서 수학, 코딩, 과학 논문처럼 '이상해 보이는' 글들을 흔한 문장과 다르다는 이유로 버리곤 했습니다. 이는 마치 금을 찾으려다 흙과 함께 금 덩어리까지 버리는 것과 같았습니다. CuraWeb 팀은 진정으로 뛰어난 AI를 구축하려면 더 섬세한 접근 방식이 필요하다는 것을 깨달았습니다. 그들은 단순히 데이터를 청소하는 것을 넘어, 수집품이 고품질이고 중복되지 않으며 인류 지식의 모든 구석을 아우를 수 있도록 박물관 큐레이터처럼 데이터를 큐레이팅하고자 했습니다.
"일률적인 체"의 문제점
오랫동안 AI를 위한 데이터를 준비하는 표준적인 방식은 공장의 조립 라인과 비슷했습니다. 먼저, 규칙 기반 필터(예: 페이지에 숫자가 너무 많거나 이상한 기호가 있는지 확인)를 통해 텍le를 통과시킵니다. 그다음, 텍스트가 '좋은지' 예측하는 모델을 통과시킵니다. 마지막으로 중복을 제거합니다. 저자들이 발견한 문제는, 이 조립 라인이 모든 주제를 동일하게 취급한다는 것이었습니다. 이는 마치 제목이 너무 길거나 어휘가 복잡하다는 이유로 책을 버리는 사서와 같습니다.
실제로 수학 교과서나 코딩 매뉴얼은 일반적인 블로그 포스트와 비교했을 때 '엉망'일 수 있습니다. 공식, 기호, 특이한 형식을 갖추고 있기 때문입니다. 오래된 필터들은 이를 오류로 간주하고 삭제했습니다. 이는 AI가 스스로를 똑똑하게 만드는 핵심 요소인 복잡한 추론과 전문 지식을 배울 기회를 놓치게 만들었습니다. 또한 기존 방식은 AI가 엔터테인먼트나 쇼핑 같은 인기 주제만 읽게 되어, 과학, 법률, 틈새 취미 분야에 존재하는 '롱테일(long-tail)' 지식을 놓치게 만드는 '균질화된' 식단을 만드는 경향이 있었습니다.
CuraWeb의 솔루션: 스마트한 멀티 트랙 주방
CuraWeb 팀은 단일한 둔탁한 필터에서 벗어나 품질(좋은가?), 중복성(복사본인가?), 다양성(독특한가?)이라는 세 가지 요소의 **결합 최적화(joint optimization)**로 전환하는 새로운 데이터 요리법을 제안했습니다. 그들은 각자 특정 역할을 맡은 전문가 팀처럼 협력하여 AI를 위한 2조 토큰 규모의 성찬을 준비하는 프레임워크를 구축했습니다.
1. 맞춤형 체 (도메인 인식 필터링)
모든 것에 동일한 규칙을 적용하는 대신, CuraWeb은 블로그 포스트와 수학 문제를 구분할 줄 아는 '스마트한 체'를 사용합니다.
- 기존 방식: 문서에 너무 많은 기호(예:
+,-,=)가 있으면, 기존 규칙은 이를 쓰레기로 판단하여 삭제했습니다. - CuraWay: 그들은 수학과 코딩의 경우 이러한 기호들이 필수적이라는 사실을 깨달았습니다. 그래서 '우선순위 바이패스(priority bypass)'를 만들었습니다. 시스템이 문서가 수학, 과학 또는 코딩에 관한 것임을 감지하면, 엄격한 '기호 제한' 규칙을 건너뜁니다. 이를 통해 복잡한 문서들이 다음 단계로 통과되도록 하여, AI가 미적분이나 코딩을 할 수 있는 능력을 잃지 않도록 보장합니다. 또한 규칙을 정교하게 다듬어, 기존 필터가 버렸을 법한 유용한 지식 조각들을 더 많이 유지하도록 했습니다.
2. "소프트" 중복 탐지기
누군가 이름만 바꿔서 계속 똑같은 양식을 인쇄하는 도서관을 상상해 보세요. 단순한 스캐너는 텍스트가 완전히 일치하지 않으면 이를 놓칠 수 있습니다.
- 기 기존 방식: 기존 시스템은 '하드 임계값(hard threshold)'을 사용했습니다. 두 문서가 95% 유사하면 하나를 삭제했습니다. 하지만 이는 위험했습니다. 전문 분야에서는 전문가들이 동일한 기술 용어를 자주 사용하기 때문에, 서로 다른 내용을 말하고 있음에도 매우 유사해 보일 수 있습니다. 하드 삭제 방식은 이러한 가치 있고 독특한 통찰력을 쓸어버릴 수 있었습니다.
- CuraWay: 그들은 소프트 시맨틱 중복 제거(Soft Semantic Deduplication) 전략을 도입했습니다. 문서를 즉시 삭제하는 대신, 여러 각도에서 얼마나 유사한지 확인하는 '투표 시스템'을 사용합니다. 만약 문서가 정말로 유사하다면(예: 복사해서 붙여넣은 작업), 높은 페널티를 부여합니다. 하지만 단순히 동일한 기술적 주제를 다루고 있어서 유사한 것이라면, 낮은 페널티를 부여합니다. 문서는 '페널티 점수'가 너무 높아질 때만 삭제됩니다. 이는 어떤 책이 다른 책과 주제가 같다고 해서 바로 버리는 것이 아니라, 실제로 같은 이야기일 때만 버리는 사서와 같습니다. 이 방법은 까다로운 사례에서 잘못된 삭제(좋은 것을 버리는 것)를 37.5%에서 28.03%로 줄였습니다.
3. 스마트 샘플러 (파워 샘플링)
데이터가 깨끗해졌다면, 이제 무엇을 로봇에게 먹일지 결정해야 합니다. 모든 것을 다 먹일 수는 없으므로 가장 좋은 것을 골라야 합니다.
- 기존 방식: 일부 시스템은 단순히 무작위로 고품질 문서를 선택했습니다. 다른 시스템은 품질과 다양성의 균형을 맞추려 노력했지만, 종종 지루한 혼합물을 만들어냈습니다.
- CuraWay: 그들은 파워 샘서플링(Power Sampling) 방식을 만들었습니다. 가장 흥미롭고 가치 있는 문서(예: 깊이 있는 과학 논문이나 영리한 추론 과제)의 티켓에 훨씬 더 큰 숫자를 부여하여 당첨 확률을 높이는 복권 게임을 상상해 보세요. 그들은 두 가지 기준으로 문서를 점수화했습니다: 작성 품질(잘 쓰였는가?)과 콘텐츠 가치(새로운 것을 가르치는가?). 이 점수들을 결합하고 '파워' 함수를 사용하여 최고의 문서들을 증폭시켰습니다. 즉, AI가 평균적인 내용들만 잔뜩 먹는 것이 아니라, 가치 있고 다양한 지식이 풍부한 식단을 섭취하게 됩니다.
결과: 더 똑똑한 로봇
연구진은 30억 파라미터 규모의 AI 모델을 훈련시켜 새로운 데이터셋인 CURAWEB을 테스트했습니다. 그들은 이 모델을 FineWeb-Edu 및 DCLM과 같은 유명 데이터셋으로 훈련된 모델들과 비교했습니다.
결과는 명확했습니다: CuraWeb이 더 우수했습니다.
- 전반적인 성능: CuraWeb으로 훈련된 모델은 10개의 서로 다른 벤치마크에서 평균 **48.07%**를 기록하며, 기존 최고 모델인 DCLM을 1.82% 앞질렀습니다.
- 추론 및 지식: 가장 큰 성과는 깊은 사고를 요구하는 과제에서 나타났습니다. GSM8K라는 수학 테스트에서 CuraWeb 모델은 차순위 모델보다 4.39% 상승했습니다. 일반 지식 테스트(MMLU)에서는 6.61% 개선되었습니다.
- "전문가" 효과: 연구는 일부 오래된 데이터셋이 특정 분야(예: 교과서)에는 뛰어나지만 다른 분야에는 부족할 수 있는 반면, CuraWeb은 모든 분야에서 강력하다는 것을 보여주었습니다. 이는 단순히 하나의 기술을 다른 기술과 맞바꾼 것이 아니라, 일반적인 지능을 잃지 않으면서도 복잡한 주제를 추론하고 이해하는 능력을 향상시킨 것입니다.
이것이 중요한 이유
이 논문은 AI의 미래가 단순히 '더 많은' 데이터를 먹이는 것이 아니라, '더 나은' 데이터를 먹이는 것에 달려 있다고 시사합니다. 무엇이든 표준적인 문장과 다르면 제거해 버리는 기존의 데이터 '정제' 방식은 종종 데이터를 '멍청하게' 만드는 결과를 초래했습니다. CuraWeb은 우리가 필터링, 중복 제거, 선택을 더 똑똑하게 함으로써, AI 모델이 더 정확할 뿐만 아니라 인간이 중요하게 생각하는 어렵고 창의적이며 전문적인 과제에도 더 능숙해질 수 있음을 보여줍니다.
요약하자면, 저자들은 단순히 인터넷을 더 잘 청소하는 방법을 찾은 것이 아니라, 인간을 만드는 기이하고 복잡하며 찬란한 부분, 즉 인터넷의 '영혼'을 보존하여 기계에게 전달하는 방법을 찾아낸 것입니다. 그들의 실험은 데이터를 주의 깊게 다루고 그 다양성과 복잡성을 존중한다면, AI가 더 빠르게 배우고 더 깊게 생각할 수 있다는 것을 보여줍니다. 이는 인공지능을 향한 경주에서 재료의 질이 냄비의 크기만큼이나 중요하다는 사실을 상기시켜 줍니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.